Методология AI Evals: как находить скрытые ошибки моделей с Claude Code
Эксперты Шрея Шанкар и Хамель Хусейн предложили методику поиска скрытых ошибок в ИИ-агентах для Claude Code: сопоставление черновых ответов с правками человека на небольших выборках вскрывает смысловые сбои, а плагин Error Discovery помогает кластеризовать дефекты и настроить изолированных тестовых агентов.
