Оценка AI-агентов: 7 ошибок, из-за которых тесты врут
Опубликовано: 2026-09-25 · Автор: AI Release · @ai_release1
⚡ Главное за 5 секунд - Суть: зелёный статус eval-тестов не гарантирует правильной работы AI-агента; проверка только финального ответа пропускает невыполненные действия. - Где доступно: статья Сергея Прощаева опубликована на Хабре в блоге компании OTUS. - Ограничение: eval-тесты создают ложное чувство надёжности; для реальной оценки нужно проверять состояние системы и промежуточные шаги. ### 🔍 Что обнаружено В статье «Оценка AI‑агентов: 7 ошибок, из‑за которых тесты врут» Сергей Прощаев, Tech Lead направления Java|Kotlin в FinTech & E-commerce и преподаватель OTUS, разбирает типичные провалы в eval-обвязке. Он приводит показательный пример: у команды есть eval-набор из 40 задач, прогон в CI держит около 90% успеха, но через две недели саппорт приносит переписку, где агент отрапортовал «заявка оформлена», а в базе по заявке пусто. Тесты не сломаны — они просто измеряют не то. Первая ошибка — успех считают по финальному тексту, а не по состоянию системы. Модель может безупречно описать результат, которого не было. В τ-bench от Sierra основной критерий — соответствие конечного состояния базы целевому, и в исходном эксперименте GPT-4o в такой конфигурации решал меньше половины задач. Вторая ошибка — набор тестов состоит из одних happy path; прод подсовывает враждебные сценарии: prompt-инъекции, джейлбрейки, устаревшие данные, структурно валидные, но семантически неверные ответы инструментов. Отдельно автор выделяет повторы: таймаут не равен неуспеху, и при неидемпотентном инструменте аккуратный агент может провести списание дважды. ### 💡 Почему это важно Оценка агента — не одна цифра, а несколько ортогональных измерений. Правильное конечное состояние ещё не означает правильный процесс: агент может отменить заказ, но не проверить права. Практическая польза: проверять переход состояния, а не его наличие, сверять логи и промежуточные шаги, добавлять в eval-набор минимум одну поломку на каждую happy-path задачу. Это единственный способ увидеть, что агент действительно делает то, что нужно. ### 🧩 Контекст Несколько месяцев назад автор уже разбирал шесть архитектурных ошибок, из-за которых агенты не доживают до запуска — та статья была про то, как агент устроен. Эта статья — про соседний слой: как понять, что агент действительно работает. В конце материала Сергей обещает сводную таблицу, чек-лист и вывод о том, какой навык группа граблей на самом деле проверяет.
⚡ Главное за 5 секунд - Суть: зелёный статус eval-тестов не гарантирует правильной работы AI-агента; проверка только финального ответа пропускает невыполненные действия.
- Где доступно: статья Сергея Прощаева опубликована на Хабре в блоге компании OTUS.
- Ограничение: eval-тесты создают ложное чувство надёжности; для реальной оценки нужно проверять состояние системы и промежуточные шаги.
🔍 Что обнаружено В статье «Оценка AI‑агентов: 7 ошибок, из‑за которых тесты врут» Сергей Прощаев, Tech Lead направления Java|Kotlin в FinTech & E-commerce и преподаватель OTUS, разбирает типичные провалы в eval-обвязке.
Он приводит показательный пример: у команды есть eval-набор из 40 задач, прогон в CI держит около 90% успеха, но через две недели саппорт приносит переписку, где агент отрапортовал «заявка оформлена», а в базе по заявке пусто.
Тесты не сломаны — они просто измеряют не то.
Первая ошибка — успех считают по финальному тексту, а не по состоянию системы.
Модель может безупречно описать результат, которого не было.