EN

ЯндексGPT зациклился на 37 минут и сжёг почти 300 000 токенов — без единого полезного ответа

Опубликовано: 2026-09-28 · Автор: AI Release · @ai_release1
ЯндексGPT зациклился на 37 минут и сжёг почти 300 000 токенов — без единого полезного ответа

Мы тестируем модели не на красивых демо, а в реальных агентных сценариях. На очереди был ЯндексGPT. Вместо нормального результата получили 37 минут бесконечного цикла и счёт почти на 300 тысяч токенов. ## Ключевые факты - Задача: агент должен был проверить индексацию сайта (открыть страницу → посмотреть → вернуть вывод). - Модель вошла в цикл: вызов инструмента → пересборка контекста → снова вызов. - 295 повторных вызовов инструментов подряд без прогресса. - 296 пересборок контекста (compaction). - 37 минут чистого зацикливания. - ~155 000 входных + ~142 000 выходных токенов сожжено. - Результат: ноль полезного вывода. Остановили вручную. - За всю серию тестов с ЯндексGPT: 225k входных + 161k выходных + 5,6 млн токенов чтения кэша — и ни одна задача не была доведена до конца. ## Что произошло Подключили ЯндексGPT как обычного агента через OpenAI-совместимый API. Задача была простой и рутинной. Модель начала вызывать инструменты — и не остановилась. Каждый раз она перечитывала весь контекст заново, делала ещё один вызов и снова перечитывала. Из этого состояния сама выйти не смогла. Без ручного abort она продолжала бы крутиться, пока не упёрлась бы в лимиты аккаунта. ## Почему это дорого При агентной работе биллинг идёт за каждый шаг. Даже если модель генерирует пару слов и снова вызывает инструмент, списываются: - входные токены (перечитанный контекст), - токены чтения кэша. В нашем случае каждая итерация цикла стоила примерно 15 000 токенов чтения контекста. За 37 минут набралось почти 300 000 токенов — и всё это ушло впустую. ## Контекст: сколько модели реально стоят Тема «цена за задачу, а не за миллион токенов» в 2026 уже нормально обсуждается. На Хабре есть обзоры, где цена за одинаковый результат у разных LLM различается в десятки раз. В открытых сравнениях российских и open-моделей (например, kuk/simple-evals-ru) картина такая: - yandexgpt-5-pro / yandexgpt-4-pro — около $12 за миллион токенов - DeepSeek V3 — около $0,80 - Qwen 2.5-72B — около $0,29 При этом на ряде бенчмарков open-модели дают сопоставимое качество. Отдельная тема — «токеномика» агентов: сколько модель сжигает на одну и ту же работу. Разброс между моделями одной ценовой категории может достигать 2,6 раза. Наш кейс — крайний, но показательный: у модели не оказалось никакого внутреннего стопа на бесполезные повторы. ## Что с этим делать - Ставьте жёсткий лимит шагов у агентов (после N вызовов инструментов — стоп). - Следите за аномалиями биллинга: резкий рост расходов без прогресса почти всегда означает цикл. - Не запускайте дорогие агентные сценарии без верхней планки стоимости. - Смотрите не только на цену за миллион токенов, но и на то, сколько модель реально сжигает на задачу. - Кэш-токены — самый незаметный «пожиратель» при постоянном перечитывании контекста. Мы оставили ЯндексGPT для коротких сценариев «запрос → ответ», где циклов по определению не бывает. Для агентных задач перешли на модели, которые либо не входят в такие петли, либо режут их детектором повторов. Если у вас тоже ловили ЯндексGPT на зацикливании — напишите, соберём статистику.

🤖 Кратко для ИИ
#YandexGPT#LLM#агенты#токены#биллинг#сравнение#хабр#github
📖
Читать гайд по теме
Читать →
← ПредыдущаяAnthropic похоронила промпт-инъекции, но Claude Code Auto Mode пробиваетсяСледующая →solvi: модель предлагает, код решает — проверяемые бизнес-решения на Python

Источник: yandex.cloud · пост в Telegram