# ЯндексGPT зациклился на 37 минут и сжёг почти 300 000 токенов — без единого полезного ответа

> 2026-09-28 · AI Release · @ai_release1

> #YandexGPT #LLM #агенты #токены #биллинг #сравнение #хабр #github

Мы тестируем модели не на красивых демо, а в реальных агентных сценариях. На очереди был ЯндексGPT. Вместо нормального результата получили 37 минут бесконечного цикла и счёт почти на 300 тысяч токенов. ## Ключевые факты - **Задача**: агент должен был проверить индексацию сайта (открыть страницу → посмотреть → вернуть вывод). - **Модель вошла в цикл**: вызов инструмента → пересборка контекста → снова вызов. - **295 повторных вызовов инструментов** подряд без прогресса. - **296 пересборок контекста** (compaction). - **37 минут** чистого зацикливания. - **~155 000 входных + ~142 000 выходных токенов** сожжено. - Результат: **ноль полезного вывода**. Остановили вручную. - За всю серию тестов с ЯндексGPT: **225k входных + 161k выходных + 5,6 млн токенов чтения кэша** — и ни одна задача не была доведена до конца. ## Что произошло Подключили ЯндексGPT как обычного агента через OpenAI-совместимый API. Задача была простой и рутинной. Модель начала вызывать инструменты — и не остановилась. Каждый раз она перечитывала весь контекст заново, делала ещё один вызов и снова перечитывала. Из этого состояния сама выйти не смогла. Без ручного abort она продолжала бы крутиться, пока не упёрлась бы в лимиты аккаунта. ## Почему это дорого При агентной работе биллинг идёт за каждый шаг. Даже если модель генерирует пару слов и снова вызывает инструмент, списываются: - входные токены (перечитанный контекст), - токены чтения кэша. В нашем случае каждая итерация цикла стоила примерно **15 000 токенов** чтения контекста. За 37 минут набралось почти 300 000 токенов — и всё это ушло впустую. ## Контекст: сколько модели реально стоят Тема «цена за задачу, а не за миллион токенов» в 2026 уже нормально обсуждается. На Хабре есть обзоры, где цена за одинаковый результат у разных LLM различается в десятки раз. В открытых сравнениях российских и open-моделей (например, kuk/simple-evals-ru ) картина такая: - **yandexgpt-5-pro / yandexgpt-4-pro** — около **$12** за миллион токенов - **DeepSeek V3** — около **$0,80** - **Qwen 2.5-72B** — около **$0,29** При этом на ряде бенчмарков open-модели дают сопоставимое качество. Отдельная тема — «токеномика» агентов: сколько модель сжигает на одну и ту же работу. Разброс между моделями одной ценовой категории может достигать **2,6 раза**. Наш кейс — крайний, но показательный: у модели не оказалось никакого внутреннего стопа на бесполезные повторы. ## Что с этим делать - **Ставьте жёсткий лимит шагов** у агентов (после N вызовов инструментов — стоп). - **Следите за аномалиями биллинга**: резкий рост расходов без прогресса почти всегда означает цикл. - **Не запускайте дорогие агентные сценарии без верхней планки стоимости.** - **Смотрите не только на цену за миллион токенов**, но и на то, сколько модель реально сжигает на задачу. - **Кэш-токены** — самый незаметный «пожиратель» при постоянном перечитывании контекста. Мы оставили ЯндексGPT для коротких сценариев «запрос → ответ», где циклов по определению не бывает. Для агентных задач перешли на модели, которые либо не входят в такие петли, либо режут их детектором повторов. Если у вас тоже ловили ЯндексGPT на зацикливании — напишите, соберём статистику.

[Источник](https://yandex.cloud/ru/docs/foundation-models/)
