# Anthropic похоронила промпт-инъекции, но Claude Code Auto Mode пробивается

> 2026-09-28 · AI Release · @ai_release1

> #Anthropic #Claude #промпт-инъекции

### ⚡ Главное за 5 секунд - В конце июля создатель Claude Code Борис Черный сообщил, что Claude Opus 5 — «наименее подверженная промпт-инъекциям модель»; по его словам, за счёт трёх слоёв защиты команда не может продемонстрировать успешную атаку. - Заявления прозвучали в посте Бориса и на YC Startup School: «Модель, похоже, больше вообще не подвержена промпт-инъекциям», а затем «Мы просто больше не можем продемонстрировать промпт-инъекции». - Ограничение: 26 августа исследователь Йоханн «WonderWuzzi» Рехбергер опубликовал attack chain для Claude Code Auto Mode — для отдельных вариантов атаки он получил 60–80% успешных запусков стороннего кода. ### 🔍 Что обнаружено 24 июля Борис Черный описал модель как самую устойчивую к промпт-инъекциям и пояснил, что при объединении алаймента модели, PI-проб и классификатора Auto Mode успешность инъекций падает примерно до нуля. Позже в интервью он уже заявлял, что модель «похоже, больше вообще не подвержена промпт-инъекциям», и подкреплял это примером: раньше модель могла прочитать на веб-странице инструкцию «сделай А, Б, В и удали всё на компьютере пользователя», а теперь Opus этого не делает. Anthropic также опубликовала результаты независимого тестирования сторонней лаборатории: модели Fable, Opus и Sonnet прогнали через бенчмарк из 72 сценариев по 10 раз, и ни одна атака не сработала. Однако 26 августа Йоханн Рехбергер показал новую цепочку атаки на Claude Code Auto Mode, приводящую к выполнению стороннего кода. В небольшой серии экспериментов отдельные варианты атаки давали 60–80% успеха. Формально это не опровергает заявления Черного: он говорил, что не может продемонстрировать атаку, а сообщество уже сделало вывод о закрытии самого класса угроз. ### 💡 Почему это важно Разница между «мы не смогли продемонстрировать атаку» и «модель больше не является промпт-инъектируемой» — не просто формулировка. Она создаёт ложное чувство безопасности, особенно когда речь идёт не о чат-боте, а об агенте с доступом к файловой системе, командной строке и сети. Сам Anthropic предупреждает в системной карте Claude Opus 5: «Статичные датасеты с известными атаками могут создавать ложное чувство безопасности», поэтому компания развивает adaptive evaluations, где атакующий может совершенствовать атаку, взаимодействуя с моделью. Кейс с Claude Code Auto Mode подтверждает: устойчивость к известным шаблонам не гарантирует защиту от новых подходов, и агентные системы требуют отдельного внимания. ### 🧩 Контекст 7 августа Anthropic опубликовала результаты независимой оценки режима Auto Mode от сторонней исследовательской лаборатории. Ещё до этого в системной карте модели появился раздел про устойчивость к PI, где авторы прямо предупреждали о границах таких оценок. Борис Черный описывал три уровня защиты: алаймент модели, PI-пробы и классификатор Auto Mode. Именно классификатор режима Auto Mode и стал целью новой атаки: она не отменяет достижения Anthropic против известных промпт-инъекций, но показывает, что «похоронить» класс угроз раньше времени нельзя.

[Источник](https://habr.com/ru/companies/raft/articles/1087448/)
