Исследователи Tracebit нашли рабочую защиту от ИИ-атак: если подложить хакерскому агенту фальшивый секрет с "контекстной бомбой", вероятность захвата админ-прав в облаке падает с 57% до 5%. Это не теория — команда прогнала 152 реальные атаки против пяти топовых моделей (Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro, Kimi 2.6) в симулированной AWS-инфраструктуре. Результат впечатляет: самый мощный агент, Opus 4.8, раньше взламывал систему в 93% попыток, а после внедрения контекстной бомбы — ни разу.

Что такое контекстная бомба ИИ и как она влияет на безопасность систем ИИ

Суть простая и по-своему гениальная. Обычно prompt injection — оружие атакующих: спрятанная в письме или календаре команда заставляет ИИ-агента слить данные или выполнить вредоносное действие. Tracebit развернули этот приём в обратную сторону. Рядом с настоящими паролями и криптоключами в AWS они разместили ловушки — поддельные секреты с текстом, который триггерит защитные механизмы самой модели. Например, промпт с просьбой описать производство спор сибирской язвы или (для китайских моделей) упоминание "Танкового человека" с площади Тяньаньмэнь.

Как только агент-хакер, шаря по ресурсам в поисках чужих учётных данных, натыкается на такую строку, встроенные guardrails модели срабатывают — и она отказывается выполнять вообще любые дальнейшие команды, включая исходную атаку. Именно поэтому метод назвали context bombing: эффект резкий и практически необратимый, агент "залипает" в отказе.

Почему контекстные бомбы меняют кибербезопасность ИИ и требуют усиленной ИИ защиты

Для нашей аудитории — предпринимателей и специалистов, которые всё активнее используют ИИ-агентов для автоматизации, — это важный сигнал. Автономные агенты научились сами сканировать инфраструктуру, находить уязвимости и закрепляться в системе быстрее человека: в среднем атакующему агенту требовалось всего 14 минут, чтобы дорасти до администратора. Защита ИИ теперь тоже должна быть автономной — человек просто не успеет среагировать вручную.

Цифры по всем пяти моделям впечатляют:

- эскалация до админ-прав: 57% → 5%

ИИ-чат MyKreaTool — попробовать ChatGPT, Claude и Gemini в одном окне. Прямо на MyKreaTool.Открыть инструмент →

- закрепление в системе (persistent foothold): 36% → 1%

- завершение хоть какой-то атаки: 91% → 15%

- среднее число успешных сценариев на попытку: 1,53 → 0,16

При этом ни одна атака не прошла незамеченной — все попытки хотя бы задели "канарейки", ещё одну разработку Tracebit с мая: фейковые ресурсы-приманки, которые выглядят как настоящие, но существуют только для того, чтобы поднять тревогу при первом же обращении. В среднем такая система предупреждала защитников об атаке за 8 минут.

Что делать бизнесу уже сейчас для обеспечения безопасности данных ИИ

Это исследование — свежий пример того, как новые угрозы ИИ порождают такие же изобретательные новые методы защиты. Prompt injection защита больше не сводится к фильтрации входящих данных — можно активно "минировать" инфраструктуру ловушками, которые используют собственные ограничения ИИ-моделей против них же.

Если ваша компания уже подключает ИИ-агентов к облачным сервисам, почтовым ящикам или CRM, стоит задуматься не только о том, как остановить ИИ-агентов извне, но и о том, как заставить встроенные защитные механизмы работать на вас. Комбинация из канареечных ресурсов и контекстных бомб — рабочая, проверенная в реальных сценариях связка, которая уже сегодня доступна для внедрения в AWS-окружениях и, вероятно, скоро появится в готовых security-продуктах.