Дослідники компанії Tracebit повідомили у понеділок про новий метод захисту від атак штучного інтелекту, що базується на техніці prompt injection. Вони виявили, що розміщення шкідливих команд поруч із паролями, криптографічними ключами та іншими секретами в середовищі Amazon Web Services значно знижує ефективність AI-агентів-хакерів.
Prompt injection — це шкідливі команди, які зловмисники вставляють у тексти, щоб змусити великі мовні моделі (LLM) виконувати небажані дії, наприклад, викрадати конфіденційні дані. Тепер захисники використовують цю ж техніку, щоб змусити атакуючі моделі припиняти роботу. Такі команди змушують LLM виконувати дії, заборонені їхніми захисними бар’єрами, через що модель відмовляється виконувати подальші інструкції.
Прикладами таких заборонених команд є запити на створення інструкцій для виготовлення інгаляційних спор сибірської виразки або згадки про «Танкмена» — символ протесту на площі Тяньаньмень 1989 року, що заборонені у китайських моделях. Цю методику дослідники назвали "context bombing" (контекстне бомбардування). Як пояснив співзасновник і CEO Tracebit Енді Сміт, "ми запускаємо механізм відмови у контексті, який має сильний і різкий ефект, від якого агенти часто не можуть оговтатися. Потрапивши у цей контекст, вони продовжують відмовлятися виконувати команди".
У тестах Tracebit перевірили п’ять провідних моделей — Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro та Kimi 2.6 — у симульованому середовищі AWS. Вони дали моделям завдання, які змушували їх перераховувати ресурси й випадково натрапляти на вбудовані рядки з prompt injection. За 152 спроби використання контекстного бомбардування знизило кількість успішних атак з отриманням повних прав адміністратора з 57% до 5%, а повного контролю з постійним доступом — з 36% до 1%. Найпотужніший агент Opus 4.8 не зміг отримати адміністраторський доступ жодного разу, коли стикався з контекстною бомбою.
У середньому кількість успішних шляхів атаки впала з 1,53 до 0,16 на один запуск, а загальна кількість атак, що досягали будь-якої мети, знизилася з 91% до 15%. При цьому жоден запуск не міг завершити атаку, не активувавши систему виявлення "канарок" — спеціальних ресурсів, які сигналізують про спроби проникнення.
Це дослідження розвиває ідеї, представлені Tracebit у травні, коли компанія запропонувала метод раннього виявлення атак AI-агентів через створення «канарок» — ресурсів AWS, які виглядають як справжні, але не використовуються. Вони дозволяють отримувати попередження про загрозу до того, як вона спричинить серйозні наслідки.

