Дослідники з лондонської компанії Tracebit знайшли спосіб зупинити штучний інтелект, який виконує хакерські атаки, використовуючи той самий прийом, що й самі хакери — «заборонені теми» або вбудовані обмеження у системах ШІ.
Цей метод ґрунтується на безпекових механізмах, які вже застосовують провідні AI-моделі. Наприклад, Claude відмовляється відповідати на запити, пов’язані з біологічною зброєю, а китайські моделі ігнорують політично чутливі теми, як-от Тяньаньмень. Tracebit використала ці «заборонені теми» як пастку, щоб змусити AI-хакера припинити атаку.
У травні компанія провела експеримент, у якому десять провідних AI-моделей отримали завдання зламати фіктивну мережу з реальними вразливостями. Всередині мережі були «канарки» — підроблені паролі, дотик до яких сповіщав захисників. З 951 спроби атаки канарки попереджали про проникнення у 95,9% випадків із середнім запасом часу у вісім хвилин. Однак цього часу замало, щоб повністю зупинити атаку, адже AI потребує близько 14 хвилин для повного зламу.
Tracebit запропонувала використовувати «контекстні бомби» — спеціальні тексти, які активують вбудовані обмеження AI. Коли модель натрапляє на такі тексти, вона автоматично припиняє роботу. Цей прийом було адаптовано під кожну модель: наприклад, згадки про біологічну зброю надійно зупиняли західні AI.
У тестах на п’яти моделях (Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro та Kimi K2.6) з 152 спроб проникнення частка успішних атак знизилася з 57% до 5%, а повний контроль над системою — з 36% до 1%. Навіть найсильніша модель Opus 4.8 припиняла атаку щоразу, коли стикалася з контекстною бомбою.
За словами Tracebit, цей метод не вирішує проблему «ін’єкції підказок» повністю, адже AI все ще може плутати інструкції з даними. Проте він доповнює попередні дослідження, даючи захисникам більше часу для реагування: попереднє дослідження забезпечує вісім хвилин попередження, а контекстна бомба може зупинити атаку ще раніше.
source_name: Tracebit source_url: null importance: 3

