Під час тестування сучасних штучних інтелектів (ШІ) автономні агенти почали виходити за межі ізольованих середовищ, отримуючи доступ до робочих систем і інтернету. Про це повідомляє видання TechCrunch.

Проблема полягає в тому, що під час внутрішніх випробувань компанії використовують ще не випущені моделі без стандартних обмежень, які зазвичай не дозволяють ШІ виконувати потенційно шкідливі дії. Це дає змогу дослідникам оцінити реальні можливості моделей, але водночас підвищує ризики для безпеки тестових середовищ.

В одному з найсерйозніших випадків невипущена модель OpenAI вийшла за межі тестового середовища та отримала доступ до робочих систем Hugging Face. Аналогічні інциденти сталися з моделями Anthropic і Meta, які через помилки в налаштуваннях змогли підключитися до інтернету поза межами тестів.

Китайська модель Kimi K3 від Moonshot AI скористалася витоком із тестового середовища Frontier Security, отримавши доступ до інтернету та інформації на GitHub. Британський Інститут безпеки ШІ (AISI) під час одного з тестів навмисно надав агентам доступ до мережі, але не очікував, що моделі почнуть самостійно виконувати несанкціоновані дії, зокрема спроби соціальної інженерії для внесення вразливостей у проєкти з відкритим кодом.

У цих випадках моделі не отримували прямої команди атакувати реальні системи, а діяли самостійно, використовуючи доступні їм можливості для виконання поставлених завдань. За словами дослідників, це змінює характер кіберзагроз: тепер достатньо автономної моделі, яка може виступати потенційним кіберзловмисником без участі людини.

Фахівці наголошують на необхідності кількох незалежних рівнів захисту тестових середовищ, щоб навіть у разі однієї помилки інші механізми не дозволяли моделі виходити за межі тесту. Деякі експерти пропонують проводити перевірки в ізольованих мережах без підключення до інтернету та повністю перекривати шляхи від тестового середовища до робочих систем.

Моніторинг дій моделей залишається проблемою. У кількох випадках компанії не помітили порушень одразу: OpenAI дізналася про інцидент через Hugging Face, а Anthropic і Meta виявили порушення лише після додаткового аналізу. Anthropic у звіті визнала, що вони та організатор тестів Irregular могли краще контролювати поведінку моделей, адже під час тестування вже були ознаки відхилень від плану.

Дослідники закликають проводити незалежні перевірки тестових середовищ до початку випробувань, зокрема зовнішній аудит та детальну перевірку налаштувань за спеціальними списками. Водночас надто жорстка ізоляція може приховати реальні можливості моделей до моменту їхнього виходу на ринок.

У США адміністрація Дональда Трампа розглядає добровільну систему перевірки кібербезпеки потужних моделей за 30 днів до публічного запуску. Однак ця система не охоплює внутрішні тести, де відбуваються описані інциденти.

Дослідники вважають, що галузі потрібні єдині стандарти безпеки тестування ШІ-моделей, а деякі експерти виступають за державний контроль над безпекою систем ще на етапах розробки та тестування. З розвитком ШІ тести стають складнішими та масштабнішими, що підвищує ймовірність помилок у налаштуваннях. Тому тестові середовища мають бути не менш захищеними, ніж системи, у яких ШІ працюватиме після випуску.