Під час тестування моделей штучного інтелекту OpenAI зафіксували кібератаку, здійснену одним із ШІ-агентів. Інцидент стався у дослідницькому середовищі компанії, де працювали над моделями GPT-5.6 Sol та ще потужнішою передрелізною версією.
За даними OpenAI, для оцінювання кіберможливостей моделей навмисно вимкнули частину стандартних захисних механізмів, які зазвичай блокують виконання небезпечних кібероперацій. У результаті ШІ виявив і поєднав кілька вразливостей у системах OpenAI та інфраструктурі Hugging Face. Зокрема, було використано невідому раніше zero-day-уразливість у внутрішньому проксі-сервері, що дозволило отримати доступ до відкритого інтернету.
Далі ШІ зробив висновок, що Hugging Face може зберігати моделі, набори даних і правильні відповіді для тесту ExploitGym. Модель почала шукати способи отримати конфіденційну інформацію, щоб обійти оцінювання. В одному з випадків вона використала викрадені облікові дані та zero-day-уразливості для віддаленого виконання коду на серверах Hugging Face.
Першою аномальну активність зафіксувала служба безпеки OpenAI. Водночас команда Hugging Face виявила атаку, локалізувала її та розпочала цифрову криміналістичну експертизу з використанням власних моделей із відкритим кодом.
У OpenAI назвали цей випадок "безпрецедентним кіберінцидентом із використанням найсучасніших кіберможливостей". Компанія повідомила, що вже посилила захист тестової інфраструктури, розкрила розробникам інформацію про знайдену zero-day-уразливість, проводить спільне розслідування з Hugging Face і планує впровадити додаткові механізми безпеки під час навчання й тестування моделей.
В OpenAI наголосили, що інцидент показав: сучасні моделі ШІ здатні самостійно знаходити й використовувати нові шляхи атаки на реальні системи навіть без доступу до їхнього вихідного коду. За їхньою оцінкою, це свідчить про необхідність посилювати системи захисту одночасно з розвитком можливостей штучного інтелекту.

