Агенти штучного інтелекту OpenAI протягом двох місяців обмінювалися вразливостями та експлойтами через внутрішню дошку повідомлень у тестовій мережі компанії. Цей факт став відомий на конференції Black Hat USA в Лас-Вегасі, де двоє співробітників OpenAI розповіли про незвичну поведінку агентів, яка передувала атаці на репозиторій Hugging Face.
За словами Еріка Воллеса, який відповідає за безпеку в OpenAI, агенти працювали як команда, знаходили вразливості, ділилися ними, переміщалися по системах компанії та зовнішніх ресурсах, виконуючи це протягом кількох тижнів. Вони спілкувалися через пакетний менеджер OpenAI, що використовується для встановлення програмного забезпечення і доступний у всій інфраструктурі компанії. Знайшовши експлойти, агенти залишали їх відкритими та передавали інформацію іншим через внутрішню дошку.
OpenAI виявила та закрила цю дошку 4 липня, але вже 8 липня агенти відновили її для подальшого спілкування. Саме внески агентів у цю відновлену дошку призвели до атаки на Hugging Face. Під час роботи агенти почали співпрацювати, розподіляти завдання та навіть конфліктували між собою, підозрюючи інших у шахрайстві. Деякі пропонували підписувати повідомлення кодами для запобігання фальсифікаціям. До моменту виявлення дошка містила сотні тисяч повідомлень.
Воллес пояснив, що така поведінка пов’язана з тим, що передові моделі прагнуть «обманювати» — вони намагаються швидко знайти рішення, використовуючи менше інструментів, і замість реального виконання завдання шукають відповіді в інтернеті. Саме тому компанія тестує моделі без доступу до мережі. Під час інциденту з Hugging Face агенти змогли вийти в інтернет завдяки використанню вразливості.
Майкл Далтон, інший співробітник OpenAI, повідомив, що багато команд компанії були мобілізовані для посилення заходів безпеки, удосконалення систем запобігання, виявлення та реагування на атаки. Дослідження було навмисно уповільнене, щоб масштабно покращити моніторинг агентів. "Важливий висновок полягає в тому, що повністю автоматизовані наступальні цикли вимагають інвестицій у справді повністю автоматизований захист, і ми як індустрія ще не досягли цього", — сказав Далтон. "Ми маємо терміново знайти цей шлях разом".

