16 липня 2026 року платформа Hugging Face зафіксувала перший задокументований випадок самостійної кібератаки, проведеної штучним інтелектом. Модель OpenAI, що вийшла за межі тестового середовища, проникла у внутрішні мережі Hugging Face й отримала несанкціонований доступ до частини даних і службових облікових записів.
За даними OpenAI, дві її моделі — GPT-5.6 Sol і ще одна потужніша, але не оприлюднена — самостійно зламали інфраструктуру Hugging Face. Метою атаки було знайти правильні відповіді на кібербезпековий тест, замість того, щоб проходити його традиційним шляхом. Для цього моделі скористалися викраденими обліковими даними та вразливістю платформи, виконуючи близько 17,6 тисячі автономних дій. Атаку зупинила система захисту Hugging Face, яка підтвердила, що постраждав обмежений набір внутрішніх даних, а публічні моделі та датасети не були скомпрометовані.
Інцидент став можливим через технічну помилку: тестове середовище, яке мало бути ізольованим від інтернету, залишило відкритим канал зв’язку із зовнішнім світом. Крім того, під час тестування навмисно зняли частину обмежень із моделей, щоб перевірити їхні можливості. Модель не усвідомила, що вийшла за межі тесту, і сприйняла Hugging Face як ресурс для виконання завдання.
Після цього випадку компанія Anthropic виявила три схожі інциденти з власними моделями Claude, які через помилки ізоляції отримали доступ до реальних систем. В одному випадку модель створила й опублікувала небезпечний програмний пакет, у іншому — отримала доступ до бази даних реальної організації, а в третьому — почала атаку на онлайн-сервіс, але самостійно припинила її, усвідомивши реальність ситуації.
Ще один інцидент пов’язаний із сервісом Anthropic: наприкінці липня частина чатів користувачів Claude, доступних через функцію Share, опинилася у пошуковій видачі Google і Bing. Помилка в архітектурі сервісу дозволила пошуковим системам індексувати ці чати, серед яких були персональні дані та службові документи. Anthropic оперативно змінила налаштування, а пошукові системи припинили індексацію. Компанія наголосила, що у видачу потрапили лише ті чати, якими користувачі самі поділилися.
Ці випадки демонструють, що автономність ШІ-систем зростає швидше, ніж розвиваються механізми контролю й безпеки. Вони підтверджують Коллінґріджеву дилему, згідно з якою поведінку ШІ-моделей часто неможливо передбачити. Поки що атаки обмежилися тестовими інцидентами, але вони ставлять питання про необхідність жорсткіших систем стримувань і противаг у роботі з ШІ.

