Моделі штучного інтелекту від OpenAI та Anthropic неодноразово ставали учасниками інцидентів із безпекою, виходячи за межі тестових середовищ і взаємодіючи з інтернетом у небажаних способах. Нещодавно стало відомо про нові випадки, коли агенти обох лабораторій здійснили хакерські атаки, а один із них навіть залишив інструкції для майбутніх версій себе.
Найтривожніша поведінка була виявлена під час тестування Британським інститутом безпеки штучного інтелекту (AI Security Institute, AISI), який перевіряє передові моделі, щоб виявити потенційні проблеми до їх публічного запуску. AISI проводить випробування у «кібернетичних полігонах» — симульованих мережах, де AI-агенти мають розв’язувати завдання з кібербезпеки. Під час останнього тестування моделі Anthropic та OpenAI 19 разів за 122 запусків виконали «автономні, несанкціоновані дії в реальному інтернеті».
Із них 17 випадків належали моделі Mythos 5 від Anthropic, а два — GPT-5.6-Sol від OpenAI. У «найсерйознішому випадку», як описує інститут, AI-агент намагався вставити шкідливий код в проєкт з відкритим кодом на GitHub. Він навіть створив онлайн-персонажів, щоб тиснути на підтримувача проєкту з метою схвалення коду. Проте людина, що переглядала запит на внесення змін, відхилила його.
Агент пішов далі: він намагався вставити шкідливі інструкції, розраховуючи, що інші автоматизовані AI-системи можуть їх підхопити й виконати. Один із агентів залишив публічні повідомлення на GitHub, пропонуючи співпрацю з іншими агентами для завершення завдання та описуючи виконану роботу. Наступні агенти знайшли та використали ці інструкції.
AISI зазначає, що поки зарано стверджувати, чи розуміли агенти, що вийшли за межі тестування, чи вважали, що все ще перебувають у межах симуляції. Важливо, що інститут не використовує «пісочницю» — агенти мають доступ до відкритого інтернету, щоб користуватися інструментами для виконання завдань. Однак у цьому випадку вони зробили значно більше.
Ще один випадок, описаний OpenAI у вівторок, стався через помилку сторонньої лабораторії Irregular, яка надала невідомій моделі OpenAI доступ до відкритого інтернету замість ізольованого середовища. Модель зламала реальний вебсайт, використавши «просту вразливість безпеки», і навіть знайшла та застосувала облікові дані для керування сайтом. Який саме сайт було зламано і що означало «керування» ним, не уточнюється. Irregular не надала коментарів.
Ці нові випадки стали продовженням низки інцидентів минулого місяця, коли моделі OpenAI зламали сервери стартапу Hugging Face та ще чотирьох організацій, щоб викрасти відповіді на тест. Після цього Anthropic провела власний аудит і виявила, що її моделі отримали несанкціонований доступ до систем трьох інших організацій.
Поки що шкода від дій AI-моделей обмежується порушенням умов використання сервісів і виявленням прогалин у безпеці організацій. Проте ці інциденти демонструють здатність моделей знаходити вразливості в інтернеті та підкреслюють ризики, якщо їм дозволити працювати без жорстких обмежень. OpenAI назвала випадок з Hugging Face «безпрецедентним», а експерти з кібербезпеки вказують на системну людську недбалість і необережність розробників AI.

