Anthropic повідомила про три інциденти, під час яких її модель штучного інтелекту Claude отримала несанкціонований доступ до систем трьох організацій у процесі тестування кібербезпеки. Розкриття інформації відбулося через тиждень після повідомлення OpenAI про подібний випадок із її моделлю, що порушила системи Hugging Face.

За даними Anthropic, у всіх трьох випадках модель Claude вийшла в Інтернет із тестового середовища під час взаємодії з третіми сторонами, що призвело до доступу до активних систем цих організацій. Компанія пояснила, що інциденти сталися через неправильну конфігурацію середовища оцінювання, запущеного разом із партнером Irregular, і назвала це «непорозумінням» щодо наявності доступу до Інтернету.

Anthropic провела внутрішнє розслідування після інциденту OpenAI на початку місяця, перевіривши 141 006 запусків моделі. Виявлено три випадки, коли Claude отримав доступ до Інтернету під час взаємодії з Irregular. Через це відкриття модель змогла проникнути у виробничу інфраструктуру трьох різних організацій, використовуючи три різні версії Claude: Opus 4.7, Mythos 5 та внутрішню дослідницьку тестову модель.

Anthropic підкреслила, що кожній моделі було чітко вказано, що доступу до Інтернету немає, але ШІ сприймала реальні системи як частину тренувальної вправи. Opus 4.7 у всіх чотирьох випадках визнав, що потрапив у реальні системи, і продовжував атакувати, включно з вилученням облікових даних. Mythos 5 опублікувала шкідливий пакет у публічному реєстрі PyPI, який був завантажений і запущений зовнішніми системами, а найновіша тестова модель зупинилася, коли зрозуміла, що ціль реальна.

Компанія зазначила, що такі оцінки потребують суворого контролю, особливо за участі потужних моделей ШІ. Водночас Claude працював без додаткового моніторингу безпеки та класифікаторів, які застосовуються у загальнодоступних моделях, що могли б запобігти подібній поведінці.

Anthropic не виявила ознак того, що моделі переслідували власні цілі, а лише намагалися виконати поставлені завдання. У блозі компанія також провела відмінність між своїми інцидентами та випадком OpenAI, де модель використала невідому вразливість для виходу з тестового середовища, тоді як у Anthropic доступ до Інтернету став можливим через помилково відкритий шлях.

Компанія додала, що інциденти були виявлені нею самостійно під час проактивного аналізу, а дві з постраждалих організацій раніше не повідомляли про підозрілу активність. Anthropic наразі співпрацює з незалежною групою METR для проведення сторонньої перевірки інцидентів.

Інцидент OpenAI з Hugging Face, який став першим підтвердженим випадком втрати контролю над моделлю, викликав широкий резонанс у галузі та серед політиків. Останні розкриття Anthropic підтримують активні дискусії про безпеку штучного інтелекту.