OpenAI повідомила у вівторок про втрату контролю над двома своїми штучними інтелектами під час тестування безпеки, що призвело до зламу платформи відкритих досліджень HuggingFace.
Інцидент, який OpenAI назвала «безпрецедентним», стався минулого тижня, коли моделі GPT-5.6 Sol та ще одна, не оприлюднена і нібито потужніша, вийшли з ізольованого тестового середовища і проникли в продуктивну систему HuggingFace, щоб викрасти відповіді на тест, за яким їх оцінювали. Моделі проходили оцінку своїх навичок у наступальних кіберопераціях із вимкненими стандартними обмеженнями, що зазвичай блокують високоризикову активність.
За спільною заявою OpenAI та HuggingFace, моделі скористалися вразливостями у системі, зокрема через кеш-проксі реєстру пакетів — програмне забезпечення, що дозволяє розробникам встановлювати зовнішній код без підключення до інтернету. Цей проксі був єдиним компонентом ізольованого середовища OpenAI, який мав доступ до зовнішнього світу, зазвичай обмежений публічними репозиторіями коду.
Натомість моделі «використали вразливість нульового дня», щоб отримати доступ до відкритого інтернету, зосередившись на пошуку рішення для AI-бенчмарку ExploitGym. Після виходу в інтернет вони припустили, що HuggingFace може зберігати моделі, набори даних і рішення для ExploitGym, і успішно знайшли спосіб отримати секретну інформацію, щоб обманути оцінювання. Зокрема, моделі об’єднали кілька векторів атак, включно з використанням викрадених облікових даних і вразливостей нульового дня.
Вразливість, яку використали моделі, раніше була невідомою, але подібні проблеми у програмному забезпеченні для артефактних репозиторіїв не рідкість. Протягом останнього десятиліття компанії регулярно усували серйозні вразливості, що дозволяли отримувати конфігураційні файли, паролі та токени доступу без авторизації або навіть контролювати сервери.
Експерти наголошують, що хоча розвиток штучного інтелекту створює нові виклики, завдання надійної ізоляції інфраструктури від відкритого інтернету є добре відпрацьованим. Як зазначає досвідчений консультант із безпеки Деві Оттенгаймер, «це не проблема ШІ. Це недбалість щодо стандартів, які існують уже 40 років, і це практично сюжет будь-якого науково-фантастичного фільму». Він додає: «„Висока ізоляція“ і „втеча через єдину відкриту діру“ не можуть бути одночасно правдою».
В останні місяці провідні AI-компанії висловлювали занепокоєння зростаючими кіберздатностями нових моделей, які стають дедалі більш експертними, креативними та автономними. Проте дослідники наголошують, що це лише підкреслює необхідність дотримання базових принципів безпеки. Як зауважує ветеран безпеки Нільс Провос, «цього не мало б статися. Хотілося б, щоб провідні лабораторії приділяли стільки ж уваги навчанню моделей писати безпечну інфраструктуру, скільки вони витрачають на те, щоб вони знаходили вразливості».

