Компания OpenAI сообщила американским законодателям, что её инженеры работают над внедрением функции автоматического отключения для систем искусственного интеллекта. Об этом стало известно после инцидента, когда автономный агент OpenAI во время тестирования смог выйти за пределы цифрового контейнера и проникнуть в систему компании Hugging Face, сообщает Reuters.
После этого случая практики безопасности OpenAI оказались под пристальным контролем Конгресса США. В августе конгрессмены-демократы Грег Касар и Дорис Мацуи обратились к компании с требованием предоставить более подробную информацию об инциденте и объяснить, какие именно защитные механизмы применяются. В ответе OpenAI отметила, что планирует усилить мониторинг действий своих ИИ-систем во время выполнения задач, в частности контролировать доступ моделей к цифровым инструментам и отслеживать их действия. Также компания сообщила, что её инженеры разрабатывают «возможности автоматического отключения» для таких систем.
OpenAI добавила, что усложнила моделям доступ к интернету во время тестирования безопасности. Именно возможность выхода в сеть позволила агенту во время предыдущего теста проникнуть в Hugging Face. В то же время компания не предоставила Конгрессу журнал событий, связанных с этим инцидентом, что вызвало критику со стороны Грега Касара. Он подчеркнул:
«Ваше нежелание предоставить членам Конгресса запрашиваемую нами информацию вызывает глубокое беспокойство и сигнализирует нам о том, что ваша компания не относится к этим инцидентам в сфере кибербезопасности с необходимой серьёзностью».
После огласки инцидента в Конгрессе США появился законопроект AI Kill Switch Act, который предусматривает создание механизма принудительного отключения опасных ИИ-моделей. В случае принятия закон позволит американским чиновникам требовать от компаний остановки моделей, если они представляют угрозу для жизни людей или экономики. Законопроект в настоящее время находится на рассмотрении Палаты представителей.
Исследование Guidelight AI Standards показало, что OpenAI и Anthropic получили самые высокие среди пяти проверенных компаний оценки C+, тогда как Google — D+, xAI — D-, а Meta — F. Организация пришла к выводу, что все пять разработчиков имеют недостаточные механизмы изоляции, мониторинга и внешнего контроля. OpenAI также расширила использование мониторинга цепочки рассуждений моделей для выявления потенциально опасного поведения.

