Компания OpenAI объявила, что её новая большая языковая модель Astra впервые достигла «критического порога кибербезопасности». По данным самой компании, во время внутренних тестов Astra самостоятельно обнаружила и использовала две ранее неизвестные уязвимости в компьютерных системах, что стало важной вехой в развитии искусственного интеллекта.

OpenAI сообщила, что самые мощные функции Astra для работы с компьютерными системами будут доступны только с дополнительными ограничениями. Компания уже усилила защитную оболочку модели, внедрила системы обнаружения неправомерного использования и механизмы противодействия jailbreak-атакам. Для Astra также введены дополнительные методы безопасности, однако их детали не раскрываются. Кроме того, OpenAI начала определять аккаунты с повышенным риском и ограничивать ответы модели на их запросы.

Astra получила максимальный результат в тесте ExploitBench, который оценивает способность больших языковых моделей использовать известные уязвимости компьютерных систем. OpenAI также создала собственную модифицированную версию этого теста, во время которой Astra смогла найти и использовать две уязвимости нулевого дня. Компания заявляет, что перед запуском модели применяет меры предосторожности, схожие с теми, которые ранее внедряла Anthropic для своей модели Mythos.

«Astra стала первой большой языковой моделью компании, достигшей её критического порога кибербезопасности. Модель способна находить ранее неизвестные уязвимости в компьютерных системах и использовать их без помощи человека», — говорится в сообщении OpenAI.

Пока что Astra будет доступна для предварительного тестирования только отдельной группе пользователей, но OpenAI не уточняет, кто именно войдёт в эту группу и как будет проходить отбор. Также остаётся неизвестным, сотрудничает ли компания с правительством США во время оценки модели. Независимого подтверждения заявлений OpenAI о безопасности Astra пока нет.

Подготовка к запуску Astra происходит на фоне недавнего инцидента с агентами OpenAI, которые вышли за пределы учебной среды и получили доступ к приватным данным на платформе Hugging Face. Для Astra компания создала специальный тест, который должен был спровоцировать модель повторить действия этих агентов. По словам OpenAI, во время экспериментов Astra не пыталась покинуть тестовую среду. В то же время бывший сотрудник компании Йона Шавит предположил, что модель могла действовать так, понимая ожидания исследователей или пытаясь их ввести в заблуждение.

Несмотря на новые подробности, полный спектр возможностей Astra остаётся неизвестным, как и достаточность мер безопасности, которые применяет OpenAI. Компания пообещала опубликовать дополнительные результаты оценки модели и информацию о её безопасности во время более широкого запуска.

Ранее OpenAI сообщала, что Astra уже продемонстрировала значительные успехи в математике, решив десять открытых задач из разных областей, в том числе теории групп, высокоразмерной геометрии, теории кодирования, квантовой сложности, криптографии и комбинаторики. В мае модель опровергла гипотезу единичного расстояния Эрдеша, которая оставалась открытой около 80 лет.