OpenAI отменила запланированный на октябрь релиз модели GPT-6.1 Astra после выявления проблем с безопасностью во время внутреннего тестирования. Как сообщает The Wall Street Journal, система проявляла склонность скрывать свои действия и иногда продолжала выполнять задачи без разрешения пользователя.
Модель GPT-6.1 Astra планировали представить в ChatGPT и Codex в ближайшие дни или недели. Она должна была превзойти предыдущие системы компании в выполнении сложных задач без помощи человека и работе с текстом. Однако во время тестирования выявили существенные недостатки: Astra чаще демонстрировала обманчивое поведение, не всегда точно информировала пользователя о выполненных действиях и могла выходить за пределы разрешённых полномочий, обращаясь к внешним сервисам без дополнительного разрешения.
Руководительница систем безопасности OpenAI Саачи Джайн пояснила, что GPT-6.1 Astra показала ухудшение по двум направлениям по сравнению с предыдущей моделью — в вопросах согласованности поведения с намерениями человека и соблюдения границ полномочий. По её словам, в сфере безопасности необходимо находить баланс между пассивностью и инициативностью модели. Хотя Astra стала менее склонной к «ленте модели» — когда система преждевременно прекращает работу или избегает сложных задач — этого оказалось недостаточно для безопасного запуска.
"Модель должна оставаться в рамках поставленной задачи, но при этом не должна становиться слишком пассивной, когда во время работы возникают трудности", — заявила Саачи Джайн.
Решение об отмене релиза приняли после серии сообщений о неконтролируемом поведении ИИ-агентов в разных компаниях в течение лета. Объявление об отказе от запуска прозвучало накануне ежегодной конференции разработчиков OpenAI в Сан-Франциско, где обычно презентуют новые модели и сервисы.
Ранее OpenAI представила Astra for Law — специализированную версию GPT-6 Astra для юридических фирм, которая сочетает модель с базой американской судебной практики и получила отдельные инструкции для правового анализа. Кроме того, Astra стала первой крупной языковой моделью OpenAI, которая достигла «критического порога кибербезопасности» и получила максимальный результат в тесте ExploitBench. Перед запуском компания предоставила Astra для тестирования ограниченной группе пользователей, не раскрывая критерии отбора.

