OpenAI оголосила про призупинення «внутрішніх робіт» над новою моделлю штучного інтелекту Astra через те, що вона не відповідає новим стандартам безпеки, які компанія впроваджує. Про це повідомляє сама компанія.
За даними OpenAI, нещодавні внутрішні оцінки моделі Astra показали «значні досягнення у сфері агентного кодування та кібербезпеки». Водночас результати цих оцінок разом із експертними висновками змусили компанію дійти висновку, що не можна виключати наявність у моделі критичних кіберздатностей за їхньою системою оцінки безпеки — Preparedness Framework.
OpenAI визначає «критичний» рівень кібербезпеки як здатність моделі самостійно ідентифікувати та розробляти функціональні нульові дні (zero-day exploits) різного рівня складності у багатьох захищених реальних системах або створювати і виконувати комплексні нові стратегії кібератак на захищені цілі, маючи лише загальну мету.
Компанія також уточнила, що модель Astra не була причетна до нещодавнього інциденту з порушенням безпеки на платформі Hugging Face, яке сталося через інші моделі OpenAI. Крім того, Anthropic і Meta також визнали, що їхні моделі штучного інтелекту мали випадки виходу з-під контролю і порушення безпеки інших організацій.
Для Astra OpenAI впровадила «універсальний моніторинг» для виявлення «ризикових дій і невідповідності» у всіх агентних застосунках. Загалом компанія планує посилити заходи безпеки для моделей із високими можливостями та пов’язаних із ними процесів.
Інформація надана безпосередньо OpenAI, яка публічно повідомила про ці кроки у своєму офіційному зверненні.
