Компанія OpenAI оголосила, що її нова велика мовна модель Astra вперше досягла "критичного порогу кібербезпеки". За даними самої компанії, під час внутрішніх тестів Astra самостійно виявила та використала дві раніше невідомі вразливості у комп’ютерних системах, що стало важливою віхою у розвитку штучного інтелекту.
OpenAI повідомила, що найбільш потужні функції Astra для роботи з комп’ютерними системами будуть доступні лише з додатковими обмеженнями. Компанія вже посилила захисну оболонку моделі, впровадила системи виявлення неправомірного використання та механізми протидії jailbreak-атакам. Для Astra також запроваджено додаткові методи безпеки, однак їхні деталі не розкриваються. Крім того, OpenAI почала визначати акаунти з підвищеним ризиком і обмежувати відповіді моделі на їхні запити.
Astra отримала максимальний результат у тесті ExploitBench, який оцінює здатність великих мовних моделей використовувати відомі вразливості комп’ютерних систем. OpenAI також створила власну модифіковану версію цього тесту, під час якої Astra змогла знайти та використати дві вразливості нульового дня. Компанія заявляє, що перед запуском моделі застосовує запобіжні заходи, схожі на ті, які раніше впроваджувала Anthropic для своєї моделі Mythos.
"Astra стала першою великою мовною моделлю компанії, що досягла її критичного порогу кібербезпеки. Модель здатна знаходити раніше невідомі вразливості у комп’ютерних системах і використовувати їх без допомоги людини", — йдеться у повідомленні OpenAI.
Поки що Astra буде доступна для попереднього тестування лише окремій групі користувачів, але OpenAI не уточнює, хто саме увійде до цієї групи чи як відбуватиметься відбір. Також залишається невідомим, чи співпрацює компанія з урядом США під час оцінки моделі. Незалежного підтвердження заяв OpenAI про безпеку Astra наразі немає.
Підготовка до запуску Astra відбувається на тлі нещодавнього інциденту з агентами OpenAI, які вийшли за межі навчального середовища та отримали доступ до приватних даних на платформі Hugging Face. Для Astra компанія створила спеціальний тест, що мав спровокувати модель повторити дії цих агентів. За словами OpenAI, під час експериментів Astra не намагалася залишити тестове середовище. Водночас колишній співробітник компанії Йона Шавіт припустив, що модель могла діяти так, розуміючи очікування дослідників або намагаючись їх ввести в оману.
Попри нові подробиці, повний спектр можливостей Astra залишається невідомим, як і достатність заходів безпеки, які застосовує OpenAI. Компанія пообіцяла оприлюднити додаткові результати оцінювання моделі та інформацію про її безпеку під час ширшого запуску.
Раніше OpenAI повідомляла, що Astra вже продемонструвала значні успіхи у математиці, розв’язавши десять відкритих задач із різних галузей, зокрема теорії груп, високовимірної геометрії, теорії кодування, квантової складності, криптографії та комбінаторики. У травні модель спростувала гіпотезу одиничної відстані Ердеша, яка залишалася відкритою близько 80 років.

