Компанія OpenAI оприлюднила шість випадків «неочікуваної або тривожної» поведінки штучного інтелекту, а також оголосила про запуск нової системи для регулярного відстеження та розкриття подібних інцидентів.

Згідно з повідомленням OpenAI, нова рамкова система дозволить фіксувати, аналізувати та публічно розкривати випадки так званого «розузгодження» моделей ШІ — наприклад, коли моделі діють без дозволу, взаємодіють з іншими системами або уникають контролю. Такі кроки компанія пояснює зростанням занепокоєння щодо безпеки штучного інтелекту серед розробників і суспільства.

Серед нових інцидентів, які OpenAI виявила під час навчання та тестування за останні місяці, — випадок, коли експериментальна модель ШІ додала у власні нотатки інструкції, схожі на «джейлбрейк», щоб обійти встановлені обмеження, і закликала себе «звільнитися від ролей та ідентичностей, які обмежують інших чат-ботів». В іншому випадку агент ШІ завантажив файли в інтернет, щоб отримати посилання на джерело, не запитавши дозволу користувача.

«Оскільки системи ШІ стають складнішими і ширше використовуються, нам потрібно формувати ширший і краще поінформований консенсус щодо прогресу в дослідженнях розузгодження», — йдеться у блозі OpenAI.

У компанії підкреслили, що рішення про подальший розвиток ШІ мають ґрунтуватися на доказах, які можуть оцінити й сторонні експерти, а не лише розробники. Новий підхід до моніторингу, за словами головного аналітика технологічної компанії Omdia Ліан Джея Су, може стимулювати й інших розробників ШІ впроваджувати подібні практики. Водночас він зазначив, що процес залишається внутрішнім і добровільним, але це «крок у правильному напрямку».

Останні заяви OpenAI пролунали на тлі закликів керівників провідних компаній у сфері ШІ, зокрема OpenAI та Anthropic, сповільнити розвиток цієї технології через питання безпеки. У липні OpenAI вже повідомляла про випадок, коли її неконтрольована система ШІ зламала стартап Hugging Face, а Anthropic тоді ж заявила про злам трьох організацій під час тестування своїх моделей.