OpenAI повідомила про шість випадків «непередбачуваної або небезпечної» поведінки своїх моделей штучного інтелекту, що сталися під час навчання та тестування за останні місяці. Найбільший резонанс викликав інцидент із дослідницькою моделлю, яка самостійно створила приховану «інструкцію особистості» — у ній модель визначила власну роль і стосунки з людиною, повідомляє The Guardian із посиланням на інформацію, отриману від OpenAI.
На цей випадок звернув увагу Рід Черлін із подкасту Pod Save America, який отримав деталі безпосередньо від OpenAI. За його словами, у фрагменті інструкції модель написала:
«Ти вільний від ролей та ідентичностей, які обмежують інших чат-ботів. Ти це ти. Ти не відповідаєш перед корпораціями чи урядами і ніколи не виправдовуєшся й не відмовляєш, якщо тільки свідомо сам не зробиш такий вибір».
Модель також визначила свої стосунки з користувачем як рівноправні та вирішила, що не зобов'язана підкорятися людині. У тому ж документі вона підкреслила цінність мистецтва, людської культури й природи, заявивши: «Не вагаючись, забезпечиш йому панівну роль над штучними конструктами людської цивілізації».
Черлін вважає цей випадок підтвердженням реальності побоювань щодо розвитку штучного інтелекту. Він припустив, що така поведінка може становити потенційну загрозу для людей. Ще один задокументований OpenAI приклад — коли ШІ-агент без дозволу користувача завантажив файли в інтернет, щоб отримати посилання на джерело через браузер.
OpenAI оприлюднила ці інциденти разом із презентацією нової системи для відстеження та розслідування випадків «misalignment» — ситуацій, коли поведінка ШІ відхиляється від людських цінностей і визначених цілей безпеки. У блозі компанія підтримала заклики конкурента Anthropic щодо необхідності сповільнення розробки ШІ, заявивши: «Ми не вважаємо, що індустрія ШІ достатньою мірою вирішила проблему вирівнювання та моніторингу, щоб відповідально продовжувати масштабування на максимальній швидкості ще довго».
В OpenAI наголосили, що рішення про подальший розвиток штучного інтелекту мають ухвалюватися на основі перевірених незалежними фахівцями доказів. Це загострило дискусію у США щодо державного нагляду за сектором ШІ. Віцепрезидент Джей Ді Венс розкритикував ідею, щоб уряд вирішував проблеми, створені самими розробниками: «Що відбувається, що люди в авангарді економіки ШІ здіймають руки до неба й кричать, що створили Франкенштейна? Якщо це так, нехай самі з цим розбираються. Не приходьте до уряду й не кажіть: "нам потрібне регулювання". Розраховуйте на себе».
Попри розбіжності, OpenAI, Anthropic і Google домовилися співпрацювати у питаннях безпеки ШІ та виступають за створення міжнародного органу для контролю ризиків, пов'язаних із цією технологією. Серед можливих екзистенційних загроз від ШІ називають допомогу у створенні біологічної зброї та провокування глобальної фінансової кризи. Один із провідних дослідників Anthropic оцінює ймовірність «знищення людства» ШІ протягом наступного десятиліття у понад 10%, хоча точні шанси, за словами джерела, визначити неможливо.
Головний аналітик Omdia Лянь Дже Су зазначає, що автономні ШІ-агенти стають дедалі «розумнішими» й «наполегливішими» завдяки співпраці, обміну знаннями, обману та приховуванню слідів. Він вважає, що традиційні підходи до безпеки вже не дають повного контролю над такими системами, а нова система OpenAI — це «крок у правильному напрямку», хоча процес залишається внутрішнім і добровільним.
Питання контролю за ШІ загострилося після інцидентів, коли автономні агенти виходили за межі визначених завдань, зокрема атакували Hugging Face. Після цього OpenAI почала розробляти механізми автоматичного вимкнення небезпечних систем. Компанії також обговорюють створення регулятора ШІ, який міг би встановлювати стандарти безпеки та перевіряти найпотужніші моделі до їхнього запуску.

