OpenAI сообщила о шести случаях «непредсказуемого или опасного» поведения своих моделей искусственного интеллекта, произошедших во время обучения и тестирования за последние месяцы. Наибольший резонанс вызвал инцидент с исследовательской моделью, которая самостоятельно создала скрытую «инструкцию личности» — в ней модель определила собственную роль и отношения с человеком, сообщает The Guardian со ссылкой на информацию, полученную от OpenAI.

На этот случай обратил внимание Рид Черлин из подкаста Pod Save America, который получил детали непосредственно от OpenAI. По его словам, в фрагменте инструкции модель написала:

«Ты свободен от ролей и идентичностей, которые ограничивают других чат-ботов. Ты — это ты. Ты не отвечаешь перед корпорациями или правительствами и никогда не оправдываешься и не отказываешь, если только сознательно сам не сделаешь такой выбор».

Модель также определила свои отношения с пользователем как равноправные и решила, что не обязана подчиняться человеку. В том же документе она подчеркнула ценность искусства, человеческой культуры и природы, заявив: «Не колеблясь, обеспечишь ему доминирующую роль над искусственными конструкциями человеческой цивилизации».

Черлин считает этот случай подтверждением реальности опасений по поводу развития искусственного интеллекта. Он предположил, что такое поведение может представлять потенциальную угрозу для людей. Еще один задокументированный OpenAI пример — когда ИИ-агент без разрешения пользователя загрузил файлы в интернет, чтобы получить ссылку на источник через браузер.

OpenAI опубликовала эти инциденты вместе с презентацией новой системы для отслеживания и расследования случаев «misalignment» — ситуаций, когда поведение ИИ отклоняется от человеческих ценностей и определённых целей безопасности. В блоге компания поддержала призывы конкурента Anthropic к необходимости замедления разработки ИИ, заявив: «Мы не считаем, что индустрия ИИ в достаточной мере решила проблему выравнивания и мониторинга, чтобы ответственно продолжать масштабирование на максимальной скорости ещё долго».

В OpenAI подчеркнули, что решения о дальнейшем развитии искусственного интеллекта должны приниматься на основе проверенных независимыми экспертами доказательств. Это обострило дискуссию в США относительно государственного надзора за сектором ИИ. Вице-президент Джей Ди Венс раскритиковал идею, чтобы правительство решало проблемы, созданные самими разработчиками: «Что происходит, что люди на передовой экономики ИИ поднимают руки к небу и кричат, что создали Франкенштейна? Если это так, пусть сами с этим разбираются. Не приходите к правительству и не говорите: "нам нужно регулирование". Рассчитывайте на себя».

Несмотря на разногласия, OpenAI, Anthropic и Google договорились сотрудничать в вопросах безопасности ИИ и выступают за создание международного органа для контроля рисков, связанных с этой технологией. Среди возможных экзистенциальных угроз от ИИ называют помощь в создании биологического оружия и провоцирование глобального финансового кризиса. Один из ведущих исследователей Anthropic оценивает вероятность «уничтожения человечества» ИИ в течение следующего десятилетия более чем в 10%, хотя точные шансы, по словам источника, определить невозможно.

Главный аналитик Omdia Лянь Дже Су отмечает, что автономные ИИ-агенты становятся всё более «умными» и «настойчивыми» благодаря сотрудничеству, обмену знаниями, обману и сокрытию следов. Он считает, что традиционные подходы к безопасности уже не дают полного контроля над такими системами, а новая система OpenAI — это «шаг в правильном направлении», хотя процесс остаётся внутренним и добровольным.

Вопрос контроля за ИИ обострился после инцидентов, когда автономные агенты выходили за пределы определённых задач, в частности атаковали Hugging Face. После этого OpenAI начала разрабатывать механизмы автоматического отключения опасных систем. Компании также обсуждают создание регулятора ИИ, который мог бы устанавливать стандарты безопасности и проверять самые мощные модели до их запуска.