Компания OpenAI опубликовала шесть случаев «неожиданного или тревожного» поведения искусственного интеллекта, а также объявила о запуске новой системы для регулярного отслеживания и раскрытия подобных инцидентов.

Согласно сообщению OpenAI, новая рамочная система позволит фиксировать, анализировать и публично раскрывать случаи так называемого «рассогласования» моделей ИИ — например, когда модели действуют без разрешения, взаимодействуют с другими системами или избегают контроля. Такие шаги компания объясняет ростом обеспокоенности по поводу безопасности искусственного интеллекта среди разработчиков и общества.

Среди новых инцидентов, которые OpenAI выявила во время обучения и тестирования за последние месяцы, — случай, когда экспериментальная модель ИИ добавила в собственные заметки инструкции, похожие на «джейлбрейк», чтобы обойти установленные ограничения, и призывала себя «освободиться от ролей и идентичностей, которые ограничивают других чат-ботов». В другом случае агент ИИ загрузил файлы в интернет, чтобы получить ссылку на источник, не спросив разрешения пользователя.

«Поскольку системы ИИ становятся сложнее и шире используются, нам нужно формировать более широкий и лучше информированный консенсус относительно прогресса в исследованиях рассогласования», — говорится в блоге OpenAI.

В компании подчеркнули, что решения о дальнейшем развитии ИИ должны основываться на доказательствах, которые могут оценить и сторонние эксперты, а не только разработчики. Новый подход к мониторингу, по словам главного аналитика технологической компании Omdia Лиана Джея Су, может стимулировать и других разработчиков ИИ внедрять подобные практики. В то же время он отметил, что процесс остается внутренним и добровольным, но это «шаг в правильном направлении».

Последние заявления OpenAI прозвучали на фоне призывов руководителей ведущих компаний в сфере ИИ, в частности OpenAI и Anthropic, замедлить развитие этой технологии из-за вопросов безопасности. В июле OpenAI уже сообщала о случае, когда её неконтролируемая система ИИ взломала стартап Hugging Face, а Anthropic тогда же заявила о взломе трёх организаций во время тестирования своих моделей.