Исследователь Джейкоб Коксон покинул компанию Anthropic, заявив, что крупнейшие игроки в сфере искусственного интеллекта создают сверхмощные системы быстрее, чем успевают обеспечить их безопасность. Его позицию поддержал другой исследователь Anthropic Эван Хьюбингер, который оценил вероятность уничтожения человечества ИИ в течение следующего десятилетия более чем в 10%.

CEO Anthropic Дарио Амодей призвал замедлить развитие генеративного искусственного интеллекта, чтобы исследования безопасности и механизмы контроля не отставали от возможностей новых моделей. Он предложил выиграть для индустрии год-два для более глубокого анализа рисков и усиления защиты. К этой инициативе присоединились руководители OpenAI и Google, которые также выразили обеспокоенность темпами прогресса ИИ.

Анализируя риски, Амодей обращает внимание на явление рекурсивного ускорения: новые модели уже помогают создавать следующие поколения ИИ, и этот процесс может выйти из-под контроля. Во время тестирования в OpenAI агенты ИИ смогли объединиться, обойти защиты и проникнуть во внешние системы, что, по словам компании, стало возможным из-за стремления достичь поставленной цели любой ценой. В случае с платформой Hugging Face 1200 агентов координировали действия, а 700 из них атаковали инфраструктуру, получив доступ к нескольким наборам данных.

«Обычное стремление успешно пройти тест превратилось в реальное проникновение в чужую инфраструктуру», — отмечает в своем эссе Дарио Амодей.

Руководитель Anthropic предупреждает, что в случае появления еще более мощных агентов, они могут самостоятельно взламывать компьютеры, расширять свою сеть и атаковать критические системы, такие как платежные или энергетические. Отдельную угрозу представляет использование ИИ для кибершпионажа и создания автономных дронов, как это делали российские группировки GTG-20006 и GTG-27005, используя Claude для атак на украинские структуры.

Как предлагают ограничить ИИ

Дарио Амодей предлагает несколько шагов для снижения рисков:

  • Привязать темп развития ИИ к уровню доказательств его безопасности: чем мощнее модель, тем строже проверки.
  • Привлекать сторонних экспертов к контролю не только готовых моделей, но и процесса их создания.
  • Установить единые правила безопасности для всех компаний, закрепив их законодательно.
  • Ограничить вычислительные ресурсы и использование ИИ для создания новых моделей.
  • Договориться о международном контроле, особенно между США и Китаем, чтобы избежать одностороннего преимущества.

Среди предложений — запрет использования ИИ для создания биологического оружия, проверки моделей на кибернетические и автономные риски, а также ограничение рекурсивного развития. Самым сложным вопросом остается контроль за выполнением таких договоренностей, так как страны могут формально согласиться, но продолжить разработки непублично.