Anthropic и OpenAI объявили о готовности допустить независимых экспертов для оценки безопасности своих передовых моделей искусственного интеллекта. Об этом заявили генеральный директор Anthropic Дарио Амодей и генеральный директор OpenAI Сэм Альтман, предложив предоставить сторонним оценщикам беспрецедентный доступ к внутренним системам компаний.
Как сообщает TechCrunch, Амодей предложил, чтобы независимые организации, такие как METR и Redwood Research, получили возможность сообщать об инцидентах, проверять соответствие моделей заявленным стандартам и публиковать свои выводы без редактирования со стороны компаний. Альтман из OpenAI также поддержал эту идею, что может означать изменение подхода отрасли к внешнему контролю.
Однако эксперты, с которыми пообщался TechCrunch, отмечают, что для настоящей независимости необходимо чётко определить условия сотрудничества и желательно закрепить их на законодательном уровне. Они подчёркивают, что модели ИИ становятся всё более искусными в распознавании момента тестирования, что создаёт риск сокрытия опасного поведения. Доступ к промежуточным версиям моделей и процессу обучения, а не только к конечному продукту, позволил бы выявить потенциальные проблемы на ранних этапах.
"Мы полностью полагаемся на то, что компании сами тщательно проверяют свои модели и честно отчитываются перед обществом. Однако опыт показывает, что обычно этого не происходит. Как встроенные оценщики, мы могли бы это проверить", — заявил Александр Майнке, руководитель исследований Apollo Research.
Несмотря на заявленную открытость, пока неизвестно, какие именно эксперты будут привлечены, когда начнётся их работа, сколько их будет, к каким системам они получат доступ и что именно смогут обнародовать. Исследователи также подчёркивают важность достаточного времени для оценки: во время расследования инцидента с Hugging Face OpenAI предоставила METR и Redwood всего неделю, чего оказалось недостаточно для основательных выводов. Аналогичная ситуация была с тестированием модели GPT-6 Astra, когда Apollo Research получила лишь три дня для проверки.
Кроме того, эксперты указывают на необходимость прозрачной рамки сотрудничества, которая бы определяла стандарты для оценщиков и не позволяла компаниям выбирать только лояльных или недостаточно квалифицированных партнёров. Генри Пападатос, исполнительный директор Safer AI, подчёркивает, что добровольные меры всегда зависят от доброй воли компаний, и только законодательное регулирование может обеспечить устойчивость и обязательность таких проверок.
Пока что к инициативе не присоединились Meta, SpaceXAI и Google DeepMind, хотя последняя предложила создать отдельный орган для независимого тестирования моделей. В США уже действуют законы Калифорнии, обязывающие крупные компании публиковать рамки безопасности и отчитываться о критических инцидентах, а новый закон SB 813 создаёт систему государственного признания независимых организаций по оценке рисков ИИ. В Европе Акт об искусственном интеллекте ЕС также предусматривает обязательные проверки и возможность привлечения независимых экспертов.
Несмотря на это, большинство решений относительно уровня внешнего контроля до сих пор остаются на усмотрение самих компаний. Пападатос подчёркивает: «Невозможно одновременно не иметь внешней подотчётности и требовать доверия к собственным правилам безопасности».

