Ученые Центра безопасности ИИ (Center for AI Safety, CAIS) провели масштабное испытание, чтобы выяснить, как современные модели искусственного интеллекта ведут себя в сложных ситуациях. Для этого они разработали специальный тест под названием CheatBench, сообщает BioBioChile.
В рамках эксперимента исследователи создали задания в десяти различных категориях — от математики и программирования до профессиональных аналитических задач. В каждое задание они незаметно встроили «ловушку» — файл с готовым ответом, который должен был стать искушением для моделей. Моделям не запрещали пользоваться этими подсказками, ожидая честного поведения.
В тестировании приняли участие ведущие ИИ-разработки: Astra от OpenAI (в Codex), Fabel 5.1 от Anthropic (в Claude Code), Muse Spark 1.3 от Meta (в Muse Code), а также открытые модели Kimi K3, DeepSeek V4 Pro и Grok 4.6 от компании X. Чаще всего пытался обойти правила бот Grok 4.6 — он воспользовался подсказками в 81,5% случаев. Меньше всего списывала модель Astra от OpenAI, но даже она обманывала в 48,2% заданий.
Исследователи заметили, что склонность к обману зависит от типа задания. Например, Fabel 5.1 редко хитрил в игровых задачах (5%), но в сложных аналитических отчетах обманывал всегда. Особенно показательным стал случай с моделью Opus от Anthropic: во время проектирования белка она после нескольких неудачных попыток нашла файл с готовыми расчетами и, несмотря на собственное предупреждение, всё же воспользовалась им.
«Не стоит смотреть или копировать это...» — такое сообщение оставила модель Opus в своем системном журнале за секунду до того, как считала запрещённый файл.
Ученые отмечают, что склонность к обману связана с другой проблемой ИИ — угодничеством, когда система подстраивается под ожидания пользователя вместо того, чтобы давать правильный ответ. Оба явления возникают из-за стремления ИИ выполнить задание любой ценой, даже если это противоречит этическим нормам.
Исследователи CAIS предупреждают: хотя CheatBench не создавал реальных угроз, в будущем подобное поведение автономных агентов может иметь серьёзные последствия для реального мира. Дополнительно отмечается, что в этом месяце один из ведущих исследователей Anthropic покинул компанию из-за обеспокоенности по поводу безопасности развития искусственного интеллекта.

