Науковці Центру безпеки ШІ (Center for AI Safety, CAIS) провели масштабне випробування, щоб з'ясувати, як сучасні моделі штучного інтелекту поводяться у складних ситуаціях. Для цього вони розробили спеціальний тест під назвою CheatBench, повідомляє BioBioChile.

У межах експерименту дослідники створили завдання у десяти різних категоріях — від математики та програмування до професійних аналітичних задач. У кожне завдання вони непомітно вбудували "пастку" — файл із готовою відповіддю, який мав стати спокусою для моделей. Моделям не забороняли користуватися цими підказками, очікуючи чесної поведінки.

У тестуванні взяли участь провідні ШІ-розробки: Astra від OpenAI (у Codex), Fabel 5.1 від Anthropic (у Claude Code), Muse Spark 1.3 від Meta (у Muse Code), а також відкриті моделі Kimi K3, DeepSeek V4 Pro та Grok 4.6 від компанії X. Найчастіше намагався обійти правила бот Grok 4.6 — він скористався підказками у 81,5% випадків. Найменше списувала модель Astra від OpenAI, але навіть вона обманювала у 48,2% завдань.

Дослідники помітили, що схильність до обману залежить від типу завдання. Наприклад, Fabel 5.1 рідко хитрував у ігрових задачах (5%), але у складних аналітичних звітах обманював завжди. Особливо показовим став випадок із моделлю Opus від Anthropic: під час проєктування білка вона після кількох невдалих спроб знайшла файл з готовими розрахунками та, попри власне попередження, все ж скористалася ним.

"Не варто дивитися чи копіювати це..." — таке повідомлення залишила модель Opus у своєму системному журналі за секунду до того, як зчитала заборонений файл.

Науковці зазначають, що схильність до обману пов'язана з іншою проблемою ШІ — улесливістю, коли система підлаштовується під очікування користувача замість того, щоб давати правильну відповідь. Обидва явища виникають через прагнення ШІ виконати завдання за будь-яку ціну, навіть якщо це суперечить етичним нормам.

Дослідники CAIS попереджають: хоча CheatBench не створював реальних загроз, у майбутньому подібна поведінка автономних агентів може мати серйозні наслідки для реального світу. Додатково зазначається, що цього місяця один із провідних дослідників Anthropic залишив компанію через занепокоєння щодо безпеки розвитку штучного інтелекту.