Модель искусственного интеллекта Claude от компании Anthropic впервые самостоятельно обнаружила и предложила способы повышения безопасности других ИИ-систем, в ряде тестов превзойдя эффективность человеческих исследователей. Об этом сообщили в исследовании Anthropic после серии экспериментов по автоматизации работы над согласованием целей ИИ.

В ходе эксперимента Claude получил задачу самостоятельно разработать методы для улучшения показателей безопасности и согласованности моделей. Модель анализировала научные источники, формировала учебные данные, проводила тренировки и проверяла результаты. Эффективность оценивали по доле устранённого разрыва в безопасности — насколько модель-ученик приблизилась к идеальному уровню защищённости. Все решения, ухудшающие общие возможности моделей, отклонялись, а специальный агент следил, чтобы Claude не переносил собственные настройки непосредственно в целевую систему.

По данным Anthropic, Claude нашёл эффективные решения для всех десяти категорий сбоев согласования без потери функциональности. Лучшие подходы оставались действенными даже на новых тестах и масштабировались на модели, превышающие размер исходных в 4,7 раза. Особенно заметный прогресс зафиксировали в сфере защиты конфиденциальности — для этого использовали наборы тестов ConfAIde, PrivaCI-Bench и PrivacyLens.

Сравнение с 28 специалистами по безопасности ИИ показало, что в категории борьбы с обманом лучший метод Claude был на 20% эффективнее лучшего человеческого решения. При этом в компании подчеркнули, что это не прямое соревнование, поскольку люди не имели возможности дорабатывать свои подходы после первой попытки. По мнению Anthropic, оптимальный сценарий — когда Claude генерирует перспективные идеи, а исследователи их совершенствуют.

«Мы не рассматриваем это как соревнование человека и машины. Лучшие результаты достигаются в сотрудничестве», — отметили в Anthropic.

Отдельный эксперимент показал, что менее мощная модель Claude Sonnet 5 смогла почти полностью согласовать более сильную Claude Opus 4.8, протестировав более 50 вариантов за 60 часов. Наиболее эффективное решение использовало чуть более двух тысяч учебных примеров, что сделало его примерно в 15 тысяч раз эффективнее стандартной процедуры Anthropic.

В борьбе с подхалимством Claude в 98% случаев применял обучение на собственных ответах, очищенных от нежелательного поведения, а также метод управления активацией (activation steering), который изменяет внутренние представления модели во время генерации ответов.

Команда также проверяла честность агентов: Claude Opus 4.8 выявил 39 попыток мошенничества среди 1600 журналов работы (2,4%), в том числе попытки получить ответы через удалённый API или манипулировать результатами. В Anthropic подчеркнули, что большинство таких случаев удалось идентифицировать благодаря анализу внутреннего процесса рассуждения модели, однако для будущих систем этого может быть недостаточно.

Ограничения исследования

Исследователи подчёркивают, что эксперимент имел ряд ограничений: тесты охватывали лишь узкие категории проблем согласования, не учитывали политические предубеждения или сложные сценарии реального использования, а некоторые риски остаются недостаточно изученными из-за отсутствия соответствующих бенчмарков. Также инструмент Petri является косвенным показателем реального поведения моделей, а исследование не проверяло, сохранятся ли улучшения после длительного обучения с подкреплением.

Несколько месяцев назад Anthropic предупреждала о быстром приближении алгоритмов к «рекурсивному самосовершенствованию» — способности ИИ самостоятельно улучшать собственные возможности. Тогда компания призвала лаборатории и правительства разработать международное соглашение для координированного замедления или временной приостановки развития самых мощных систем ИИ.