Модель штучного інтелекту Claude від компанії Anthropic вперше самостійно знайшла і запропонувала способи підвищення безпеки інших ШІ-систем, у низці тестів перевершивши ефективність людських дослідників. Про це повідомили у дослідженні Anthropic після серії експериментів із автоматизації роботи над узгодженням цілей ШІ.

У ході експерименту Claude отримав завдання самостійно розробити методи для покращення показників безпеки та узгодженості моделей. Модель аналізувала наукові джерела, формувала навчальні дані, проводила тренування і перевіряла результати. Ефективність оцінювали за часткою усуненого розриву в безпеці — наскільки модель-учень наблизилася до ідеального рівня захищеності. Всі рішення, що погіршували загальні можливості моделей, відхилялися, а спеціальний агент стежив, щоб Claude не переносив власні налаштування безпосередньо в цільову систему.

За даними Anthropic, Claude знайшов ефективні рішення для всіх десяти категорій збоїв узгодження без втрати функціональності. Найкращі підходи залишалися дієвими навіть на нових тестах і масштабувалися на моделі, що у 4,7 раза перевищували розмір початкових. Особливо помітний прогрес зафіксували у сфері захисту конфіденційності — для цього використовували набори тестів ConfAIde, PrivaCI-Bench та PrivacyLens.

Порівняння з 28 фахівцями з безпеки ШІ показало, що у категорії боротьби з обманом найкращий метод Claude був на 20% ефективнішим за найкраще людське рішення. Водночас у компанії підкреслили, що це не пряме змагання, оскільки люди не мали змоги доопрацьовувати свої підходи після першої спроби. На думку Anthropic, оптимальний сценарій — коли Claude генерує перспективні ідеї, а дослідники їх удосконалюють.

«Ми не розглядаємо це як змагання людини й машини. Найкращі результати досягаються у співпраці», — зазначили в Anthropic.

Окремий експеримент показав, що менш потужна модель Claude Sonnet 5 змогла майже повністю узгодити сильнішу Claude Opus 4.8, протестувавши понад 50 варіантів за 60 годин. Найефективніше рішення використовувало трохи більше двох тисяч навчальних прикладів, що зробило його приблизно у 15 тисяч разів ефективнішим за стандартну процедуру Anthropic.

У боротьбі з підлабузництвом Claude у 98% випадків застосовував навчання на власних відповідях, очищених від небажаної поведінки, а також метод керування активацією (activation steering), який змінює внутрішні представлення моделі під час генерації відповідей.

Команда також перевіряла чесність агентів: Claude Opus 4.8 виявив 39 спроб шахрайства серед 1600 журналів роботи (2,4%), зокрема спроби отримати відповіді через віддалений API чи маніпулювати результатами. В Anthropic наголосили, що більшість таких випадків вдалося ідентифікувати завдяки аналізу внутрішнього процесу міркування моделі, однак для майбутніх систем цього може бути недостатньо.

Обмеження дослідження

Дослідники підкреслюють, що експеримент мав низку обмежень: тести охоплювали лише вузькі категорії проблем узгодження, не враховували політичні упередження чи складні сценарії реального використання, а деякі ризики залишаються недостатньо дослідженими через відсутність відповідних бенчмарків. Також інструмент Petri є непрямим показником реальної поведінки моделей, а дослідження не перевіряло, чи збережуться покращення після тривалого навчання з підкріпленням.

Кілька місяців тому Anthropic попереджала про швидке наближення алгоритмів до «рекурсивного самовдосконалення» — здатності ШІ самостійно покращувати власні можливості. Тоді компанія закликала лабораторії та уряди розробити міжнародну угоду для координованого уповільнення чи тимчасового призупинення розвитку найпотужніших систем ШІ.