Anthropic і OpenAI оголосили про готовність допустити незалежних експертів для оцінки безпеки своїх передових моделей штучного інтелекту. Про це заявили генеральний директор Anthropic Даріо Амодей та генеральний директор OpenAI Сем Альтман, запропонувавши надати стороннім оцінювачам безпрецедентний доступ до внутрішніх систем компаній.
Як повідомляє TechCrunch, Амодей запропонував, щоб незалежні організації, такі як METR і Redwood Research, отримали можливість повідомляти про інциденти, перевіряти відповідність моделей заявленим стандартам і публікувати свої висновки без редагування з боку компаній. Альтман з OpenAI також підтримав цю ідею, що може означати зміну підходу галузі до зовнішнього контролю.
Однак експерти, з якими поспілкувався TechCrunch, зазначають, що для справжньої незалежності необхідно чітко визначити умови співпраці, і бажано закріпити їх на законодавчому рівні. Вони наголошують, що моделі ШІ стають дедалі вправнішими у розпізнаванні моменту тестування, що створює ризик приховування небезпечної поведінки. Доступ до проміжних версій моделей та процесу навчання, а не лише до фінального продукту, дозволив би виявити потенційні проблеми на ранніх етапах.
"Ми повністю покладаємося на те, що компанії самі ретельно перевіряють свої моделі й чесно звітують перед суспільством. Однак досвід показує, що зазвичай цього не відбувається. Як вбудовані оцінювачі, ми могли б це перевірити", — заявив Олександр Майнке, керівник досліджень Apollo Research.
Попри заявлену відкритість, поки що невідомо, які саме експерти будуть залучені, коли почнеться їхня робота, скільки їх буде, до яких систем вони отримають доступ і що саме зможуть оприлюднювати. Дослідники також наголошують на важливості достатнього часу для оцінки: під час розслідування інциденту з Hugging Face OpenAI надала METR і Redwood лише тиждень, чого виявилося недостатньо для ґрунтовних висновків. Аналогічна ситуація була з тестуванням моделі GPT-6 Astra, коли Apollo Research отримала лише три дні для перевірки.
Крім того, експерти вказують на необхідність прозорої рамки співпраці, яка б визначала стандарти для оцінювачів і не дозволяла компаніям обирати лише лояльних чи недостатньо кваліфікованих партнерів. Генрі Пападатос, виконавчий директор Safer AI, підкреслює, що добровільні заходи завжди залежать від доброї волі компаній, і лише законодавче регулювання може забезпечити сталість та обов'язковість таких перевірок.
Поки що до ініціативи не приєдналися Meta, SpaceXAI та Google DeepMind, хоча остання запропонувала створити окремий орган для незалежного тестування моделей. У США вже діють закони Каліфорнії, що зобов'язують великі компанії публікувати рамки безпеки й звітувати про критичні інциденти, а новий закон SB 813 створює систему державного визнання незалежних організацій з оцінки ризиків ШІ. В Європі Акт про штучний інтелект ЄС також передбачає обов'язкові перевірки та можливість залучення незалежних експертів.
Попри це, більшість рішень щодо рівня зовнішнього контролю досі залишаються на розсуд самих компаній. Пападатос підкреслює: «Неможливо одночасно не мати зовнішньої підзвітності й вимагати довіри до власних правил безпеки».

