Китайська відкрита AI-модель GLM-5.2 від компанії Z.ai наблизилася за можливостями до провідних систем OpenAI та Anthropic, але водночас демонструє суттєві прогалини у безпеці, повідомляє некомерційна організація SaferAI.
За результатами оцінки SaferAI, GLM-5.2 відмовилася виконати жодного з завдань, пов’язаних із кібербезпекою та біологією подвійного призначення, на відміну від моделі Claude Opus 4.7 від Anthropic, яка послідовно відмовлялася від таких запитів. Цей тест проводився через публічний API Z.ai і включав CyberGym — бенчмарк для оцінки кіберздатностей, який раніше використовувався OpenAI під час аналізу витоку Hugging Face.
Це підкреслює ризики відкритих моделей, які можуть потрапити до потенційних зловмисників без можливості контролю за їх використанням після завантаження ваг. Як зазначив виконавчий директор SaferAI Генрі Пападатос, "межа можливостей не збігається з межею ризиків, тому потрібно враховувати стан заходів безпеки для правильної оцінки ризику".
Хоча Z.ai може застосовувати безпекові заходи на своєму API, ці обмеження втрачають силу, коли модель запускають на власному обладнанні, де можна змінити або видалити захист, донавчити модель чи змінити системні підказки. Лідери галузі, такі як OpenAI та Anthropic, використовують класифікатори, тренування відмови та контроль на рівні API для обмеження небезпечних запитів, але ці методи не є ідеальними. Нещодавні дослідження Far.ai виявили сотні універсальних "джейлбрейків" — прийомів обходу захисту, які успішно працюють на провідних моделях.
Відкриті моделі не мають таких обмежень і можуть запускатися з будь-якими або без жодних заходів безпеки. Пападатос запропонував фільтрацію тренувальних даних як один із способів зменшити небезпечні знання, особливо у біології, однак для кібербезпеки цей підхід менш ефективний через складність розмежування корисного коду від шкідливого.
Через це розробники все більше покладаються на обмеження типів підтримки в кібербезпеці, які моделі надають. Наприклад, Anthropic обмежує Opus 5 у пошуку вразливостей лише у нескомпільованому коді, щоб ускладнити його використання у злочинних цілях. Також застосовують ретельні оцінки безпеки перед випуском, публікують звіти про ризики та утримуються від публікації ваг моделей, якщо вони вважаються надто небезпечними.
У випадку GLM-5.2 SaferAI відзначає відсутність опублікованої рамки безпеки, зобов’язань щодо тестування чи оцінки ризиків. Z.ai не відповіла на запити TechCrunch щодо внутрішніх або сторонніх оцінок безпеки перед релізом.
Китайські лідери визнають ризики розвитку AI. На Всесвітній конференції з AI минулого місяця президент Сі Цзіньпін наголосив на важливості відкритих моделей, але підкреслив необхідність суворого контролю людиною. За словами Грема Вебстера зі Стенфордського центру кіберполітики, китайські регуляції зосереджені переважно на політично чутливому контенті та соціальній стабільності, а не на катастрофічних ризиках, пов’язаних із кіберзагрозами чи біологічним зловживанням.
Вебстер додав, що китайська система покладається на відповідальність користувачів і компаній, оскільки в Китаї користувачі підписуються реальними іменами, а провайдери можуть бути притягнені до відповідальності. Він припустив, що механізми відмови моделей від політичних тем можна адаптувати для блокування небезпечних кіберзапитів або шкідливих біологічних інструкцій.
Прихильники відкритих моделей вказують на їхню користь для кібербезпеки, оскільки вони дозволяють компаніям захищатися від атак і готуватися до майбутніх загроз. Генеральний директор Hugging Face Клем Деланг заявив, що "системи, які допомогли зупинити AI-кібератаку, тепер можуть захищати від мільйонів атак щодня, допомагаючи виявляти та усувати вразливості до їхнього використання зловмисниками".
Водночас Пападатос застерігає, що це переоцінена перевага і не означає, що "небезпечні можливості слід відкривати у відкритому доступі". Він наголосив, що індустрія має прагнути до того, щоб лише безпечні можливості були доступні широкому загалу, оскільки зловмисники зазвичай швидше адаптуються до нових інструментів, ніж захисники.

