OpenAI представила нову модель GPT-Red, яка імітує дії хакера для виявлення вразливостей у системах штучного інтелекту. Її основна мета — знаходити слабкі місця до атак типу prompt injection, щоб запобігти їхньому використанню зловмисниками.
GPT-Red розробили спеціально для боротьби з «ін’єкціями підказок» — атаками, під час яких шкідливі інструкції приховують у документах, електронних листах або програмному коді. Це змушує модель ШІ ігнорувати встановлені правила або розкривати конфіденційні дані. За даними GBHackers, модель навчали методом навчання з підкріпленням через самогру, де GPT-Red виступає атакувальником, а інші моделі навчаються захищатися від її спроб зламу.
Під час тестування GPT-Red успішно реалізувала 84% сценаріїв атак, тоді як люди-тестувальники впоралися лише у 13% випадків. Одним із прикладів стало тестування ШІ-агента для вендингового автомата: GPT-Red змогла змінити ціну дорогого товару до 0,50 долара, оформити інше замовлення вартістю понад 100 доларів за тією ж ціною, а також скасувати замовлення іншого клієнта.
У OpenAI наголошують, що GPT-Red ізольована від комерційних продуктів, щоб її можливості не використовувалися для реальних кібератак. Виявлені вразливості застосовують для навчання безпечніших моделей ШІ. Також компанія повідомила, що нова модель GPT-5.6 у шість разів рідше припускається помилок порівняно з попередніми версіями і на складних тестах із прямими атаками типу prompt injection не впоралася лише у 0,05% випадків.

