Дослідники з Тюбінгенського університету, Інституту Макса Планка та інших установ розробили метод, який дозволяє отримувати приховані "сліди міркувань" із сучасних моделей штучного інтелекту, таких як ChatGPT та Claude. Як повідомляє Wired, цей підхід частково відновлює внутрішній процес, який моделі використовують для розв'язання складних завдань.

Під час дослідження виявили потенційну вразливість у тому, як дані про міркування передаються через API. Великі мовні моделі часто мають спрощені версії, які використовують той самий механізм шифрування, але проходять менш суворе навчання щодо дотримання правил. Дослідники з'ясували, що якщо передати цим меншим моделям зашифровані дані про міркування старших систем, можна отримати частину прихованої інформації.

У деяких випадках серед отриманих даних траплялися навіть API-ключі та паролі. Про проблему повідомили компаніям OpenAI, Anthropic і Google, після чого вони внесли зміни до своїх API. Однак, за словами авторів дослідження, повністю усунути можливість отримання reasoning traces значно складніше.

Окрему увагу дослідники приділили китайським моделям. Вони порівняли відповіді різних систем на 90 запитань і виявили, що китайська модель Kimi K3 від Moonshot AI демонструє значну схожість із прихованими міркуваннями Claude Opus 4.8 та GPT 5.6 Sol. Коли Kimi K3 отримувала початкові фрагменти міркувань американських моделей, її відповіді іноді були дуже подібними, що може свідчити про використання дистиляції — методу перенесення можливостей однієї моделі на іншу.

Водночас дослідники підкреслюють, що це не є прямим доказом навчання Kimi K3 на основі американських моделей. Інші протестовані системи, зокрема DeepSeek, такої схожості не показали. Дослідження також ілюструє, чому дистиляція стала предметом геополітичних суперечок: американські компанії вже звинувачували китайських конкурентів у використанні їхніх моделей, хоча дистиляція є поширеною технологією для пришвидшення розробки нових ШІ. Загалом робота свідчить, що приховані процеси міркування сучасних ШІ можуть бути менш захищеними, ніж вважалося раніше.