Физик и исследователь искусственного интеллекта Макс Тегмарк из Массачусетского технологического института (MIT) представил новый подход к контролю нейронных сетей на семинаре Института чистой и прикладной математики (IPAM). Он предложил не анализировать сложную внутреннюю структуру ИИ, а математически проверять понятный код, который система может самостоятельно генерировать.

В своем выступлении Тегмарк обозначил два возможных пути к созданию «надежного ИИ». Первый — это глубокое исследование механистической интерпретируемости, то есть попытка полностью понять, как работает нейросеть изнутри. Второй подход, который он считает более перспективным, заключается в формальной верификации программного кода, который ИИ способен экспортировать из своих знаний. Об этом сообщает zn.ua со ссылкой на выступление ученого.

Тегмарк объяснил, что способность нейросетей к обобщению возникает благодаря тому, что они самостоятельно открывают геометрические структуры во время обучения. Например, при решении задач на модульное сложение или оперирование днями недели внутри сети формируется круг, а числа от 0 до 99 выстраиваются в трехмерную спираль. Исследователь называет этот процесс «интеллектом через голодание» — когда ограниченные ресурсы заставляют ИИ находить оптимальные способы решения задач.

«Если у вас очень ограничены ресурсы, возможно, единственный способ выполнить интеллектуальную задачу — это найти разумный способ её решения», — отметил Макс Тегмарк.

Команда Тегмарка уже создала алгоритмы, которые автоматически анализируют внутреннюю структуру нейросетей (например, операции бинарного сложения) и преобразуют её в понятный человеку код на языке Python. Это открывает возможность формальной математической проверки такого кода на безопасность и надежность, что особенно актуально для разработчиков и регуляторов.

Для Европейского Союза этот подход может стать ключевым с учетом внедрения Закона об искусственном интеллекте (AI Act). Математическая проверка сгенерированного кода позволит компаниям соответствовать требованиям по надежности систем без чрезмерных затрат и рисков неконтролируемого поведения ИИ.

В то же время Тегмарк признает, что часть его выводов пока являются гипотезами. Во внутренней геометрии сетей до сих пор фиксируется много «шума» и аномалий: ИИ иногда строит неточные фигуры или дублирует одни и те же алгоритмы. Также пока нет четкого пути масштабирования автоматического экспорта кода на современные большие языковые модели без принципиально новых решений.