Компания Veracode опубликовала отчет GenAI Code Security Report 2026, в котором проанализирована безопасность кода, сгенерированного искусственным интеллектом. По результатам тестирования более 100 моделей, средний показатель успешности по критериям безопасности составил всего 56%, что почти не отличается от прошлогодних результатов.

Как отмечают в Veracode, модели искусственного интеллекта почти всегда создают синтаксически корректный код, который выполняет поставленные задачи. Однако это не гарантирует его безопасность: во многих случаях в таком коде остаются уязвимости. Тестирование проводилось на стандартизированных заданиях из разных языков программирования и категорий уязвимостей, без дополнительных инструкций по безопасности.

В компании подчеркивают, что 44% неудачных проверок не означают, что столько же кода в реальных проектах является уязвимым. Тесты отражают лишь конкретные условия и не учитывают дополнительные меры защиты, такие как статический анализ, корпоративные политики или проверка человеком.

Специализированные модели для программирования не показали значительного преимущества: их средний результат — 51%, тогда как универсальные модели достигли 52%. Размер модели также почти не повлиял на безопасность: большие модели набрали 53%, средние и малые — 51%. Лучше всего справились модели с режимом рассуждений (reasoning mode): 56% против 51% у остальных. Лидером рейтинга стала GPT-4.5 с результатом 68%, тогда как большинство моделей получили от 50% до 53%.

Заметная разница наблюдалась между языками программирования: Python показал самый высокий средний результат (63%), а Java — самый низкий (30%), хотя её показатели постепенно растут. Это свидетельствует, что выбор языка программирования влияет на вероятность получить безопасный код от ИИ.

Veracode рекомендует рассматривать любой код, созданный искусственным интеллектом, как непроверенный и обязательно проводить проверки безопасности перед интеграцией в основную кодовую базу, в частности анализировать зависимости. Главный вывод отчёта звучит так:

"Скорость генерации работоспособного кода не заменяет контроль, способный выявить уязвимости, которые функциональное тестирование просто не замечает."

Об этом сообщает компания Veracode в своём отчёте.