Компанія NVIDIA анонсувала нову модель штучного інтелекту з 30 мільярдами параметрів, яка завдяки архітектурі Mixture-of-Experts активує лише 3 мільярди параметрів для кожного токена. Про це повідомляє rbc.ua з посиланням на офіційні матеріали компанії.

Завдяки такому підходу модель забезпечує продуктивність великих систем при витратах ресурсів, характерних для менших моделей. Серед основних характеристик: швидкість генерації у чотири рази вища, ніж у аналогів такого ж розміру; точність досягає 86% на тесті PinchBench; виконання 10 000 завдань відбувається на 30% швидше, ніж у Qwen3.6 35B. Модель підтримує speculative decoding для прискореної перевірки токенів і використовує формат квантування NVFP4, що дозволяє ефективно працювати на чипах Blackwell, Hopper і Ampere.

Як зазначає NVIDIA, сучасні розробки часто використовують кілька моделей одночасно: великі нейромережі, такі як Nemotron 3 Ultra, відповідають за планування і складні рішення, а Nemotron 3.5 Lightning — за повторювані операції, перевірку результатів, виконання команд і форматування даних. Для автоматичного розподілу завдань компанія випустила бібліотеку NeMo Switchyard, яка аналізує складність запиту і перенаправляє прості інструкції меншій моделі. За словами розробників, це дозволяє суттєво економити обчислювальні ресурси.

Модель оптимізована для середовищ OpenClaw і Hermes Agent, а також підтримує стек безпеки NVIDIA NemoClaw. Її можна швидко і недорого розгортати за допомогою інструментів NeMo Automodel або NeMo Megatron Bridge. У комплекті постачається відкритий датасет Nemotron-RL Agentic Terminal Pivot для підготовки ШІ-кодерів.

Модель можна запускати локально на DGX Spark, Jetson та ПК з відеокартами GeForce RTX 5090. Код, вагові коефіцієнти і датасети доступні за ліцензією OpenMDW-1.1.