Українську національну мовну модель "Сяйво" будують на базі Gemma 3 від Google, адаптуючи її під українську мову, локальний контекст та історико-культурні особливості. Проєкт реалізує "Київстар", який відповідає за технічну інфраструктуру, фінансування та організаційні процеси.
Основним викликом є створення національного корпусу даних. Команда збирає та верифікує інформацію приблизно з 90 державних установ, наукових закладів, медіа та університетів. Зокрема, Укрдержархів надав понад 10 терабайт матеріалів — історичні документи, державні акти та наукові праці, частина яких потребує оцифрування з паперових носіїв. Розробники також оптимізують токенізатор для коректної й швидкої обробки української мови, а юридичний фреймворк визначає правила використання даних та захист інтелектуальної власності.
Для оцінки якості роботи "Сяйва" сформовано експертний комітет із понад 70 фахівців, які тестують модель за мовознавчим, культурно-історичним, етико-правовим та науково-технічним напрямами. Модель перевіряють на точність мови й контексту, безпеку — стійкість до галюцинацій, дезінформації, упереджень і відсутність дискримінаційних відповідей, а також проводять порівняльний аналіз із іншими світовими LLM у міжнародних рейтингах.
У червні 2025 року маломасштабний експериментальний прототип "Сяйва" успішно пройшов етапи pre-training, supervised fine-tuning, а також закрите бета-тестування й перевірку архітектури. Після завершення тестування та передачі проєкту державі базову версію моделі та українські датасети планують опублікувати у відкритому доступі (open source). Розробники, бізнес і науковці отримають технічний пайплайн для донавчання моделі під власні продукти.
У державному секторі "Сяйво" стане основою для майбутніх сервісів, зокрема "Дія AI", освітнього асистента у застосунку "Мрія" та інструментів для аналізу законодавства. Про це повідомляють розробники проєкту, які координують роботу над моделлю.

