Група волонтерів, що працює над проєктом LapaLLM, натренувала велику мовну модель на базі Gemma спеціально для української мови та відкрила свої напрацювання для дослідників. Про це розповів керівник проєкту та аспірант УКУ Юрій Панів в інтерв’ю DOU.
За словами Панева, команда зараз складається з 13 людей і працює над масштабуванням: після навчання 12-мільярдної Gemma вони готуються до тренування ще більшої моделі на основі Mistral Small (120 мільярдів параметрів). Для цього вони отримали доступ до суперкомп’ютера JUPITER через програму EuroHPC, що дозволяє використовувати сучасні відеокарти з великим обсягом пам’яті. Панів зазначає, що для повноцінного розвитку українських LLM потрібен значний обсяг обчислювальних ресурсів, і команда прагне отримати мільйони нод-годин для тренування моделей такого масштабу.
LapaLLM також створила відкритий лідерборд для оцінки моделей, які працюють з українською мовою. Проте серед протестованих немає закритих API-рішень, зокрема від Anthropic, через високу вартість тестування: один прогін для API-моделі коштує близько 400–500 доларів. У майбутньому, за умови фінансування, команда планує протестувати моделі з кількістю параметрів до трьох трильйонів, включно з китайськими розробками.
Панів вважає, що потреба у власній LLM для України об’єктивна, особливо для задач, де важлива якість обробки української мови та приватність даних. Він підкреслює, що якісна модель потрібна не лише для бізнесу, а й для державних чи військових задач, а також для розвитку експертизи в країні. За його оцінкою, серед відкритих моделей найкраще з українською справляється Gemma 4 від Google, яка має великий словник і добре працює з багатьма мовами, хоча поступається у задачах математики та програмування.
«Згідно з нашими вимірюваннями, поки що це Gemma 4: і за різними задачами обробки, і за загальним стилем написання. Вона найменш „механічно перекладена“, найменше відчувається як типова мовна модель», — зазначив Панів.
Окремо він прокоментував ініціативу Мінцифри та «Київстару» зі створення української LLM «Сяйво». На його думку, міністерство виступає замовником і працює над законодавчими аспектами, а також над захистом персональних даних у ШІ-сервісах. Водночас, процес розробки «Сяйва» затягнувся, і, на думку Панева, якщо система постійно не дає результату, це може бути особливістю її дизайну. Він радить, за браку даних для універсальної моделі, зосередитися на вузькоспеціалізованих рішеннях для окремих задач.

