Китайська компанія ByteDance працює над новою великою мовною моделлю, яка може досягти 10 трильйонів параметрів і стати найбільшою у світі. Наразі модель перебуває на ранніх стадіях тренування, яке може тривати до шести місяців, повідомляє Financial Times.
Найбільші наразі відомі моделі у світі належать американському стартапу Anthropic. Хоча компанія не розкриває точну кількість параметрів, експерти оцінюють, що модель Mythos має близько 8 трильйонів параметрів, а Fable — близько 5 трильйонів. Найбільша китайська модель Kimi K3 від Moonshot налічує приблизно 3 трильйони параметрів.
ByteDance планує перевершити ці показники з новою LLM, яка зараз проходить попереднє навчання. Після цього знадобиться додатковий час на доопрацювання та запуск моделі. Водночас кількість параметрів не є єдиним критерієм якості: успіх залежатиме також від якості тренувальних даних і методів навчання.
Цей крок ByteDance відображає ширші тенденції, за якими китайські ШІ-лабораторії активно наздоганяють західних конкурентів, таких як Anthropic, OpenAI та Google. Інші китайські компанії також розробляють великі моделі, а деякі вже випущені, як Kimi K3, не поступаються за масштабом і потенціалом американським аналогам.
Цікаво, що ByteDance не застосовує процес дистиляції, коли для навчання використовують вже готові великі моделі власного виробництва або конкурентів. Керівництво компанії вважає, що лише незалежна розробка дозволить створити модель, яка перевершить конкурентів.

