Стартап PrismML презентував Bonsai 2 27B — компактну мовну модель, яка займає лише 5,9 ГБ, що у 9–10 разів менше за оригінальну Qwen3.8 27B від Alibaba. За словами компанії, нова версія зберігає приблизно 98% продуктивності початкової моделі, але може працювати навіть на звичайних комп'ютерах і потенційно на флагманських смартфонах. Про це повідомляє TechCrunch із посиланням на PrismML.

Bonsai 2 створено на основі відкритої архітектури Qwen3.8 27B. Розробники стверджують, що їхній підхід дозволив суттєво зменшити обсяг пам'яті, необхідної для роботи моделі, без значної втрати якості. Засновниками PrismML є дослідники Каліфорнійського технологічного інституту, а компанію очолює професор цього закладу та спеціаліст зі стиснення даних Бабак Хассібі. Серед радників — співзасновник Databricks Іон Стоїка, який також керує Sky Computing Lab у Каліфорнійському університеті в Берклі.

За словами Хассібі, головна перевага технології полягає не лише у зменшенні розміру моделей, а й у мінімальній втраті якості. Перша версія Bonsai, випущена у березні, досягала 95% результатів оригіналу в тестах, а Bonsai 2 — вже 98%. За даними PrismML, оригінальну Bonsai завантажили понад 11 мільйонів разів, а компактніші моделі — ще 2,6 мільйона разів.

Стиснення стало можливим завдяки зміні способу зберігання ваг моделі: замість традиційного 16-бітного представлення використано тернарні ваги, де кожен параметр може бути +1, -1 або 0. Це суттєво скорочує обсяг даних для зберігання. Хассібі зазначає, що певна втрата продуктивності неминуча, але різниця близько 2% навряд чи буде помітною для більшості користувачів.

«Інтелектуальні можливості будуть завжди під рукою, і це буде безплатно, адже модель працюватиме на пристрої, який ви вже придбали. До того ж це забезпечить конфіденційність, оскільки дані не потрібно буде надсилати в хмару», — пояснив Стоїка.

Наступною метою PrismML стане стиснення ще більших моделей із сотнями мільярдів параметрів. Хассібі вважає, що саме такі моделі можуть бути навіть більш придатними до подібної оптимізації, бо «з'являється більше можливостей для стиснення без втрати інтелектуального потенціалу».

Вибір Qwen як бази для оптимізації відображає її популярність у сфері штучного інтелекту: відкриті моделі Qwen за пів року завантажили понад 3 мільярди разів, що значно перевищує показники американських аналогів від Google та Meta на платформі Hugging Face.