Стартап PrismML представил Bonsai 2 27B — компактную языковую модель, занимающую всего 5,9 ГБ, что в 9–10 раз меньше оригинальной Qwen3.8 27B от Alibaba. По словам компании, новая версия сохраняет около 98% производительности исходной модели, но может работать даже на обычных компьютерах и потенциально на флагманских смартфонах. Об этом сообщает TechCrunch со ссылкой на PrismML.

Bonsai 2 создана на основе открытой архитектуры Qwen3.8 27B. Разработчики утверждают, что их подход позволил существенно уменьшить объем памяти, необходимой для работы модели, без значительной потери качества. Основателями PrismML являются исследователи Калифорнийского технологического института, а компанию возглавляет профессор этого учреждения и специалист по сжатию данных Бабак Хассиби. Среди советников — сооснователь Databricks Ион Стоика, который также руководит Sky Computing Lab в Калифорнийском университете в Беркли.

По словам Хассиби, главное преимущество технологии заключается не только в уменьшении размера моделей, но и в минимальной потере качества. Первая версия Bonsai, выпущенная в марте, достигала 95% результатов оригинала в тестах, а Bonsai 2 — уже 98%. По данным PrismML, оригинальную Bonsai загрузили более 11 миллионов раз, а компактные модели — ещё 2,6 миллиона раз.

Сжатие стало возможным благодаря изменению способа хранения весов модели: вместо традиционного 16-битного представления использованы тернарные веса, где каждый параметр может быть +1, -1 или 0. Это существенно сокращает объем данных для хранения. Хассиби отмечает, что определённая потеря производительности неизбежна, но разница около 2% вряд ли будет заметна для большинства пользователей.

«Интеллектуальные возможности всегда будут под рукой, и это будет бесплатно, так как модель будет работать на устройстве, которое вы уже приобрели. К тому же это обеспечит конфиденциальность, поскольку данные не нужно будет отправлять в облако», — объяснил Стоика.

Следующей целью PrismML станет сжатие ещё больших моделей с сотнями миллиардов параметров. Хассиби считает, что именно такие модели могут быть даже более пригодны для подобной оптимизации, поскольку «появляется больше возможностей для сжатия без потери интеллектуального потенциала».

Выбор Qwen в качестве базы для оптимизации отражает её популярность в сфере искусственного интеллекта: открытые модели Qwen за полгода загрузили более 3 миллиардов раз, что значительно превышает показатели американских аналогов от Google и Meta на платформе Hugging Face.