Стартап PrismML представил Bonsai 2 27B — компактную крупную языковую модель, которая занимает всего 5,9 ГБ вместо десятков гигабайт оригинальной Qwen3.8 27B от Alibaba. Компания утверждает, что новинка сохраняет около 98% производительности исходной модели, при этом работает на обычных компьютерах и потенциально на флагманских смартфонах. Разработчики считают, что мощные модели искусственного интеллекта не обязательно должны быть большими, а локальный запуск может сделать их дешевле и безопаснее для пользователей, передает TechCrunch.
Новая Bonsai 2 построена на основе открытой модели Qwen3.8 27B. По данным PrismML, благодаря новому подходу объем необходимой памяти удалось сократить примерно в 9–10 раз по сравнению с оригиналом.
PrismML была основана исследователями Калифорнийского технологического института, а компанию возглавляет профессор этого вуза и специалист по технологиям сжатия данных Бабак Хассиби. В состав советников входит соучредитель Databricks Ион Стоика, который также руководит Sky Computing Lab при Калифорнийском университете в Беркли.
Хассиби утверждает, что главное преимущество технологии заключается не только в меньшем размере моделей, но и в минимальной потере качества. Если первая версия Bonsai, выпущенная в марте, демонстрировала примерно 95% результатов оригинальной модели в бенчмарках, то Bonsai 2 уже достигла 98%. По данным компании, оригинальную версию Bonsai скачали более 11 миллионов раз, а ещё более компактные модели линейки — дополнительно 2,6 миллиона раз.
Сжатие достигается благодаря изменению способа хранения весов модели — параметров, содержащих знания, полученные в процессе обучения. Вместо традиционного 16-битного представления PrismML использует так называемые тернарные веса, где каждый параметр может принимать только три значения: +1, -1 или 0.
Такой подход существенно уменьшает объем данных, необходимых для хранения модели. По словам Хассиби, некоторая потеря производительности при сжатии остается неизбежной, однако разница на уровне около 2% вряд ли окажет заметное влияние на большинство реальных сценариев использования.
Следующим шагом компании станет сжатие значительно более крупных моделей с сотнями миллиардов параметров. Хассиби считает, что именно крупные модели могут оказаться даже более подходящими для такого подхода, поскольку «появляется больше возможностей для сжатия без потери интеллектуального потенциала».
«Интеллектуальные возможности будут всегда под рукой, и это будет бесплатно, ведь модель будет работать на устройстве, которое вы уже приобрели. К тому же это обеспечит конфиденциальность, поскольку данные не нужно будет отправлять в облако», — объяснил Стоика.
Выбор открытой архитектуры Qwen для подобных оптимизаций отражает её статус одной из ведущих платформ в глобальной индустрии ИИ. Ранее открытые модели линейки Qwen преодолели отметку в 3 миллиарда загрузок за полгода, существенно опередив американские аналоги от Google и Meta на платформе Hugging Face.
