Потужний ШІ тепер важить менше за гру: модель Qwen стиснули вдесятеро без втрати якості

Нова Bonsai 2 зберігає 98% продуктивності та працює на звичайних пристроях.

Стартап PrismML представив Bonsai 2 27B — компактну велику мовну модель, яка займає лише 5,9 ГБ замість десятків гігабайтів оригінальної Qwen3.8 27B від Alibaba. Компанія стверджує, що новинка зберігає близько 98% продуктивності вихідної моделі, водночас працює на звичайних комп'ютерах і потенційно на флагманських смартфонах. Розробники вважають, що потужні моделі штучного інтелекту не обов'язково мають бути великими, а локальний запуск може зробити їх дешевшими й безпечнішими для користувачів, передає TechCrunch.

Нову Bonsai 2 побудовано на основі відкритої моделі Qwen3.8 27B. За даними PrismML, завдяки новому підходу обсяг необхідної пам'яті вдалося скоротити приблизно в 9–10 разів порівняно з оригіналом.

PrismML заснували дослідники Каліфорнійського технологічного інституту, а компанію очолює професор цього вишу та фахівець із технологій стиснення даних Бабак Хассібі. До складу радників входить співзасновник Databricks Іон Стоїка, який також керує Sky Computing Lab при Каліфорнійському університеті в Берклі.

Хассібі стверджує, що головна перевага технології полягає не лише в меншому розмірі моделей, а й у мінімальній втраті якості. Якщо перша версія Bonsai, випущена в березні, демонструвала приблизно 95% результатів оригінальної моделі в бенчмарках, то Bonsai 2 вже досягла 98%. За даними компанії, оригінальну Bonsai завантажили понад 11 мільйонів разів, а ще компактніші моделі лінійки — додатково 2,6 мільйона разів.

Стиснення досягається завдяки зміні способу зберігання ваг моделі — параметрів, які містять знання, отримані під час навчання. Замість традиційного 16-бітного представлення PrismML використовує так звані тернарні ваги, де кожен параметр може набувати лише трьох значень: +1, -1 або 0.

Такий підхід суттєво зменшує обсяг даних, необхідних для зберігання моделі. За словами Хассібі, певна втрата продуктивності під час стиснення залишається неминучою, однак різниця на рівні близько 2% навряд чи матиме помітний вплив на більшість реальних сценаріїв використання.

Наступним кроком компанії стане стиснення значно більших моделей із сотнями мільярдів параметрів. Хассібі вважає, що саме великі моделі можуть виявитися навіть більш придатними до такого підходу, оскільки «з'являється більше можливостей для стиснення без втрати інтелектуального потенціалу».

«Інтелектуальні можливості будуть завжди під рукою, і це буде безплатно, адже модель працюватиме на пристрої, який ви вже придбали. До того ж це забезпечить конфіденційність, оскільки дані не потрібно буде надсилати в хмару», — пояснив Стоїка.

Вибір відкритої архітектури Qwen для подібних оптимізацій відображає її статус однієї з провідних платформ у глобальній індустрії ШІ. Раніше відкриті моделі лінійки Qwen подолали позначку в 3 мільярди завантажень за пів року, суттєво випередивши американські аналоги від Google та Meta на майданчику Hugging Face. 

Помітили помилку?

Будь ласка, виділіть її мишкою та натисніть Ctrl+Enter або Надіслати помилку

Додати коментар
Всього коментарів: 0
Текст містить неприпустимі символи
Залишилось символів: 2000
Будь ласка, виберіть один або кілька пунктів (до 3 шт.), які на Вашу думку визначає цей коментар.
Будь ласка, виберіть один або більше пунктів
Нецензурна лексика, лайка Флуд Порушення дійсного законодвства України Образа учасників дискусії Реклама Розпалювання ворожнечі Ознаки троллінгу й провокації Інша причина Відміна Надіслати скаргу ОК
Залишайтесь в курсі останніх подій!
Підписуйтесь на наш канал у Telegram
Стежити у Телеграмі