Компактные нейросети в 5,93 ГБ: Bonsai 2 сжала 27 млрд параметров в 9 раз без потери качества
Microsoft второго июня запустила Ternary Bonsai 2 27B — нет, стоп. Перечитываю источник.
Компания PrismML выпустила Ternary Bonsai 2 27B, компактную нейросеть на 27 миллиардов параметров, которая весит всего 5,93 ГБ вместо 53,8 ГБ оригинала и сохраняет 98,2% его качества по 20 тестам.
Модель построена на архитектуре Qwen3.8 27B, но каждый вес хранится в тернарном формате (принимает только три значения: минус один, ноль или плюс один), что сжимает её почти в 9,1 раза. Для русскоязычной аудитории главное: такую нейросеть можно запустить дома, на ноутбуке с 16 ГБ памяти или на одной видеокарте с 24 ГБ.
Компактные нейросети с 27 миллиардами параметров впервые помещаются в объём, который раньше занимала модель на 3 миллиарда, и при этом почти не теряют в точности. Это делает локальный запуск серьёзных ИИ-инструментов реальным без облака и подписок.
PrismML опубликовала результаты спустя два месяца после первого Bonsai 27B, тернарный вариант которого сохранял около 95% качества оригинала. Новая версия прибавила больше трёх процентных пунктов, доведя среднюю оценку по 20 бенчмаркам до 83,9 балла против 85,4 у полноразмерного Qwen3.8 27B в формате FP16 (стандартная 16-битная точность хранения весов). Результаты получены самой PrismML и пока не воспроизведены независимо.
| Показатель | Значение | Источник |
|---|---|---|
| Размер модели (PTQ1_0) | 5,93 ГБ | PrismML |
| Размер оригинала (FP16) | 53,80 ГБ | PrismML |
| Сжатие | примерно в 9,1 раза | PrismML |
| Сохранение качества (среднее по 20 тестам) | 98,2% | PrismML |
| Средний балл Bonsai 2 | 83,9 | PrismML |
| Средний балл Qwen3.8 27B FP16 | 85,4 | PrismML |
| Скорость на RTX 5090 | 142,5 токена в секунду | PrismML |
| Скорость на RTX 4090 (PTQ1_0) | 96,7 токена в секунду | PrismML |
| Скорость на Apple M5 Max | 46,8 токена в секунду | PrismML |
| Параметры | 27,36 млрд | PrismML |
| Контекстное окно | 262 000 токенов | PrismML |
| Лицензия | Apache 2.0 | PrismML |
Как устроено сжатие и что такое тернарные веса?
В обычных нейросетях каждый вес, это число с плавающей точкой, занимающее 16 бит. В тернарном формате вес принимает одно из трёх значений: минус один, ноль или плюс один. Представьте выключатель с тремя положениями вместо плавного регулятора: информации меньше, но для большинства задач этого хватает.
Каждая группа из 128 весов делит одну общую «шкалу» (масштабный коэффициент в формате FP16). Итого на один вес уходит около 1,72 бита вместо 16. Только 26,2 миллиона параметров из 27,36 миллиарда (0,0976%) остаются в повышенной точности: это нормализационные слои и рекуррентные пути.
PrismML предлагает два формата упаковки для GGUF (популярный формат хранения весов для локального запуска):
- PTQ1_0: плотная упаковка, 1,76 бита на вес, итоговый файл 5,93 ГБ
- PQ2_0: каждый трит хранится в 2-битном слоте, файл 7,25 ГБ, но распаковка проще и на ряде карт быстрее
Модель принимает и текст, и изображения. Визуальный модуль (0,47 млрд параметров) поставляется отдельным файлом на 0,63 ГБ и загружается только при работе с картинками.
Где модель обгоняет тяжёлые аналоги, а где проседает?
Компактные нейросети обычно проигрывают на сложных задачах. Bonsai 2 подтверждает это правило, но с нюансами.
Сильные стороны (цифры PrismML):
- На математическом тесте AIME26 Bonsai 2 набирает 95,83 балла. Для сравнения: IQ2_XXS-квантизация (другой способ сжатия) того же Qwen3.8 27B при 7,3 ГБ набирает 78,6
- На тесте программирования LiveCodeBench v6 разрыв ещё заметнее: 90,07 против 70,05
Слабые стороны:
- Зрение сохраняет 96,3% качества оригинала, знания и рассуждения 96,9%
- Длительные агентные задачи проседают заметно: на Terminal-Bench 2.1 результат 52,8 против 69,7 у оригинала, на SWE-bench Verified (тест на реальное исправление багов в коде) 60,8 против 80,6. Это около 75% сохранения, и оба теста не входят в среднюю по 20 бенчмаркам
- Режим пониженных усилий рассуждения (low effort) не поддерживается; при среднем усилии (medium effort) средний балл 79,3 против 82,6 у FP16
Скорость на реальном железе
PrismML публикует замеры скорости при генерации по одному запросу (batch size 1) на собственных ядрах. Дата замеров: 16 сентября 2026 года.
- RTX 5090: 142,5 токена в секунду, 0,582 мВт·ч на токен
- RTX 4090 (PTQ1_0): 96,7 токена в секунду
- L4 (72 Вт): 32,1 токена в секунду
- Apple M5 Max: 46,8 токена в секунду
- Apple M5 Pro: 27,7 токена в секунду
Формат PTQ1_0 быстрее на картах поколения Ada и L4. PQ2_0 обгоняет на Blackwell, Hopper, Ampere и Apple Silicon, а при обработке длинных промптов (подсказок для модели) выигрывает везде.
PrismML также заявляет о 40% лучшей энергоэффективности по сравнению с полноразмерной 8-миллиардной моделью.
Все цифры качества и скорости получены самой PrismML и не воспроизведены независимо. Средний показатель 98,2% скрывает неравномерность: на агентных задачах удержание падает до 75%. Режим пониженных усилий рассуждения отсутствует. Запуск требует форка llama.cpp от PrismML: стандартная версия llama.cpp файлы PTQ1_0 и PQ2_0 не откроет.
Как это запустить?
Для запуска нужен форк llama.cpp от PrismML. Стандартный llama.cpp не поддерживает форматы PTQ1_0 и PQ2_0 и отклонит файлы.
Путь запуска: репозиторий Bonsai-demo, команды ./setup.sh, затем ./scripts/start_llama_server.sh. После этого чат, работа с изображениями и вызов инструментов доступны по адресу localhost:8080.
На Mac доступен пакет MLX со своим загрузчиком. Есть также демо через WebGPU прямо в браузере.
Лицензия Apache 2.0 позволяет коммерческое использование.
Что делать с этим прямо сейчас?
Автору Дзена и копирайтеру. Модель на 27 миллиардов параметров, помещающаяся в 6 ГБ, означает, что локальный ИИ-помощник для текстов и кода перестаёт требовать мощного сервера. Если у вас ноутбук с 16 ГБ оперативной памяти, вы можете запустить Bonsai 2 и использовать его для черновиков, рерайта, генерации идей без облачной подписки и без отправки данных на внешние серверы.
Маркетологу. Контекстное окно в 262 000 токенов (токен, это примерно три четверти слова) позволяет загрузить в модель десятки страниц брифа, аналитики или переписки целиком. Однако на длинных агентных сценариях (автоматическая цепочка действий) качество падает до 75% от оригинала: для автоматизации сложных воронок пока рано, для анализа текстов и генерации контента, вполне рабочий вариант.
Предпринимателю в РФ. Веса открыты под Apache 2.0, скачать и запустить можно из России. Из доступных в РФ аналогов для локального запуска: YandexGPT работает только через API, GigaChat тоже. Bonsai 2 на открытых весах, это редкая возможность иметь мощную модель полностью на своём оборудовании. Порог входа: видеокарта RTX 4090 (около 96,7 токена в секунду) или ноутбук Apple с чипом M-серии.
Компактные нейросети на тернарных весах, это не лабораторная диковинка, а рабочий инструмент. По моим наблюдениям, для 80% задач контент-автора (генерация черновиков, суммаризация, простой код) потеря 1,8% качества незаметна. Настоящая проблема в другом: запуск привязан к форку от PrismML, а не к стандартному llama.cpp. Это значит, что вы зависите от одной команды в обновлениях и совместимости. Я бы подождал, пока сообщество перенесёт поддержку тернарных форматов в основную ветку llama.cpp, и тогда переводил бы локальные задачи на Bonsai 2. А пока, попробовать через WebGPU-демо в браузере, чтобы оценить качество ответов на своих промптах, можно уже сегодня.
Шесть гигабайт вместо пятидесяти четырёх при сохранении 98% качества, это та точка, после которой аргумент «у меня слабое железо для локального ИИ» перестаёт работать для большинства пользователей с видеокартой от RTX 4090 и выше.
По данным Marktechpost

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Google расширяет команду по ИИ и экономике
Google собрала команду нобелевских лауреатов и ведущих экономистов, чтобы в реальном времени отслеживать, как искусственный интеллект от Google меняет рынок…
OpenAI и Microsoft знали о «краже труда»: рассекреченные документы раскрыли масштаб
OpenAI и Microsoft годами знали, что их модели разрушают экономику веб-издателей и создателей контента, но продолжали скрейпить данные ради коммерческой…
MIT Technology Review назвал реальную опасность ИИ: не апокалипсис, а кибератаки и потеря контроля
Почему это важно MIT Technology Review впервые собрал в одном материале конкретные сценарии, при которых ИИ может причинить массовый вред: от кибератак на…
Комментарии