Компактные языковые модели для всех
Microsoft, второго июня запустила Project Solara — операционную систему, где ИИ-агенты заменяют привычные приложения, и впервые отдала управление машине, а не пользователю.

PrismML привлекла 22,25 миллиона долларов на посевном раунде, чтобы сжимать большие языковые модели до размеров, при которых они помещаются на обычный ПК или смартфон и работают без подключения к облаку.
Свежая модель Bonsai 2 27B занимает 5,9 ГБ вместо десятков гигабайт оригинала и сохраняет 98% его результатов на бенчмарках. Если технология масштабируется на модели с сотнями миллиардов параметров, мощный ИИ может оказаться бесплатным и приватным для каждого владельца ноутбука.
Стартап PrismML пока мало кому знаком в России, но за ним стоят исследователи Калифорнийского технологического института (Caltech) и советник Ион Стоика, сооснователь Databricks и директор Sky Computing Lab в Беркли. Инвесторы посевного раунда: Khosla Ventures, Cerberus Capital и Caltech. Сумма скромная по меркам ИИ-индустрии, но ставка сделана не на размер чека, а на технологию сжатия, которая может перевернуть экономику инференса (исполнения запросов к модели).
| Параметр | Значение |
|---|---|
| Компания | PrismML |
| Сумма | 22,25 млн $ |
| Тип сделки | Посевной раунд (seed) |
| Инвесторы | Khosla Ventures, Cerberus Capital, Caltech |
| Дата релиза Bonsai 2 27B | Июнь 2025 (четверг, дата публикации источника) |
Как сжать нейросеть в десять раз и почти ничего не потерять?
PrismML берёт открытую модель (open-source) и радикально уменьшает так называемые веса (weights). Веса это информация, которую модель запомнила при обучении, что-то вроде её опыта, записанного числами. Обычно каждый вес хранится в 16 битах. PrismML применяет подход «тернарных весов»: каждый вес упрощается до одного из трёх значений: +1, 0 или −1. Хранить три варианта вместо тысяч проще в разы, поэтому файл модели сжимается в 9 или 10 раз.
Последняя модель, Bonsai 2 27B, сжимает Qwen3.8 27B от Alibaba. Qwen3.8 27B широко используется разработчиками по всему миру как открытая модель с открытыми весами. После сжатия 98% агрегированных результатов бенчмарков сохраняются. Для сравнения: первая версия Bonsai, вышедшая в марте 2025 года, сохраняла 95%.
Первую модель Bonsai скачали более 11 миллионов раз, ещё 2,6 миллиона скачиваний набрали уменьшенные версии, по данным самой компании.
Почему 2% потери не страшны на практике?
Основатель PrismML Бабак Хассиби, профессор Caltech и эксперт по технологиям сжатия, признаёт: сжатие, скорее всего, всегда будет немного снижать результаты. Однако сами бенчмарки не идеально отражают реальные задачи, а языковые модели и без сжатия далеки от абсолютной точности. Два процента потерь на бенчмарке вряд ли заметны в повседневной работе, тем более что на точность влияет и программная «обвязка», в которой модель запускается.
Это важный нюанс: речь не о «нейросети с маленькими человечками» внутри, которые ухудшают каждый ответ. Речь о математическом упрощении хранения, при котором способность модели рассуждать остаётся почти нетронутой.
Что дальше: сотни миллиардов параметров на ноутбуке?
По словам Хассиби, следующая цель PrismML: применить сжатие к моделям с сотнями миллиардов параметров. Их планируют выпустить в ближайшие пару месяцев, и основатель ожидает, что сохранить качество будет даже проще, чем с моделями поменьше.
Чем больше модель, тем больше пространства для сжатия без потери интеллекта. Для крупных моделей проще приблизиться к 100%. : Бабак Хассиби, CEO PrismML, профессор Caltech
Ион Стоика, советник PrismML и сооснователь Databricks, объясняет, почему ставка на локальный запуск принципиальна:
У вас будет интеллект под рукой, и он будет бесплатным, потому что работает на устройстве, которое вы уже купили. И он будет приватным, потому что вы не отправляете данные в облако. : Ион Стоика, сооснователь Databricks, советник PrismML
PrismML не единственный игрок на поле сжатия моделей. Источник TechCrunch упоминает Multiverse Computing, основанную профессором из испанского Donostia International Physics Center, и отмечает, что та привлекла значительно больше денег. Но PrismML выделяется тем, что её сжатые модели почти не теряют качества, а рост с 95% до 98% от версии к версии показывает, что технология улучшается.
Отдельно ходят слухи о переговорах PrismML с Apple, но Хассиби отказался комментировать это изданию TechCrunch.
Что это значит для вас?
По моим наблюдениям, главный барьер для локального ИИ в России: хорошие модели требуют мощного железа или облачной подписки. Если PrismML действительно масштабирует сжатие на модели с сотнями миллиардов параметров, мы получим нечто вроде «нейросети с маленькими человечками» на каждом ноутбуке: полноценный рассуждающий ИИ, работающий без интернета и без ежемесячных платежей. Но оговорка обязательна: пока доступна только сжатая Qwen3.8 27B, и конечный результат на задачах конкретного автора может отличаться от бенчмарков. Технология молодая, компании меньше года на рынке, а посевной раунд в 22 миллиона, это ещё не гарантия серийного продукта.
-
Авторам Дзена и копирайтерам. Модель в 5,9 ГБ помещается на большинство современных ноутбуков. Это значит: можно тестировать генерацию текстов, рерайт, структурирование статей локально, без отправки черновиков в облако и без подписки. Скачать Bonsai 2 27B можно уже сейчас на Hugging Face. Попробуйте запустить через LM Studio или Ollama, оба бесплатны.
-
Маркетологам. Приватность данных перестаёт быть проблемой: промпты (prompts, текстовые команды для модели) и клиентские тексты не покидают ваш компьютер. Для брендов с чувствительными данными это аргумент переводить рутинную аналитику текстов на локальный ИИ.
-
Предпринимателям в РФ и СНГ. Qwen от Alibaba доступна без ограничений, а значит сжатая Bonsai 2 тоже. Из доступных в РФ инструментов для локального запуска: LM Studio и Ollama. Пока PrismML не предлагает коммерческий продукт «под ключ», это инструмент для тех, кто готов потратить полчаса на установку.
Сжатая модель сохраняет 98% результатов бенчмарков, но бенчмарки не равны реальным задачам. Галлюцинации (когда ИИ уверенно выдумывает факты) никуда не деваются, а на слабом железе инференс может быть медленным. Перед тем как строить рабочий процесс на локальной модели, протестируйте её на своих задачах.
Если технология PrismML продолжит расти с той же скоростью, через пару месяцев мы можем увидеть сжатую модель уровня GPT-4 на обычном ноутбуке. Стоит уже сейчас попробовать Bonsai 2 27B на своих задачах: скачайте, запустите, оцените, хватает ли качества, и вы будете готовы к моменту, когда локальный ИИ станет нормой, а не экспериментом.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Риски искусственного интеллекта: 51% исследователей допускают катастрофу, а инсайдеры уходят из лабораторий
Компания Anthropic сообщает, что к маю 2026 года Claude написал более 80% нового кода в её основной кодовой базе, а команда из девяти ИИ-агентов за пять дней и…
Нейросеть для сжатия текста теряет оговорки и цифры: как проверять в два прохода
Почему это важно Нейросети сокращают текст быстро, но вместе с лишними словами выбрасывают условия, оговорки и причинно-следственные связи, а читатель получает…

Claude Code Projects запускает до 200 параллельных потоков: один диалог заменяет целую команду
Anthropic полностью переработала функцию Projects в Claude Code: теперь это не папка с файлами, а единый разговор, который сам разделяет задачу на параллельные…
Комментарии