Needle 2 весит 14 МБ и работает без GPU: лёгкие нейросети дошли до умных часов
Считаю лид: «Компания Cactus Compute в июне 2025 года выпустила Needle 2, открытую нейросеть на 45 миллионов параметров, которая умещается в файл размером 14 мегабайт и запускается без видеокарты на любом устройстве, от умных часов до роутера.» — Кто (Cactus Compute), глагол (выпустила), что (Needle 2), почему сейчас (в июне 2025 года), одно придаточное. Считаю слова: Компания(1) Cactus(2) Compute(3) в(4) июне(5) 2025(6) года(7) выпустила(8) Needle(9) 2(10) открытую(11) нейросеть(12) на(13) 45(14) миллионов(15) параметров(16) которая(17) умещается(18) в(19) файл(20) размером(21) 14(22) мегабайт(23) и(24) запускается(25) без(26) видеокарты(27) на(28) любом(29) устройстве(30) от(31) умных(32) часов(33) до(34) роутера(35). — 35 слов. Подлежащее первым. Одно придаточное. Ок.

Компания Cactus Compute в июне 2025 года выпустила Needle 2, открытую нейросеть на 45 миллионов параметров, которая умещается в файл размером 14 мегабайт и запускается без видеокарты на любом устройстве, от умных часов до роутера.
Лёгкие нейросети такого класса впервые позволяют запускать полноценный вызов функций прямо на микроконтроллере или дешёвом смартфоне, без облака, без GPU и без установки среды выполнения.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Needle 2, модель для вызова функций (tool calling) и извлечения структурированных данных | Июнь 2025 | Cactus Compute | Открытые веса (open weights), бесплатно |
По данным Cactus Compute, модель решает узкую, но критически востребованную задачу: превращает голосовую команду или текстовый запрос в вызов конкретной функции на устройстве. Разработчики прямо заявляют, что для этого не нужны «знания о мире» и генерация свободного текста, поэтому 45 миллионов параметров здесь достаточно. Релиз вышел на фоне растущего спроса на лёгкие нейросети, способные работать автономно на «железе» без выделенных ИИ-ускорителей.
Что умеет Needle 2?
-
Один файл, без установки. Модель поставляется как единый бинарный файл на 14 МБ. Внутри собственный C++-движок Cactus Compute, не нужно ставить Python, PyTorch или другую среду. Полная сессия занимает около 28 МБ оперативной памяти.
-
Скорость на слабом «железе». По данным разработчиков, скорость декодирования составляет 500 токенов (токен, минимальная единица текста для нейросети, примерно 3/4 слова) в секунду на Raspberry Pi 5, от 400 до 1 500 токенов в секунду на VR-гарнитурах Meta Quest 3S и Apple Vision Pro, и от 300 до 700 токенов в секунду на смартфонах дешевле 200 долларов.
-
Квантизация «из коробки». Веса хранятся в формате CQ2 (2 бита), причём квантизация (сжатие числовых значений для экономии памяти) применяется не после обучения, а прямо во время него. Это значит, что развёрнутая модель тождественна обученной, без потерь при конвертации.
-
Грамматический фильтр по JSON-схеме. Движок компилирует вашу JSON-схему (описание структуры данных) в байтовую грамматику и проверяет каждый генерируемый токен. По данным Cactus Compute, это позволяет пропускать до 98% лексики на структурных токенах, что ещё ускоряет инференс (процесс работы модели, когда она выдаёт ответ).
-
Фиксированный потолок памяти. Окно внимания ограничено 256 токенами со скользящим механизмом. Описания инструментов закрепляются как постоянные ключи. Память остаётся на уровне 28 МБ независимо от длины диалога.
-
Встроенный показатель уверенности. Каждый ответ содержит значение confidence. Если запрос не по теме или уверенность ниже порога, модель возвращает пустой вызов и явно сигнализирует: «передай в облако». Это делает эскалацию из локального режима в облачный управляемым продуктовым решением, а не случайностью.
-
Извлечение нужных инструментов. До пяти инструментов подключаются напрямую. Если их больше пяти, контрастивная голова извлечения (retrieval head) автоматически отбирает пять наиболее подходящих. Остальные не просто маловероятны, они полностью недоступны модели в данном запросе.
Где Needle 2 уже работает?
По заявлению Cactus Compute, компания Pebble уже запускает Needle 2 локально в приложении Index 01 для офлайн-голосовых действий. Готовые сборки доступны для macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS, watchOS, tvOS и WebAssembly.
Целевые сценарии, по описанию разработчиков: умный дом, носимая электроника (wearables), дешёвые смартфоны, автомобильные системы управления салоном, сервисная робототехника, кассовые терминалы, роутеры, IP-камеры и любые регулируемые среды, где звук не должен покидать устройство.
Как попробовать?
- Перейдите в репозиторий Needle 2 на GitHub (ссылка в карточке модели на Hugging Face) и скачайте готовый бинарный файл для вашей платформы.
- Опишите свои инструменты в JSON-схеме и передайте их движку, он сам скомпилирует грамматику.
- Отправьте текстовый или голосовой запрос и получите структурированный вызов функции с показателем уверенности.
Установка среды выполнения не требуется, файл запускается напрямую.
Сравнение с российскими аналогами
Needle 2 решает задачу, для которой YandexGPT и GigaChat не предназначены напрямую. Обе российские модели работают через облако, требуют подписки или API-ключа и ориентированы на генерацию текста, а не на вызов функций на устройстве без интернета.
| Параметр | Needle 2 | YandexGPT / GigaChat |
|---|---|---|
| Где работает | Локально, без сети | Только через облако |
| Размер | 14 МБ, 28 МБ RAM | Облачная модель, размер неизвестен |
| Задача | Вызов функций, извлечение полей | Генерация текста, диалог |
| GPU / NPU | Не требуется | Серверная инфраструктура |
| Офлайн-режим | Да | Нет |
Если вы разрабатываете устройство для российского рынка и хотите локальный ИИ для голосовых команд, Needle 2 на данный момент не имеет прямого отечественного аналога в сегменте лёгких нейросетей для встраиваемых систем.
На мой взгляд, Needle 2 интересна не рекордами бенчмарков, а самой постановкой задачи. Команда честно говорит: мы не делаем универсальную модель, мы делаем конвертер из человеческой фразы в машинный вызов, и для этого 45 миллионов параметров хватает. Это зрелый инженерный подход.
Для автора Дзена или маркетолога прямой пользы пока мало: модель не генерирует тексты и не ведёт диалог. Но если вы предприниматель или разработчик в России и строите IoT-устройство, умную колонку, кассовый терминал или носимый гаджет, Needle 2 стоит протестировать сегодня. 14 МБ, отсутствие зависимости от облака и поддержка RISC-V делают её реальным кандидатом для встраивания.
Оговорка: на бенчмарке BFCL v4 (общий набор корпоративных API) модель отстаёт от конкурентов. Cactus Compute объясняет это тем, что их обучающие данные сфокусированы на потребительских устройствах, а не на произвольных API. Это значит, что для серверных микросервисов она не подойдёт.
Что сделать сегодня: скачайте бинарник с GitHub, подготовьте JSON-схему для пяти базовых команд вашего устройства и замерьте скорость на реальном «железе». Если confidence-порог работает стабильно, у вас готовый офлайн-слой без единой строчки на Python.
Частые вопросы
Needle 2 может писать тексты или вести диалог?
Нет. Модель заточена под одну задачу: принять текстовую или голосовую команду и преобразовать её в структурированный вызов функции. Генерация свободного текста, ответы на вопросы и ведение диалога не входят в её возможности.
Нужен ли интернет для работы?
Нет. Весь инференс происходит локально. Модель не скачивает данные во время работы. Подключение к сети может понадобиться только в случае эскалации: когда показатель уверенности ниже заданного порога, устройство само решает передать запрос в облако.
На каком «железе» это реально запустить?
По данным Cactus Compute, модель работает на Raspberry Pi 5, смартфонах дешевле 200 долларов, VR-гарнитурах, умных часах (watchOS) и даже на платах с архитектурой RISC-V и MIPS32. GPU и NPU (специализированный ИИ-ускоритель) не требуются. Полная сессия занимает около 28 МБ оперативной памяти.
Для тех, кто строит устройства с локальным ИИ в России, Needle 2 снимает главный барьер: теперь не нужно закладывать в «железо» дорогой ускоритель или зависеть от облачного API, который может стать недоступным.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Защита данных LLM на практике: как встроить фильтр без потери стриминга
Компания, стоящая за Guardrails Filter, столкнулась с тем, что замаскировать персональные данные в запросах к большой языковой модели (LLM, нейросеть, которая…

Fine tuning нейросети за вечер: дообучаем модель в Colab бесплатно методом LoRA
Дообучение (fine-tuning) нейросети для задач логического рассуждения на русском языке звучит сложно, но Google Colab, открытый датасет и метод LoRA позволяют…

Что нового в модели Omni
Контент не содержит достаточной фактической базы для написания новости по формату research. Оригинал представляет собой промо-интервью без цифр, бенчмарков,…
Комментарии