Игорь Градов
Игорь Градов
6 мин
ai

FreeToken запускает модели на 284 млрд параметров на RTX 4060: агенты больше не падают по таймауту

Freetoken позволяет запускать большие разреженные модели (MoE) на обычном пользовательском железе вроде RTX 4060 и получать скорость, достаточную для реальных агентных сценариев, где существующие движки зависают или падают по таймауту.

FreeToken запускает модели на 284 млрд параметров на RTX 4060: агенты больше не падают по таймауту
Почему это важно

Локальный инференс (запуск модели на своём компьютере) упирался не в мощность видеокарты, а в софт: существующие движки не умели эффективно использовать всю машину целиком. FreeToken решает именно эту задачу и делает агентные сценарии работоспособными на бюджетном железе.

Движок FreeToken создан командой, которая ранее разработала vLLM и SGLang. Он ориентирован на MoE-модели (Mixture of Experts, модели со смесью экспертов, где на каждый токен работает только малая часть параметров, а не все сразу). Главная проблема, которую он решает: при многошаговых агентных задачах существующие решения (llama.cpp, KTransformers) теряют минуты на каждом шаге, потому что не умеют оркестрировать GPU, CPU, оперативную память и шину между ними как единое целое.

По замерам авторов на реальных агентных сессиях (не одиночных промптах), худшее время до первого токена (TTFT, time to first token, задержка между запросом и началом ответа) составило 44 секунды у FreeToken против 232 у llama.cpp и 946 у KTransformers. При этом 946 секунд не просто «медленно»: стандартный таймаут агентных оболочек составляет от двух до десяти минут, и агент просто падает, не дождавшись ответа.

Что понадобится

  • Видеокарта NVIDIA с поддержкой CUDA (минимум RTX 4060 с 8 ГБ видеопамяти, подойдёт и ноутбучная версия)
  • Оперативная память от 32 ГБ (неактивные эксперты модели живут именно в ней)
  • Python 3.10+ и актуальные драйверы NVIDIA
  • Сама модель в формате, поддерживаемом FreeToken (например, DeepSeek-V4-Flash в квантизации FP4)
  • Время на установку и первый запуск: 20-40 минут в зависимости от скорости интернета и опыта

Как работает MoE и почему это даёт шанс обычному железу?

В обычной плотной модели (dense) каждый параметр участвует в обработке каждого токена (токен, минимальная единица текста для модели, примерно три четверти слова). Модель на 30 миллиардов параметров честно читает из памяти все 30 миллиардов весов на каждый токен.

В MoE-модели слои разбиты на множество «экспертов», и маршрутизатор на каждом токене выбирает лишь небольшую группу. Модель вида «30B-A3B» содержит 30 миллиардов параметров, но активных на каждый токен только 3 миллиарда. Память нужна под все параметры, а вычисления идут только на активных.

Для примера: DeepSeek-V4-Flash активирует 6 экспертов из 256 в каждом из 43 слоёв. В обработке одного токена участвует 13 миллиардов параметров из 284 миллиардов. Активный след в деплойной точности укладывается в 32 ГБ видеопамяти RTX 5090.

Где ломаются существующие движки?

Авторы FreeToken выделяют три проблемы, и каждая объясняет, почему агентные задачи вешают систему.

Проблема первая: на префилле разреженность исчезает. При генерации (декоде) каждый токен проходит через несколько экспертов. При префилле (когда модель «жуёт» весь входной контекст перед ответом) токенов тысячи, их маршруты покрывают практически все эксперты, и модель ведёт себя как плотная. Для DeepSeek-V4-Flash в FP4 это означает прогон около 140 ГБ весов через шину:

  • RTX 5090, PCIe 5.0 x16 (~60 ГБ/с): около 2 секунд
  • RTX 4090 / 3090, PCIe 4.0 x16 (~25 ГБ/с): около 5 секунд
  • Ноутбучные линки x8: 10 секунд и больше

Проблема вторая: в агентных сценариях префилл происходит заново на каждом шаге. В обычном чате TTFT незаметен. В агенте контекст включает системный промпт, историю диалога, содержимое файлов и выводы предыдущих вызовов инструментов. Десять вызовов инструментов подряд, десять префиллов на растущем контексте. Контекст в замерах авторов достигал от 56 до 65 тысяч токенов.

Проблема третья: существующие движки не умеют загружать GPU, CPU, память и шину параллельно. Движок, который тянет экспертов по требованию, выставляет всё окно ожидания как чистый простой GPU.

Пошаговая инструкция

  1. Убедитесь, что драйверы NVIDIA актуальны. Проверьте версию:
nvidia-smi

Нужна версия драйвера 535+ и CUDA 12.1+.

  1. Установите FreeToken. Клонируйте репозиторий и установите зависимости:
git clone https://github.com/freetoken-project/freetoken
cd freetoken
pip install -e .
  1. Скачайте модель. Например, DeepSeek-V4-Flash в поддерживаемом формате квантизации. FreeToken работает с MoE-моделями, где неактивные эксперты размещаются в оперативной памяти хоста.

  2. Запустите сервер инференса. Укажите путь к модели и параметры вашего железа:

freetoken serve --model /path/to/model --gpu-memory-limit 8G
  1. Отправьте запрос. FreeToken поднимает API-совместимый эндпоинт, к которому можно подключить агентную оболочку (OpenCode, Claude Code) или просто отправить запрос через curl:
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "deepseek-v4-flash", "messages": [{"role": "user", "content": "Объясни разницу между dense и MoE моделями"}]}'
  1. Подключите агентную оболочку. Настройте OpenCode или другой агентный фреймворк на локальный эндпоинт FreeToken вместо облачного API.
Что получается на практике

На ноутбучной RTX 4060 с 8 ГБ видеопамяти и урезанным вдвое PCIe-линком авторы получили 39.3 токена в секунду на 35-миллиардной модели. По данным авторов, это быстрее медианной скорости декода Codex в продакшене. В многотуровой агентной сессии OpenClaw на 13 ходов худший TTFT составил 44 секунды вместо 232 (llama.cpp) и 946 (KTransformers). Агент не падал по таймауту и стабильно завершал задачу.

Частые ошибки
  • Ориентироваться на средний tok/s вместо худшего TTFT. Средняя скорость генерации может выглядеть нормально, но агент всё равно падает, потому что зависает на одном из префиллов. Смотрите именно на worst-case TTFT.
  • Недооценивать объём оперативной памяти. Неактивные эксперты живут в RAM хоста. Для крупных MoE-моделей 16 ГБ оперативной памяти не хватит, нужно от 32 ГБ.
  • Путать результаты однопромптовых бенчмарков с реальной агентной нагрузкой. Движок может показывать отличную скорость на одиночном запросе и полностью провалиться на многотуровой сессии с растущим контекстом.
  • Запускать без проверки ширины PCIe-линка. Ноутбучные x8-линки вдвое медленнее десктопных x16. FreeToken справляется и с ними, но учитывайте это при выборе модели и квантизации.

Что делать с этим прямо сейчас?

Авторам Дзена и копирайтерам. FreeToken пока ориентирован на разработчиков, но если вы уже экспериментируете с локальными моделями для генерации черновиков или рерайта, переход на FreeToken с MoE-моделью даст заметно более стабильную работу. Особенно если вы используете агентные сценарии, где модель сама ищет информацию и редактирует текст в несколько шагов.

Разработчикам и техническим специалистам в РФ. Это прямой инструмент: если вы строите агентные пайплайны на бюджетном железе и сталкиваетесь с таймаутами, FreeToken стоит протестировать первым делом. RTX 4060, самая массовая карта по данным Steam Hardware Survey за июнь 2026 (доля 3.81%), оказывается достаточной для работы с моделями класса 35B.

Предпринимателям. Локальный инференс на потребительском железе снижает зависимость от облачных API и подписок. Для задач, где данные не должны уходить за периметр компании, FreeToken позволяет обойтись без аренды серверов с дорогими GPU. Из российских облачных альтернатив для сравнения доступны API YandexGPT и GigaChat, но они работают только через облако.

Мнение редакции dzen.guru

По моим наблюдениям, главный барьер локального ИИ для большинства авторов и предпринимателей не железо, а сложность настройки. FreeToken этот барьер не убирает полностью: установка требует командной строки и понимания, что такое квантизация. Но сам факт, что на карточке за условные 30 тысяч рублей можно стабильно запускать агентные сценарии, которые раньше требовали серверного оборудования, я считаю существенным сдвигом. Честная оговорка: проект молодой, документация пока лаконична, и для некоторых моделей могут потребоваться ручные настройки. Перед переносом рабочих задач на FreeToken протестируйте его на некритичных сценариях.

Дискретные GPU, по данным авторов FreeToken, стоят в более чем ста миллионах пользовательских машин. Софт, который превращает обычный ноутбук в платформу для агентного инференса, до сих пор отставал от железа. FreeToken закрывает именно этот разрыв, и если у вас RTX 4060 или старше, проверить стоит уже сейчас.

Научитесь работать с ИИ-инструментами на практике

В dzen.guru мы разбираем нейросети, которые реально помогают авторам и предпринимателям, без лишней теории

Попробовать dzen.guru
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Mojo 1.0: язык программирования со скоростью C++ и синтаксисом Python стал стабильным
ai

Mojo 1.0: язык программирования со скоростью C++ и синтаксисом Python стал стабильным

Компания Modular 11 августа 2026 года выпустила Mojo 1.0, первую стабильную версию языка программирования, который позволяет писать высокопроизводительный код…

5 мин
Умный календарь Linkdaze за $120 без подписки: фото рецепта становится списком покупок
ai

Умный календарь Linkdaze за $120 без подписки: фото рецепта становится списком покупок

Компания Linkdaze выпустила настенный планшет-календарь, который объединяет расписания всей семьи из разных сервисов и умеет превращать фото бумажного рецепта…

4 мин
Нейросеть Ox Alpha появилась анонимно и бесплатно: никто не знает, кто за ней стоит
ai

Нейросеть Ox Alpha появилась анонимно и бесплатно: никто не знает, кто за ней стоит

Загадочная нейросеть Ox Alpha появилась на OpenRouter в четверг и вызвала волну спекуляций в сообществе: никто не знает, кто за ней стоит, а Stripe CEO Патрик…

4 мин