FreeToken запускает большие языковые модели до 753B на одной видеокарте: в 2 раза быстрее аналогов
Текст содержит разрыв в оригинале: последний пункт Key Takeaways обрезан. Работаю строго по тому, что есть.

Исследователи из Калифорнийского университета в Беркли и Техасского университета в Остине 10 июня опубликовали FreeToken, систему инференса (исполнения запросов к модели), которая запускает большие языковые модели до 753 миллиардов параметров на одной видеокарте обычного компьютера, без облака и без кластера.
Код выложен под открытой лицензией Apache 2.0, установка занимает одну команду, а результаты показывают скорость, достаточную для работы с ИИ-агентами (программами, которые сами выполняют цепочки действий) в реальном времени.
| Показатель | Значение | Источник |
|---|---|---|
| Модель Qwen3.6-35B-A3B на RTX 5090 | 77–83 токена в секунду (BF16) | статья FreeToken |
| DeepSeek-V4-Flash (284B) на RTX 5090 | 22–25 токенов в секунду (MXFP4) | статья FreeToken |
| Преимущество над лучшим аналогом | в 1,5–2,3 раза | статья FreeToken |
| GLM-5.2 (753B) на одной RTX PRO 6000 | 14,9 токена в секунду против 7,3 у llama.cpp | статья FreeToken |
| Модель 35B на ноутбучной RTX 4060 (8 ГБ) | 39,3 токена в секунду | статья FreeToken |
| Промах кэша экспертов (глобальный LRU) | 16 % против 41 % у KTransformers и 62 % у llama.cpp | статья FreeToken |
| Лицензия | Apache 2.0 | GitHub FreeToken |
Что здесь решали?
Современные большие языковые модели с архитектурой MoE (Mixture-of-Experts, «смесь экспертов», когда модель на каждый запрос включает лишь малую часть своих параметров) теоретически помещаются в память обычного компьютера. DeepSeek-V4-Flash, например, активирует только 6 из 256 экспертов на каждом слое, а значит, на один токен (минимальную единицу текста) работают 13 из 284 миллиардов параметров.
Но на практике запустить такую модель дома не получалось. Авторы выделили три конкретные причины:
- Предзаполнение убивает разреженность. Когда модель обрабатывает длинный промпт целиком, тысячи токенов задействуют почти всех экспертов сразу. Весь набор экспертов прокачивается через шину PCIe, и это занимает от двух секунд на топовой RTX 5090 до десяти и больше на ноутбуке.
- Статическое размещение не успевает за маршрутизацией. Существующие движки (llama.cpp, KTransformers, Ollama) раскладывают данные по памяти один раз при загрузке. Но маршрутизатор модели меняет набор активных экспертов при каждом новом токене, и большинство вычислений падает на процессор, пока видеокарта простаивает.
- Процессор не вытягивает остаток. Оперативная память обычного компьютера (DDR5 в двухканальном режиме) даёт 80–90 гигабайт в секунду. Видеопамять RTX 4090 или 5090 работает в 12–20 раз быстрее.
Три механизма, которые предложили авторы
FreeToken не упрощает модель и не обрезает экспертов. Вместо этого система делит работу между видеокартой и процессором пропорционально их реальной пропускной способности, замеренной на конкретной машине командой ft bench bw.
- Адаптивное разделение по пропускной способности (политика q*). Система измеряет, сколько данных одновременно могут читать шина PCIe и процессор из общей оперативной памяти. Часть промахов кэша заполняется на видеокарту, остальное считается прямо на процессоре. Два частичных результата складываются точно, без приближений.
- Кэширование с привязкой к смыслу. При предзаполнении FreeToken потоково загружает следующий слой, пока видеокарта обрабатывает текущий. Контрольные точки привязаны к границам блоков рассуждений, вызовов инструментов и ответов, именно там агентные фреймворки обрезают контекст. Редактирование промпта пересчитывает только новый «хвост», а не весь ввод. При генерации общий LRU-кэш (кэш, который вытесняет давно неиспользованные данные) охватывает все MoE-слои и следит за маршрутизатором в реальном времени.
- Эластичное управление памятью. Видеокарточный кэш экспертов перестраивается на лету, без перезапуска движка. Эксперты читаются с диска сразу в нужный формат, а первый запрос обслуживается с «холодным» кэшем, прогрев не нужен.
Что показали замеры?
- На RTX 5090 скорость декодирования Qwen3.6-35B-A3B составила 77–83 токена в секунду, это в 1,5–2,3 раза быстрее лучшего из существующих движков.
- Скорость декодирования при агентных сценариях (многошаговая работа с инструментами) отклонялась от однозапросной не более чем на 12 %.
- Худшее время до первого токена (TTFT, задержка перед началом ответа) не превысило 44 секунды ни в одном тесте. Для сравнения: llama.cpp показал 232 секунды, Ollama 179, KTransformers 946, за этими порогами клиенты агентов просто отваливаются по тайм-ауту.
- На ноутбуке с 8-гигабайтной RTX 4060 модель на 35 миллиардов параметров генерировала 39,3 токена в секунду. По данным авторов статьи, медианная скорость декодирования Codex (агентного продукта OpenAI) в рабочих трассах составляет 33,9 токена в секунду в нормализованном виде.
Все 9 из 16 заявленных результатов пока воспроизведены только авторами, независимая проверка не проводилась. Сравнение «39,3 токена в секунду быстрее Codex» сделано с нормализованным показателем 33,9, а не с чистой медианой декодирования Codex в 57,1. Формулировка «на одном GPU» скрывает требование к оперативной памяти: от 192 до 512 ГБ хостовой DRAM, это серверная или рабочая станция, не бытовой ноутбук. Базовый замер KTransformers проведён на 6 потоках процессора, хотя инструмент рассчитан на многоядерную конфигурацию с AMX-инструкциями.
Что это значит для вас?
Разработчику в РФ и СНГ. FreeToken решает конкретную проблему: облачные API крупных моделей либо недоступны из-за санкций, либо стоят дорого. Система позволяет развернуть большие языковые модели с открытыми весами (DeepSeek-V4-Flash, GLM-5.2, Qwen) локально, данные не покидают машину. Для медицины, юриспруденции, финансов, оборонки и любой работы с конфиденциальными документами это прямой путь к приватному инференсу без облака.
Автору Дзена и копирайтеру. Если вы пользуетесь локальными моделями для генерации черновиков, проверки текстов или синтетических данных, FreeToken обещает запуск 35-миллиардной модели на ноутбуке с 8 ГБ видеопамяти на скорости, комфортной для интерактивной работы. Установка через pip, без настройки кластера.
Предпринимателю и руководителю. Обратите внимание на оговорки: для моделей от 284 миллиардов параметров нужна рабочая станция с 192–512 ГБ оперативной памяти. Это не бытовой ПК, но всё равно на порядки дешевле аренды GPU-кластера. Код открыт под Apache 2.0, привязки к вендору нет.
Результаты выглядят убедительно арифметически: авторы честно показывают, что каждое число пересчитывается из их же таблиц, и прямо указывают на ограничения. Но независимого воспроизведения пока нет, и «один GPU» на практике означает рабочую станцию с полутерабайтом оперативной памяти, это стоит от 300 до 500 тысяч рублей. Для одиночного разработчика или небольшой команды в России, где доступ к облачным API крупных моделей ограничен, это всё равно выгоднее, чем месячный счёт за аренду кластера. Я рекомендую попробовать FreeToken на модели Qwen3.6-35B-A3B, если у вас есть хотя бы RTX 4060 и 64 ГБ оперативной памяти: для агентных задач на уровне кодинга и рецензирования документов этого уже хватает.
Главный вывод: не модели стали меньше, а система научилась использовать обычное железо так, как оно устроено, с учётом реальных скоростей каждой шины и каждого чипа. Для тех, кто работает с конфиденциальными данными или просто не хочет платить за облако, это первый открытый инструмент, который делает локальный запуск моделей-гигантов не демонстрацией, а рабочим режимом.
По данным статьи FreeToken (arXiv / GitHub)

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Нейросимвольный ИИ Шумского работает на CPU без GPU: что это даёт российским командам
Сергей Шумский, кандидат физико-математических наук и известный в российском IT-сообществе исследователь, предложил альтернативу трансформерной архитектуре:…

Нейросети для редактирования фото стирают «отпечаток» камеры: доказать подлинность снимка больше нельзя
Нейросети для редактирования фото обрабатывают снимок целиком, даже если вы поправили только угол кадра, и это уничтожает криминалистический след камеры,…

MCP-протокол подключили к антидетект-браузеру: ИИ-агент управляет Camoufox одним промптом
Компания-разработчик yvv4git выпустила открытый пакет go-juggler-mcp, который связывает MCP протокол (Model Context Protocol, стандарт подключения инструментов…
Комментарии