Игорь Градов
Игорь Градов
6 мин
ai

FreeToken запускает большие языковые модели до 753B на одной видеокарте: в 2 раза быстрее аналогов

Текст содержит разрыв в оригинале: последний пункт Key Takeaways обрезан. Работаю строго по тому, что есть.

FreeToken запускает большие языковые модели до 753B на одной видеокарте: в 2 раза быстрее аналогов

Исследователи из Калифорнийского университета в Беркли и Техасского университета в Остине 10 июня опубликовали FreeToken, систему инференса (исполнения запросов к модели), которая запускает большие языковые модели до 753 миллиардов параметров на одной видеокарте обычного компьютера, без облака и без кластера.

Код выложен под открытой лицензией Apache 2.0, установка занимает одну команду, а результаты показывают скорость, достаточную для работы с ИИ-агентами (программами, которые сами выполняют цепочки действий) в реальном времени.

Показатель Значение Источник
Модель Qwen3.6-35B-A3B на RTX 5090 77–83 токена в секунду (BF16) статья FreeToken
DeepSeek-V4-Flash (284B) на RTX 5090 22–25 токенов в секунду (MXFP4) статья FreeToken
Преимущество над лучшим аналогом в 1,5–2,3 раза статья FreeToken
GLM-5.2 (753B) на одной RTX PRO 6000 14,9 токена в секунду против 7,3 у llama.cpp статья FreeToken
Модель 35B на ноутбучной RTX 4060 (8 ГБ) 39,3 токена в секунду статья FreeToken
Промах кэша экспертов (глобальный LRU) 16 % против 41 % у KTransformers и 62 % у llama.cpp статья FreeToken
Лицензия Apache 2.0 GitHub FreeToken

Что здесь решали?

Современные большие языковые модели с архитектурой MoE (Mixture-of-Experts, «смесь экспертов», когда модель на каждый запрос включает лишь малую часть своих параметров) теоретически помещаются в память обычного компьютера. DeepSeek-V4-Flash, например, активирует только 6 из 256 экспертов на каждом слое, а значит, на один токен (минимальную единицу текста) работают 13 из 284 миллиардов параметров.

Но на практике запустить такую модель дома не получалось. Авторы выделили три конкретные причины:

  • Предзаполнение убивает разреженность. Когда модель обрабатывает длинный промпт целиком, тысячи токенов задействуют почти всех экспертов сразу. Весь набор экспертов прокачивается через шину PCIe, и это занимает от двух секунд на топовой RTX 5090 до десяти и больше на ноутбуке.
  • Статическое размещение не успевает за маршрутизацией. Существующие движки (llama.cpp, KTransformers, Ollama) раскладывают данные по памяти один раз при загрузке. Но маршрутизатор модели меняет набор активных экспертов при каждом новом токене, и большинство вычислений падает на процессор, пока видеокарта простаивает.
  • Процессор не вытягивает остаток. Оперативная память обычного компьютера (DDR5 в двухканальном режиме) даёт 80–90 гигабайт в секунду. Видеопамять RTX 4090 или 5090 работает в 12–20 раз быстрее.

Три механизма, которые предложили авторы

FreeToken не упрощает модель и не обрезает экспертов. Вместо этого система делит работу между видеокартой и процессором пропорционально их реальной пропускной способности, замеренной на конкретной машине командой ft bench bw.

  • Адаптивное разделение по пропускной способности (политика q*). Система измеряет, сколько данных одновременно могут читать шина PCIe и процессор из общей оперативной памяти. Часть промахов кэша заполняется на видеокарту, остальное считается прямо на процессоре. Два частичных результата складываются точно, без приближений.
  • Кэширование с привязкой к смыслу. При предзаполнении FreeToken потоково загружает следующий слой, пока видеокарта обрабатывает текущий. Контрольные точки привязаны к границам блоков рассуждений, вызовов инструментов и ответов, именно там агентные фреймворки обрезают контекст. Редактирование промпта пересчитывает только новый «хвост», а не весь ввод. При генерации общий LRU-кэш (кэш, который вытесняет давно неиспользованные данные) охватывает все MoE-слои и следит за маршрутизатором в реальном времени.
  • Эластичное управление памятью. Видеокарточный кэш экспертов перестраивается на лету, без перезапуска движка. Эксперты читаются с диска сразу в нужный формат, а первый запрос обслуживается с «холодным» кэшем, прогрев не нужен.

Что показали замеры?

  • На RTX 5090 скорость декодирования Qwen3.6-35B-A3B составила 77–83 токена в секунду, это в 1,5–2,3 раза быстрее лучшего из существующих движков.
  • Скорость декодирования при агентных сценариях (многошаговая работа с инструментами) отклонялась от однозапросной не более чем на 12 %.
  • Худшее время до первого токена (TTFT, задержка перед началом ответа) не превысило 44 секунды ни в одном тесте. Для сравнения: llama.cpp показал 232 секунды, Ollama 179, KTransformers 946, за этими порогами клиенты агентов просто отваливаются по тайм-ауту.
  • На ноутбуке с 8-гигабайтной RTX 4060 модель на 35 миллиардов параметров генерировала 39,3 токена в секунду. По данным авторов статьи, медианная скорость декодирования Codex (агентного продукта OpenAI) в рабочих трассах составляет 33,9 токена в секунду в нормализованном виде.
Как это читать

Все 9 из 16 заявленных результатов пока воспроизведены только авторами, независимая проверка не проводилась. Сравнение «39,3 токена в секунду быстрее Codex» сделано с нормализованным показателем 33,9, а не с чистой медианой декодирования Codex в 57,1. Формулировка «на одном GPU» скрывает требование к оперативной памяти: от 192 до 512 ГБ хостовой DRAM, это серверная или рабочая станция, не бытовой ноутбук. Базовый замер KTransformers проведён на 6 потоках процессора, хотя инструмент рассчитан на многоядерную конфигурацию с AMX-инструкциями.

Что это значит для вас?

Разработчику в РФ и СНГ. FreeToken решает конкретную проблему: облачные API крупных моделей либо недоступны из-за санкций, либо стоят дорого. Система позволяет развернуть большие языковые модели с открытыми весами (DeepSeek-V4-Flash, GLM-5.2, Qwen) локально, данные не покидают машину. Для медицины, юриспруденции, финансов, оборонки и любой работы с конфиденциальными документами это прямой путь к приватному инференсу без облака.

Автору Дзена и копирайтеру. Если вы пользуетесь локальными моделями для генерации черновиков, проверки текстов или синтетических данных, FreeToken обещает запуск 35-миллиардной модели на ноутбуке с 8 ГБ видеопамяти на скорости, комфортной для интерактивной работы. Установка через pip, без настройки кластера.

Предпринимателю и руководителю. Обратите внимание на оговорки: для моделей от 284 миллиардов параметров нужна рабочая станция с 192–512 ГБ оперативной памяти. Это не бытовой ПК, но всё равно на порядки дешевле аренды GPU-кластера. Код открыт под Apache 2.0, привязки к вендору нет.

Мнение редакции dzen.guru

Результаты выглядят убедительно арифметически: авторы честно показывают, что каждое число пересчитывается из их же таблиц, и прямо указывают на ограничения. Но независимого воспроизведения пока нет, и «один GPU» на практике означает рабочую станцию с полутерабайтом оперативной памяти, это стоит от 300 до 500 тысяч рублей. Для одиночного разработчика или небольшой команды в России, где доступ к облачным API крупных моделей ограничен, это всё равно выгоднее, чем месячный счёт за аренду кластера. Я рекомендую попробовать FreeToken на модели Qwen3.6-35B-A3B, если у вас есть хотя бы RTX 4060 и 64 ГБ оперативной памяти: для агентных задач на уровне кодинга и рецензирования документов этого уже хватает.

Главный вывод: не модели стали меньше, а система научилась использовать обычное железо так, как оно устроено, с учётом реальных скоростей каждой шины и каждого чипа. Для тех, кто работает с конфиденциальными данными или просто не хочет платить за облако, это первый открытый инструмент, который делает локальный запуск моделей-гигантов не демонстрацией, а рабочим режимом.

По данным статьи FreeToken (arXiv / GitHub)

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Нейросимвольный ИИ Шумского работает на CPU без GPU: что это даёт российским командам
ai

Нейросимвольный ИИ Шумского работает на CPU без GPU: что это даёт российским командам

Сергей Шумский, кандидат физико-математических наук и известный в российском IT-сообществе исследователь, предложил альтернативу трансформерной архитектуре:…

5 мин
Нейросети для редактирования фото стирают «отпечаток» камеры: доказать подлинность снимка больше нельзя
ai

Нейросети для редактирования фото стирают «отпечаток» камеры: доказать подлинность снимка больше нельзя

Нейросети для редактирования фото обрабатывают снимок целиком, даже если вы поправили только угол кадра, и это уничтожает криминалистический след камеры,…

5 мин
MCP-протокол подключили к антидетект-браузеру: ИИ-агент управляет Camoufox одним промптом
ai

MCP-протокол подключили к антидетект-браузеру: ИИ-агент управляет Camoufox одним промптом

Компания-разработчик yvv4git выпустила открытый пакет go-juggler-mcp, который связывает MCP протокол (Model Context Protocol, стандарт подключения инструментов…

5 мин