Игорь Градов
Игорь Градов
6 мин
ai

DFlash 2 показал 6-кратное ускорение нейросетей, обогнав встроенный MTP DeepSeek V3

Компания Inco AI совместно с z-lab представила DFlash 2, параллельный драфтер для ускорения нейросетей, который при тестировании показал шестикратный прирост скорости генерации текста и обошёл встроенный метод MTP, используемый в DeepSeek V3.

DFlash 2 показал 6-кратное ускорение нейросетей, обогнав встроенный MTP DeepSeek V3
Почему это важно

Впервые универсальный внешний драфтер обгоняет встроенные механизмы ускорения крупных моделей: это значит, что владельцы стандартных открытых моделей вроде Qwen и Llama получают сопоставимый или больший выигрыш без переобучения и без замены базовой модели.

До сих пор ускорение нейросетей при генерации текста строилось на двух стратегиях. Первая, MTP (Multi-Token Prediction, предсказание нескольких токенов за раз), встроена прямо в архитектуру модели и работает «из коробки» в DeepSeek V3/V4 и Gemma 4. Вторая, внешний драфтер, использует отдельную лёгкую модель-черновик, которая набрасывает варианты, а большая модель проверяет их за один проход. DFlash 2, второе поколение внешнего драфтера от Inco AI и z-lab, вышел буквально на днях и, по данным разработчиков, кратно обгоняет оба предыдущих подхода.

Что Когда Кто выпустил Цена
DFlash 2, параллельный драфтер для спекулятивного декодирования Август 2026 Inco AI и z-lab Не раскрыта

Почему генерация текста тормозит?

Главное узкое место инференса (процесса, при котором модель выдаёт ответ) заключается в пропускной способности видеопамяти. Чтобы сгенерировать один токен (минимальную единицу текста), модели приходится прогнать через память все гигабайты своих весов (параметров). Представьте библиотекаря, который ради одного слова каждый раз пролистывает всю энциклопедию целиком.

Спекулятивное декодирование решает эту проблему элегантно: лёгкая модель-черновик (драфтер) быстро набрасывает целый блок токенов, а большая модель проверяет весь блок разом. Вместо одного слова за проход получаем сразу несколько.

MTP: ускорение, встроенное в модель

MTP добавляет к модели дополнительные «головы» предсказания. Каждая голова угадывает следующий токен на основе внутренних состояний модели. Внешний драфтер не нужен, экономится видеопамять.

Но есть ограничение: головы работают последовательно, одна за другой. Чем дальше от текущей позиции, тем хуже точность предсказания.

По независимым замерам AMD на DeepSeek V3 с MTP-модулем NextN в SGLang, реальное ускорение нейросетей составило:

  • 1.25 до 2.11x на синтетическом Random-датасете
  • 1.36 до 1.8x на датасете ShareGPT

Это заметно скромнее маркетинговых цифр 4.66 до 7.28x из технического отчёта DeepSeek V3. Разрыв между лабораторными и реальными показателями здесь типичен: синтетика и продакшн-нагрузка живут в разных мирах.

DFlash 2: параллельный драфтер нового типа

DFlash 2 идёт другим путём. Вместо последовательного угадывания токенов маленькая модель-драфтер за один проход предлагает кандидатов сразу для всех позиций блока. По данным разработчиков:

  • Ускорение генерации превышает 6x
  • DFlash 2 в 2.5 раза обгоняет метод EAGLE-3 (предыдущий лидер среди внешних драфтеров)
  • На первой позиции блока верный токен попадает в топ-16 кандидатов в 99.5% случаев (против 85.4% при «жадном» выборе одного лучшего варианта, как в MTP)

Сам драфтер добавляет примерно 2 миллиона параметров и всего 0.6% к задержке цикла. Перед слоями внимания и вычислений добавлены лёгкие свёртки, которые не дают точности падать на дальних позициях.

Что выбрать: MTP или DFlash 2?

  • MTP подходит, если базовая модель уже содержит встроенные головки предсказания (DeepSeek V3/V4, Gemma 4) и вы не хотите держать в памяти отдельный драфтер
  • DFlash 2 подходит, если вы запускаете стандартные открытые модели (Qwen, Llama) в vLLM, SGLang или llama.cpp: драфтер не требует изменения весов базовой модели и даёт больший коэффициент принятия токенов

Как попробовать?

  1. MTP в SGLang (пример для DeepSeek V3): при запуске сервера укажите путь к NextN-чекпойнту той же модели как к драфтеру через параметр --speculative-draft-model-path lmsys/DeepSeek-V3-NextN. Сервер сам распознает архитектуру и включит MTP-режим.
  2. MTP в vLLM: укажите в speculative_config путь до модели. Если чекпойнт содержит MTP-слой, vLLM переключает метод автоматически.
  3. MTP в llama.cpp и LM Studio: используйте флаг --spec-type draft-mtp, MTP-головы загружаются из того же GGUF-файла. В LM Studio при выборе модели со встроенными головами режим MTP включается в настройках Speculative Decoding.
  4. DFlash 2 в SGLang: поддержка включается при запуске сервера (на момент публикации часть функциональности находится в PR-ветках, а не в релизных версиях, команды и параметры могут измениться).

Есть ли аналоги для российских разработчиков?

Российские модели YandexGPT и GigaChat работают через API, и пользователь не управляет инференсом напрямую. Методы MTP и DFlash 2 актуальны для тех, кто разворачивает открытые модели на своём железе. Если вы используете Qwen или Llama на собственном сервере или арендованном GPU, DFlash 2 применим без оговорок. Для тех, кто пользуется только облачными API российских сервисов, ускорение нейросетей остаётся на стороне провайдера.

Что делать с этим прямо сейчас, по ролям

Автору Дзена и копирайтеру. Если вы генерируете тексты через локально развёрнутую модель, DFlash 2 может сократить время ожидания ответа в разы. Это особенно ощутимо при длинных генерациях: статьи, сценарии, серии постов.

Разработчику и техническому специалисту. Попробуйте DFlash 2 на Qwen3.8-27B в SGLang и сравните MAL (среднюю длину принятия, то есть сколько токенов модель одобряет за один проход проверки) с родными MTP-головами. Результаты в реальных задачах будут ниже синтетических, но порядок различий покажет, стоит ли менять пайплайн.

Предпринимателю. Если ваш продукт использует LLM (большие языковые модели) и вы платите за GPU-часы, шестикратное ускорение генерации означает пропорциональное снижение затрат на инференс. Но пока DFlash 2 находится в стадии PR-веток, закладывать его в продакшн рано.

Мнение редакции dzen.guru

Цифры DFlash 2 впечатляют, но я хочу напомнить то, что честно указал и сам автор оригинального разбора: все приведённые замеры синтетические. Реальное ускорение нейросетей в продакшн-нагрузке будет ниже. Мы уже видели это с MTP: маркетинговые 4.66 до 7.28x превратились в 1.25 до 2.11x по независимым замерам AMD. Тем не менее даже с поправкой на реальность DFlash 2 выглядит как серьёзный шаг вперёд для тех, кто работает с открытыми моделями на своём железе. Рекомендую подписаться на репозитории Inco AI и z-lab и дождаться мержа в стабильные версии SGLang и vLLM, прежде чем тащить это в боевой пайплайн.

Частые вопросы

DFlash 2 работает с любой моделью?

DFlash 2 работает с открытыми моделями стандартных архитектур (Qwen, Llama и аналогичные) и не требует изменения их весов. Для моделей со встроенным MTP (DeepSeek V3/V4, Gemma 4) разумнее использовать родной механизм.

Нужна ли дополнительная видеопамять?

Драфтер DFlash 2 добавляет примерно 2 миллиона параметров, по данным разработчиков это около 0.6% к задержке цикла. Это пренебрежимо мало по сравнению с весами самой базовой модели.

Можно ли использовать DFlash 2 прямо сейчас?

На момент публикации (август 2026) часть функциональности живёт в PR-ветках фреймворков, а не в релизных версиях. Команды и параметры могут измениться после мержа в стабильные релизы SGLang и vLLM. Для экспериментов подходит уже сейчас, для продакшна лучше дождаться стабильной интеграции.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Многоагентные системы ломаются не из-за промптов: два скрытых свойства, которые нужно искать
ai

Многоагентные системы ломаются не из-за промптов: два скрытых свойства, которые нужно искать

Многоагентные системы (MAS, multi-agent systems, когда несколько ИИ-агентов работают в цепочке, передавая задачу друг другу) всё чаще ломаются не из-за слабого…

5 мин
Искусственный интеллект на производстве руды дал +10% к выработке без дня простоя
ai

Искусственный интеллект на производстве руды дал +10% к выработке без дня простоя

Искусственный интеллект на горнодобывающем комбинате заменил лабораторный контроль руды непрерывным мониторингом через компьютерное зрение, и предприятие…

7 мин
Видимость в нейросетях: тест 73 страниц не подтвердил ни один популярный совет
ai

Видимость в нейросетях: тест 73 страниц не подтвердил ни один популярный совет

Автор протестировал семь распространённых рекомендаций по видимости в нейросетях на 73 реальных русскоязычных страницах и обнаружил, что ни один из популярных…

5 мин