Игорь Градов
Игорь Градов
5 мин
aggregator

DeepSeek V4.1-Flash активирует 16 из 763 млрд параметров: качество выше флагмана, цена в разы ниже

DeepSeek 9 сентября 2026 года выпустила DeepSeek v4.1-Flash, открытую модель (модель с опубликованными весами) с новой архитектурой «кодировщик-декодировщик», которая при 763 миллиардах общих параметров активирует лишь от 8 до 16 миллиардов и стоит в десятки раз дешевле предшественника.

DeepSeek V4.1-Flash активирует 16 из 763 млрд параметров: качество выше флагмана, цена в разы ниже
Почему это важно

DeepSeek фактически заменила свой флагман DeepSeek V4 Pro моделью, которая обходит его по качеству при цене $0,30 за миллион входных токенов (единиц текста, на которые модель разбивает ввод), а кеш памяти контекста сократился до одной восьмой от прежнего объёма, что делает длительную работу ИИ-агентов (программ, выполняющих задачи автономно) радикально дешевле.

Аналитический ресурс Latent Space, который отслеживает публикации DeepSeek с момента выхода V2, обращает внимание: компания намеренно назвала модель скромно, v4.1-Flash, хотя архитектура изменилась настолько, что исследователь Себастиан Рашка прямо заявил, что «им следовало назвать это DeepSeek V5». Между тем независимый бенчмарк-аккаунт Artificial Analysis уже зафиксировал, что v4.1-Flash превосходит DeepSeek V4 Pro 0813 по их собственному индексу.

Показатель Значение Источник
Общее число параметров 763 млрд Artificial Analysis
Активные параметры на входе (prefill) 8 млрд Artificial Analysis
Активные параметры на выходе (decode) 16 млрд Artificial Analysis
Цена за 1 млн входных токенов $0,30 Artificial Analysis
Цена за 1 млн выходных токенов $1,20 Artificial Analysis
Кешированный вход $0,006 за 1 млн токенов Artificial Analysis
Скидка в непиковое время 50 % Artificial Analysis
Длина контекста 1 млн токенов Artificial Analysis
Оценка Artificial Analysis Intelligence Index 40 баллов Artificial Analysis
Позиция в Vals Index среди открытых моделей Первое место, опережает Kimi K3 Vals AI
Стоимость прогона теста Vals $0,30, самый дешёвый в топ-10 Vals AI
Лицензия MIT Artificial Analysis
Вход текст + изображения Artificial Analysis

Что именно изменили в архитектуре?

Главное нововведение DeepSeek v4.1-Flash, разделение вычислений на две фазы с разным количеством активных параметров.

Когда модель читает ваш запрос (фаза prefill, предварительное заполнение), она задействует только 8 миллиардов параметров из 763 миллиардов. Когда генерирует ответ (фаза decode, декодирование), подключаются 16 миллиардов. Остальные параметры «спят». Это и есть разреженность (sparsity) в 1-2 %: из огромной модели в каждый момент работает крошечная часть.

Представьте библиотеку из 763 тысяч книг, где для ответа на ваш вопрос библиотекарь открывает сначала 8, а потом 16 книг, а не все сразу. Результат тот же, электричества и времени уходит несопоставимо меньше.

Кроме того, в модели применён механизм Sliding-Window Attention Bounded Replay (повторное воспроизведение внимания в скользящем окне). Технический обзор Stochastic Chasm описывает подход как комбинацию локального «скользящего окна» и разреженного поиска по длинному контексту, и отмечает, что этот гибридный паттерн становится отраслевой нормой.

Мультимодальность (способность работать и с текстом, и с картинками) добавлена без отдельной модели: по описанию Stochastic Chasm, DeepSeek «позволяет основной архитектуре обрабатывать визуальные токены напрямую», используя технику 3×3 pixel unshuffle вместо более сложных решений.

Что показали независимые замеры?

  • Artificial Analysis Intelligence Index: DeepSeek v4.1-Flash набрала 40 баллов, встав чуть ниже GLM-5.3-Flash, но выше предшественника V4 Pro, при цене в разы меньше.
  • Vals Index: модель заняла первое место среди открытых моделей, обойдя Kimi K3. Тест проводился с контекстом 1 млн токенов, максимальным выводом 384 токена и температурой 1.
  • KV-кеш (оперативная память, которую модель расходует на хранение контекста разговора): по данным технического отчёта DeepSeek, объём KV-кеша сократился до одной восьмой от показателя V4 Flash, то есть примерно на 87 %.
  • Доступность: Baseten запустил поддержку в день релиза. Ollama начала раскатку для аккаунтов Max и Team, затем для подписчиков Pro.
Как это читать

Модель пока доступна через API DeepSeek только из США. По части бенчмарков v4.1-Flash формально уступает некоторым открытым моделям, Latent Space прямо указывает, что существующие тесты «пока не умеют лаконично измерить» то, на что нацелена архитектура DeepSeek, а именно эффективное и творческое использование длинного контекста. Vals тестировал с конкретными параметрами (384 токена вывода, температура 1), при других настройках результаты могут отличаться. Сравнивать напрямую с закрытыми моделями (например, GPT или Claude) корректно только при одинаковых условиях тестирования.

Что это даёт вам прямо сейчас?

Авторам Дзена и копирайтерам. Если вы используете ИИ для генерации длинных текстов или работы с большими черновиками, модель с контекстом в 1 млн токенов и ценой $0,30 за миллион входных токенов обещает заметное снижение расходов. Пока прямого доступа из России нет, но открытая лицензия MIT означает, что модель можно будет запустить локально или через сторонние сервисы, когда появятся адаптации.

Разработчикам ИИ-агентов и маркетологам. Сокращение KV-кеша в 8 раз, это не абстрактная цифра. Для ИИ-агентов, которые ведут длинные сессии (анализ клиентской базы, мониторинг упоминаний, цепочки задач), именно кеш контекста был главным узким местом по стоимости. DeepSeek v4.1-Flash делает такие сценарии экономически реальными на открытых весах.

Предпринимателям РФ и СНГ. Напрямую API DeepSeek из России недоступен. Из ближайших альтернатив, YandexGPT и GigaChat, но ни одна из них не предлагает сопоставимой длины контекста и открытых весов. Практический путь: дождаться появления v4.1-Flash на платформах вроде Ollama (уже раскатывается) или развернуть модель на собственном сервере с GPU, лицензия MIT это позволяет без ограничений.

Мнение редакции dzen.guru

Я вижу здесь два сигнала. Первый: DeepSeek сознательно занижает «номер версии», чтобы отсечь тех, кто читает только заголовки. Это нетипичный маркетинг для индустрии, где каждый релиз подаётся как прорыв. Второй: разделение параметров на prefill и decode, по моим наблюдениям, первый случай, когда открытая модель такого масштаба делает это настолько агрессивно. Если подход приживётся, стоимость ИИ-агентов для бизнеса может упасть на порядок. Для русскоязычного рынка главный вопрос, когда сторонние хостинги предложат v4.1-Flash с нормальной задержкой. Следить стоит за Ollama и Baseten в ближайшие недели.

Релиз DeepSeek v4.1-Flash показывает, куда движется конкуренция в открытых моделях: не «больше параметров», а «меньше активных параметров при том же качестве». Для тех, кто строит продукты на ИИ, это снижение порога входа, которое стоит отслеживать уже сейчас.

По данным Latent Space

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Anthropic раскрыла схемы злоупотребления Claude: от DeepSeek до ракет в Йемене
aggregator

Anthropic раскрыла схемы злоупотребления Claude: от DeepSeek до ракет в Йемене

Компания Anthropic 10 июня 2025 года выпустила масштабный отчёт об угрозах, в котором впервые за восемь месяцев подробно описала все случаи злоупотребления…

5 мин
Design Words переводит картинку в промпт: бесплатный ИИ для дизайна интерьера страниц
aggregator

Design Words переводит картинку в промпт: бесплатный ИИ для дизайна интерьера страниц

Объяснять агенту, какой дизайн вы хотите, сложно без профессионального словаря, и разработчик Пи (Pi) выпустил Design Words, визуальный конструктор стилей,…

4 мин
aggregator

10 000 нейросетей OpenAI Astra заявили о результате по задаче за $1 млн, но доказательства нет

OpenAI заявила, что около 10 000 ИИ-агентов, обученных методом мультиагентного обучения с подкреплением, совместно получили результат по задаче Навье-Стокса,…

5 мин