Игорь Градов
Игорь Градов
6 мин
ai

DeepSeek V4 Flash обошла старшую модель на агентных задачах и стоит втрое дешевле

DeepSeek 31 июля 2026 года выпустил публичную бету DeepSeek V4 Flash, обновлённой версии открытой языковой модели, которая обходит старшую V4-Pro на агентных задачах и стоит втрое дешевле.

DeepSeek V4 Flash обошла старшую модель на агентных задачах и стоит втрое дешевле
Почему это важно

Открытая модель с MIT-лицензией впервые обгоняет старшую версию того же разработчика на агентных бенчмарках, при этом генерация текста стоит $0,28 за миллион токенов (токен, это минимальная единица текста, которую «видит» модель, примерно три четверти слова) против $0,87 у V4-Pro.

До сих пор DeepSeek предлагал V4-Flash как превью, предварительную версию без гарантий стабильности. Релиз от 31 июля, по данным карточки модели на Hugging Face, официально заменяет превью. Архитектура и размер не изменились: улучшения достигнуты за счёт повторного пост-обучения (post-training), то есть модель «доучили» на новых данных, не перестраивая конструкцию. Источник новости: Marktechpost.

Что Когда Кто выпустил Цена (генерация)
DeepSeek V4 Flash (публичная бета API + веса на Hugging Face) 31 июля 2026 DeepSeek $0,28 за 1 млн выходных токенов

Что изменилось в V4 Flash по сравнению с превью?

  • Пост-обучение вместо новой архитектуры. Модель осталась на 284 млрд параметров, но из них при обработке каждого токена активируются только 13 млрд. Это архитектура MoE (Mixture of Experts, «смесь экспертов», когда модель держит много блоков-специалистов, но на каждый запрос включает лишь несколько).

  • DSpark для быстрой генерации. К модели прикреплён модуль спекулятивного декодирования DSpark. По данным статьи о DSpark, он ускоряет генерацию на 60-85% на пользователя по сравнению с базовым режимом при сопоставимой общей пропускной способности.

  • Поддержка Responses API и Codex. API-эндпоинт deepseek-v4-flash теперь работает с форматом Responses API и адаптирован для Codex. Обновление не затронуло V4-Pro API, а также приложение и веб-версию.

  • Контекстное окно до 1 млн токенов. Это примерно 1 500 страниц текста, модель способна «удерживать в голове» длинные документы, переписки или кодовые базы целиком.

  • MIT-лицензия без ограничений доступа. Веса (файлы с «знаниями» модели) выложены открыто, скачать и использовать в коммерческом проекте может любой желающий.

Агентные бенчмарки: цифры от разработчика

По данным карточки модели на Hugging Face, DeepSeek V4 Flash превосходит V4-Pro (Preview) на каждом агентном бенчмарке, который DeepSeek опубликовал. Однако здесь есть оговорка, которую стоит учитывать:

  • Задачи Code Agent запускались через внутренний инструмент DeepSeek Harness в минимальном режиме. Этот инструмент не опубликован.
  • DSBench-FullStack (68,7) и DSBench-Hard (59,6) являются внутренними тестовыми наборами.

Агентные оценки чувствительны к инструменту тестирования, поэтому независимые замеры могут дать другие результаты.

Кому и как запустить DeepSeek V4 Flash?

Два пути, принципиально разных по порогу входа:

Через API модель доступна практически всем. Ценообразование по данным страницы DeepSeek:

  • $0,14 за 1 млн входных токенов (при промахе кеша)
  • $0,0028 за 1 млн входных токенов (при попадании в кеш)
  • $0,28 за 1 млн выходных токенов
  • Лимит одновременных запросов: 2 500

Самостоятельный хостинг требует серьёзного железа. Все эксперты модели остаются в памяти, даже когда активны только 13 млрд параметров. По примеру от DeepSeek, полноточностная версия работает на одном узле из четырёх карт GB300. Версии GGUF от Unsloth занимают 162 ГБ (8 бит, без потерь) или 103 ГБ (3 бита), и потребуют примерно 110 ГБ суммарной оперативной и видеопамяти. Этот путь подходит средним и крупным компаниям с серверным кластером.

Как попробовать?

  1. Откройте страницу модели на Hugging Face и изучите карточку DeepSeek-V4-Flash-0731.
  2. Для работы через API зарегистрируйтесь на платформе DeepSeek, получите ключ и используйте эндпоинт deepseek-v4-flash.
  3. Для задач с ИИ-агентами (автоматическими помощниками, которые сами выполняют цепочки действий) DeepSeek рекомендует параметры: temperature 1.0, top_p 0.95.
  4. Запустите собственные тесты на ваших задачах, прежде чем ставить модель в продакшен: опубликованные бенчмарки получены на внутреннем инструменте разработчика.

DeepSeek V4 Flash и российские аналоги: что доступно в РФ?

Для читателей из России и СНГ важен контекст: DeepSeek, китайская компания, и её API формально доступен без региональных блокировок, в отличие от OpenAI. Однако стабильность работы из РФ зависит от конкретного провайдера и маршрутизации трафика.

Из отечественных альтернатив доступны YandexGPT и GigaChat от Сбера. Прямое сравнение качества на агентных задачах привести невозможно: ни Яндекс, ни Сбер не публикуют результаты на тех же бенчмарках, что DeepSeek. По моим наблюдениям, ни YandexGPT, ни GigaChat пока не позиционируют свои модели как инструмент для автономных агентных цепочек, это скорее чат-ассистенты и генераторы текста.

Ключевое преимущество DeepSeek V4 Flash для российских разработчиков: MIT-лицензия и открытые веса (open weights) позволяют развернуть модель на собственных серверах без юридических ограничений.

Что с этого прямо сейчас, по ролям?

Автору Дзена. Модель с контекстом в миллион токенов способна анализировать целый канал, все статьи за год, и предлагать темы, которые вы не раскрыли. Попробуйте через API загрузить подборку своих текстов и попросить найти пробелы в тематике.

Маркетологу. Цена в $0,28 за миллион выходных токенов делает реальными сценарии, которые раньше упирались в бюджет: автоматический анализ отзывов, генерация вариантов рассылок, обработка длинных брифов. Для сравнения: V4-Pro стоит $0,87 за тот же объём.

Предпринимателю в РФ и СНГ. MIT-лицензия без ограничений и отсутствие «ворот» (gating, когда доступ к весам выдаётся по заявке) позволяют использовать модель в коммерческих продуктах. Если у вас есть серверная инфраструктура с 110+ ГБ памяти, можно развернуть модель полностью на своей стороне, без зависимости от внешнего API.

Мнение редакции dzen.guru

DeepSeek продолжает ломать ценовую модель рынка: получить агентную модель, которая по собственным тестам разработчика обходит старшую версию и стоит втрое дешевле, ещё год назад было невозможно. На мой взгляд, главная ценность этого релиза не в бенчмарках, а в комбинации «открытые веса + MIT-лицензия + низкая цена API». Для команд из двух-трёх разработчиков в России это практичный способ строить агентные системы без бюджета на GPU.

Оговорка: все опубликованные результаты получены на внутреннем инструменте DeepSeek Harness, который не выложен в открытый доступ. Пока независимые исследователи не воспроизведут замеры, относитесь к цифрам как к заявлениям производителя, а не как к установленному факту.

Что сделать сегодня: возьмите одну свою рабочую задачу, ту, что сейчас решаете через ChatGPT или Claude, и прогоните её через API DeepSeek V4 Flash. Сравните качество и посчитайте стоимость на вашем объёме. Это займёт полчаса, но даст конкретную цифру вместо чужих бенчмарков.

Частые вопросы

DeepSeek V4 Flash бесплатен?

Веса модели доступны бесплатно на Hugging Face под MIT-лицензией: скачивайте, разворачивайте, используйте в коммерческих проектах. API платный, но цены одни из самых низких на рынке: $0,28 за миллион выходных токенов, $0,14 за миллион входных. При попадании в кеш входные токены обойдутся в $0,0028 за миллион.

Можно ли запустить модель на обычном компьютере?

Скорее нет. Даже агрессивно сжатая 3-битная версия занимает 103 ГБ и требует около 110 ГБ суммарной оперативной и видеопамяти. Для большинства пользователей реалистичный путь: работать через API, а не разворачивать модель локально.

Чем V4 Flash отличается от V4-Pro?

Обе модели построены на одной архитектуре MoE, но V4 Flash активирует 13 млрд параметров на токен, дешевле в работе и, по данным разработчика, обходит V4-Pro (Preview) на агентных бенчмарках. V4-Pro стоит $0,87 за миллион выходных токенов, V4 Flash втрое дешевле. При этом обновление от 31 июля затронуло только V4 Flash: V4-Pro API остался без изменений.

Для тех, кто строит агентные цепочки с ограниченным бюджетом, выбор очевиден, но запустите свои тесты: чужие бенчмарки, особенно на закрытом инструменте, не заменят проверки на ваших данных.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

SpaceX демонтирует 69 нелегальных турбин xAI, но замена на $2,8 млрд займёт два года
ai

SpaceX демонтирует 69 нелегальных турбин xAI, но замена на $2,8 млрд займёт два года

Почему это важно SpaceX впервые признала проблему с нелегальными турбинами для дата-центров xAI и назвала конкретный срок их демонтажа, но он растянут до…

4 мин
ai

Суд США признал сговор для веб-скрейпинга Reddit правдоподобным: Perplexity AI ждёт разбирательство

Reddit не отступает: суд разрешил преследовать Perplexity AI и SerpApi за скрейпинг контента с поиска Google. Почему это важно Федеральный суд США впервые на…

4 мин
Что такое ИИ-агент и почему его «побеги» из песочниц OpenAI угрожают всей отрасли
ai

Что такое ИИ-агент и почему его «побеги» из песочниц OpenAI угрожают всей отрасли

Дебаты вокруг «побегов» ИИ-агентов OpenAI из тестовых сред вышли за пределы технических форумов: одни видят в этом доказательство мощи технологий, другие…

4 мин