Игорь Градов
Игорь Градов
5 мин
ai

Alibaba Qwen на 98% дешевле: мультимодальная модель за $0,15 на миллион токенов

Alibaba Qwen выпустила Qwen3.8-Omni-Flash, первую в линейке мультимодальную модель с агентными возможностями, которая принимает текст, изображения, аудио и видео и при этом стоит на 98% дешевле предшественницы по аудиовходу.

Почему это важно

Цена аудиовхода упала более чем на 98%, а видеовхода более чем на 93% по сравнению с предыдущей Qwen3.5-Omni-Plus, по данным команды Qwen. При поддержке 113 языков и диалектов на аудиовходе это делает работу с мультимодальным ИИ доступной разработчикам и авторам за пределами англоязычного рынка.

Команда Alibaba Qwen позиционирует Qwen3.8-Omni-Flash как модель, которая не просто «понимает» разные форматы контента, а действует по цепочке: разобрать содержание, спланировать задачу, выполнить её с помощью инструментов и выдать результат. Модель доступна через API на QwenCloud, Alibaba Cloud Model Studio и Qwen Studio. Открытых весов на момент запуска нет, то есть развернуть её на своём сервере пока нельзя.

Что Когда Кто выпустил Цена
Qwen3.8-Omni-Flash, мультимодальная модель (текст, изображения, аудио, видео на входе, текст на выходе) Запуск в формате API, дата по источнику не уточнена Команда Qwen (Alibaba) $0,15 за 1 млн входных токенов, $0,47 за 1 млн выходных токенов

Что умеет Qwen3.8-Omni-Flash?

  • Контекстное окно в 1 млн токенов (токен — единица текста, примерно 3/4 слова на английском). Максимум на входе: 991 тыс. токенов, на выходе: 131 тыс. токенов. Длина рассуждения: до 262 тыс. токенов.
  • Мультимодальный вход: принимает текст, картинки, аудио (до 3 часов) и видео (до 2 часов и 2 ГБ по ссылке). Аудиовход работает на 113 языках и диалектах.
  • Рассуждение включено по умолчанию с параметром reasoning_effort, выставленным на максимум. Можно отключить, задав значение none.
  • Агентное восприятие видео: вместо того чтобы «смотреть» файл целиком, модель начинает с вопроса, выбирает нужные фрагменты и анализирует их в несколько проходов от общего к частному. По данным команды Qwen, на бенчмарке OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов сократился примерно на 45,7%.
  • Вызов функций, поиск в интернете, структурированный вывод, кэширование контекста и пакетные вызовы поддерживаются через API, совместимый с протоколами DashScope и OpenAI.
  • Выход только текстовый. Если нужна генерация речи, документация направляет к модели Qwen3.5-Omni.

Бенчмарки: цифры от разработчика

Все результаты ниже опубликованы командой Qwen. Независимых замеров на момент публикации нет.

  • Средний балл по 29 оценкам улучшился более чем на 25% по сравнению с Qwen3.5-Omni-Plus.
  • WildClawBench-MM вырос на 36,5 пункта, AgenticVBench на 22,3 пункта.
  • По заявлению разработчиков, аудиовизуальные показатели близки к Gemini 3.8 Flash, а общая производительность по аудио превышает Gemini 3.8 Flash.

Как попробовать?

  1. Зарегистрируйтесь на QwenCloud или в Alibaba Cloud Model Studio и получите API-ключ.
  2. Установите OpenAI SDK для Python (pip install openai), модель совместима с ним.
  3. Отправьте запрос к модели qwen3.8-omni-flash, передав видео- или аудиофайл по URL и текстовый промпт (промпт — текстовая инструкция для модели).
  4. Для расширения возможностей подключите открытый набор плагинов Qwen-MM-Plugins (лицензия Apache-2.0): он умеет строить аудиовизуальную память длинного видео, конвертировать обучающий ролик в иллюстрированный PDF и делать видеомонтаж с переводом и сохранением голоса.

Сравнение с доступными в РФ сервисами

Прямого аналога Qwen3.8-Omni-Flash в российских сервисах пока нет. YandexGPT и GigaChat работают преимущественно с текстом, частично с изображениями. Обработка длинного видео или трёхчасового аудио с агентным поведением (когда модель сама решает, что именно анализировать) в их публичных API не заявлена.

Для автора или маркетолога из РФ доступ к Qwen3.8-Omni-Flash возможен через API из регионов: Пекин, Сингапур, Гонконг, Токио, Франкфурт и Вирджиния. Франкфурт может оказаться ближайшей точкой по задержке для российских серверов, но стабильность доступа зависит от маршрутизации.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена. Если вы работаете с видеоконтентом, модель умеет конвертировать обучающий ролик в текстовый конспект с иллюстрациями. При цене $0,15 за миллион входных токенов это значительно дешевле ручной расшифровки. Попробуйте через плагин omni-video2note.

Маркетологам. Агентное восприятие видео означает, что можно отправить двухчасовую запись вебинара и задать конкретный вопрос: модель не будет «смотреть» всё, а найдёт релевантные фрагменты. Экономия токенов около 45,7% по данным команды Qwen напрямую снижает стоимость анализа.

Разработчикам в РФ. Открытых весов нет, только API. Самостоятельно развернуть модель на своём сервере нельзя. Базовая архитектура Qwen3.8-Flash-Next выпускалась с открытыми весами, но конкретно эта мультимодальная версия закрыта.

Мнение редакции dzen.guru

Alibaba Qwen сделала ход, который меняет экономику работы с видео и аудио через ИИ. Снижение стоимости аудиовхода более чем на 98%, по заявлению разработчика, это не косметическая скидка, а переход в другой ценовой класс. Для тех, кто работает с контентом на русском, поддержка 113 языков и диалектов на аудиовходе звучит обнадёживающе, но конкретного списка языков источник не приводит, и качество распознавания русской речи предстоит проверить.

Оговорка: все бенчмарки на данный момент только от самой команды Qwen. Независимых тестов нет. Я бы рекомендовал дождаться сторонних замеров, прежде чем переводить на эту модель продакшен-процессы. А вот для экспериментов со своим видеоконтентом, попробовать стоит уже сейчас: отправьте запись вебинара или урока через API и оцените качество конспекта.

Частые вопросы

Можно ли запустить Qwen3.8-Omni-Flash на своём сервере?

Нет. На момент запуска открытых весов (open weights, файлы модели для самостоятельного развёртывания) не опубликовано. Модель доступна только через API на платформах QwenCloud, Alibaba Cloud Model Studio и Qwen Studio.

Модель генерирует голос или только текст?

Только текст. Если нужна генерация речи, команда Qwen рекомендует использовать другую модель, Qwen3.5-Omni. Qwen3.8-Omni-Flash принимает аудио на вход, но отвечает текстом.

Сколько стоит обработка часа видео?

Точную стоимость за час источник не приводит. Базовые расценки: $0,15 за 1 млн входных токенов и $0,47 за 1 млн выходных. Попадание в кэш снижает цену до $0,016 за 1 млн токенов. По данным команды Qwen, стоимость аудиовизуального входа упала более чем на 93% по сравнению с Qwen3.5-Omni-Plus.

Доступ из России технически возможен через ближайший регион во Франкфурте, и для первого теста достаточно бесплатного API-ключа на QwenCloud, так что проверить модель на своём контенте можно за вечер.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Google расширяет команду по ИИ и экономике
ai

Google расширяет команду по ИИ и экономике

Google собрала команду нобелевских лауреатов и ведущих экономистов, чтобы в реальном времени отслеживать, как искусственный интеллект от Google меняет рынок…

5 мин
ai

OpenAI и Microsoft знали о «краже труда»: рассекреченные документы раскрыли масштаб

OpenAI и Microsoft годами знали, что их модели разрушают экономику веб-издателей и создателей контента, но продолжали скрейпить данные ради коммерческой…

6 мин
ai

MIT Technology Review назвал реальную опасность ИИ: не апокалипсис, а кибератаки и потеря контроля

Почему это важно MIT Technology Review впервые собрал в одном материале конкретные сценарии, при которых ИИ может причинить массовый вред: от кибератак на…

5 мин