Игорь Градов
Игорь Градов
5 мин
ai

Gemini видео в агентном режиме: на 88% меньше токенов и на 66% дешевле анализ

Google на этой неделе включила в моделях Gemini Flash агентный режим обработки видео, при котором модель сама решает, какие фрагменты смотреть, и тратит до 88% меньше токенов (единиц текста, которыми модель измеряет объём данных) при анализе длинных записей.

Gemini видео в агентном режиме: на 88% меньше токенов и на 66% дешевле анализ
Почему это важно

Раньше Gemini прогоняла видео целиком с частотой один кадр в секунду, даже если вопрос касался единственного момента. Теперь модель навигирует по таймлайну сама, загружая только нужные отрезки, и это снижает стоимость анализа видео до 66%.

До сих пор любая модель Gemini обрабатывала видео в один проход: извлекала кадры с частотой 1 FPS (один кадр в секунду), аудио на 1 Кбит/с в одном канале и расставляла временные метки каждую секунду. Для 90-минутной лекции это означало оплату за весь таймлайн, даже если вопрос звучал как «на какой минуте спикер переходит к слайду с ценами». По данным блога Google, новый агентный режим решает эту проблему: Gemini сама выбирает, что смотреть, с какой частотой кадров и через какой канал (видео, аудио или транскрипт).

Что Когда Кто выпустил Цена
Агентный режим понимания видео в Gemini Flash Эта неделя (июнь 2025) Google Стандартная тарификация Gemini API, без дополнительной платы за функцию

Что изменилось в работе Gemini с видео?

  • Агентный цикл вместо единого прохода. Модель запускает внутренний цикл: сама ищет, сканирует и проверяет нужные сегменты по кадрам, аудио и транскриптам. Загружается только то, что требует промпт (запрос пользователя).
  • До 88% меньше токенов и до 66% ниже стоимость. Google приводит эти цифры по своим оценкам на стандартных видеобенчмарках. Основной выигрыш приходится на длинный контент: от 10-минутных руководств до многочасовых записей.
  • До 7% выше точность на тех же бенчмарках по сравнению со статическим режимом.
  • Поддержка нескольких моделей. Агентный режим работает на Gemini 3.8, 3.7, 3.6 Flash и 3.5 Flash-Lite.
  • Включается одной строкой. В параметрах видео достаточно указать поле processing: "agentic".
  • Можно смешивать режимы. В одном запросе допустимо поставить агентный режим на длинную лекцию и статический на короткий клип.
  • Статический режим остаётся лучше для роликов короче пяти минут и для работы, требующей покадровой точности.

Примечательно, что разработчики и раньше могли собрать подобный цикл вручную, нарезая видео на куски и отправляя по частям. Разница в том, что теперь Gemini делает это внутри себя, и именно здесь исчезают затраты на разработку.

Что возвращает API?

Агентный режим добавляет в массив ответа два новых типа шагов: processing_call (модель запрашивает сегмент или транскрипт) и processing_result (загрузка завершена). Они чередуются с шагами рассуждений (thought) и предшествуют финальному ответу (model_output). По их наличию можно проверить, что агентный режим действительно сработал.

Расход токенов делится на два типа: рассуждения при навигации оплачиваются как «мыслительные» токены (total_thought_tokens), а загруженные по запросу кадры, аудио и транскрипты как «инструментальные» (total_tool_use_tokens).

Как попробовать?

  1. Откройте Google AI Studio или подключитесь через Gemini API (доступен, в том числе, разработчикам из России через стандартный API-доступ).
  2. Создайте запрос к одной из поддерживаемых моделей (например, gemini-3.7-flash), указав в параметрах видео поле "processing": "agentic".
  3. Передайте ссылку на видео (поддерживаются загруженные файлы и публичные URL YouTube) и текстовый промпт с вопросом.
  4. В ответе проверьте наличие шагов processing_call и processing_result, чтобы убедиться, что агентный режим включился.

Gemini видео и российские аналоги: есть ли альтернатива?

Gemini Flash (агентный режим) YandexGPT GigaChat
Понимание видео Да, агентная навигация по таймлайну Нет встроенной обработки видео через API Нет встроенной обработки видео через API
Доступ из России Через API (с ограничениями) Полный доступ Полный доступ

На момент публикации ни YandexGPT, ни GigaChat не предлагают встроенного анализа видео через API. Для задач, связанных именно с видео (разбор лекций, анализ записей совещаний), Gemini Flash остаётся одним из немногих вариантов, доступных через стандартный API.

Что это значит для вас?

Авторам Дзена. Если вы делаете контент на основе длинных видео (разборы лекций, обзоры вебинаров), агентный режим Gemini видео позволяет получить точные ответы по конкретным моментам записи, не оплачивая обработку всего ролика целиком. Экономия до 66% ощутима при регулярной работе.

Маркетологам. Анализ записей конференций, вебинаров клиентов, длинных презентаций обходится дешевле и точнее. Одна строка кода переключает режим, без перестройки существующих пайплайнов.

Предпринимателям и разработчикам из РФ. Функция доступна через стандартный Gemini API без дополнительной платы. Для анализа многочасовых записей (например, учебных курсов или совещаний) снижение стоимости на 66% меняет экономику задачи. Открытых весов (open weights) нет, самостоятельный хостинг невозможен, только облачный API.

Мнение редакции dzen.guru

Google сделала ход, который выглядит логичным, но до сих пор никто не реализовал на уровне API: вместо того чтобы скармливать модели всё видео, дать ей самой решать, куда смотреть. По моим наблюдениям, именно стоимость обработки длинного видео до сих пор была главным барьером для авторов, которые хотели бы автоматизировать разборы лекций и вебинаров. Снижение цены на две трети делает это практичным даже для небольших проектов. Оговорка: цифры «до 88% меньше токенов» и «до 7% выше точность» Google приводит по собственным бенчмаркам, независимых замеров пока нет. Если вы работаете с видео длиннее 10 минут, попробуйте агентный режим на одном ролике сегодня и сравните расход токенов со статическим. Разница будет видна в первом же счёте.

Частые вопросы

Агентный режим Gemini видео бесплатный?

Дополнительной платы за саму функцию нет. Оплата идёт по стандартным тарифам Gemini API за токены. Но поскольку агентный режим тратит значительно меньше токенов на длинных видео, итоговый счёт снижается до 66%.

Можно ли использовать Gemini видео для коротких роликов?

Можно, но Google прямо указывает: для клипов короче пяти минут и для задач, требующих покадровой точности, статический режим (обработка всего видео целиком) работает лучше. Агентный режим выигрывает именно на длинном контенте.

Доступна ли функция в России?

Агентный режим работает через стандартный Gemini API. Открытых весов нет, развернуть на своём сервере нельзя. Доступ из России возможен через API в Google AI Studio, но может потребовать VPN или промежуточного сервера в зависимости от текущих ограничений доступа к сервисам Google.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

ASCII-смаггинг вырос в 120 раз: спамеры шлют 2,5 млн писем с невидимым текстом

ASCII-смаггинг (ASCII smuggling) вырос из узкой атаки на ИИ-агентов (программы, которые сами выполняют задачи по инструкции) в массовый инструмент спамеров:…

5 мин
NVIDIA выпустила открытый прокси для нейросетей: один агент работает с любым LLM-провайдером
ai

NVIDIA выпустила открытый прокси для нейросетей: один агент работает с любым LLM-провайдером

Команды, которые запускают агентов для написания кода, упираются в одну и ту же стену: Claude Code работает через API Anthropic, Codex CLI требует формат…

5 мин
Персональные данные и нейросети: как не нарушить 152-ФЗ за 7 шагов
ai

Персональные данные и нейросети: как не нарушить 152-ФЗ за 7 шагов

Нейросети всё чаще берут на себя задачи, в которых неизбежно мелькают персональные данные клиентов, и эта инструкция покажет, как выстроить обработку так,…

5 мин