Gemini Omni 1.1 Flash: видео до 40 секунд, черновики за треть цены и контроль каждого кадра
Google 3 июня выпустила Gemini Omni 1.1 Flash, обновление мультимодальной (работающей сразу с текстом, изображениями, звуком и видео) модели, которое превращает генератор видео в управляемый инструмент с расширением сцен до 40 секунд и черновиками за треть цены.

Впервые в продакшн-модели Google можно задать первый и последний кадр, а между ними получить непрерывное видео с контролем камеры, и тут же проверить результат в дешёвом черновике 360p, прежде чем рендерить финал в 4K.
До сих пор видеомодели Google анализировали только последнюю секунду клипа при продолжении сцены. Gemini Omni 1.1 Flash читает до 10 секунд предыдущего контекста и наращивает видео блоками по 10 секунд до суммарных 40. Модель доступна через Gemini API в Google AI Studio и платформу Gemini Enterprise Agent Platform. По данным Google, Adobe (Firefly), Figma Weave, GMI Cloud и Runway уже используют её в продакшне.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Gemini Omni 1.1 Flash, обновление видеогенерации | Июнь 2025 | Вход: $1,50 за 1 млн токенов. Выход видео: $17,50 за 1 млн токенов (около $0,10 за секунду 720p) |
Что изменилось по сравнению с предыдущей версией?
-
Расширение сцен до 40 секунд. Модель анализирует до 10 секунд предыдущего контекста (раньше только последнюю секунду, по данным Google). Продлевать можно блоками по 3 до 10 секунд за один вызов, суммарно до 40 секунд. Последние кадры исходного видео модель подправляет сама, чтобы стык был незаметным.
-
Контроль первого и последнего кадра. Загружаете два изображения, модель генерирует непрерывное видео между ними. Это механизм для орбитальных облётов, наездов камеры (dolly-zoom) и зацикленных петель.
-
Видеореференсы для единообразия персонажей. Можно подать до трёх клипов (каждый до 3 секунд) как образец внешности. Звук внутри референса модель игнорирует. Работа сразу с несколькими видео для «рассуждения» между ними не поддерживается.
-
Черновик в 360p за треть цены. Параметр разрешения принимает значения 360p, 720p (по умолчанию), 1080p и 4K. По данным Google, 360p-черновики рендерятся до 60% быстрее и стоят треть от 720p. 1080p и 4K получаются апскейлом (увеличением разрешения с доработкой деталей).
-
Редактирование через диалог. Редактирование «с памятью»: вы передаёте идентификатор предыдущего взаимодействия, модель применяет изменение, сохраняя всё, что вы не упоминали. Видео заново загружать не нужно.
-
Водяной знак SynthID. Каждое сгенерированное видео несёт невидимую метку, которую можно проверить программно. Это для подтверждения происхождения контента.
Какие ограничения стоит учесть?
Ограничения конкретные и важные для планирования:
- Продлевать сцену можно только в конец клипа. Вставка в середину или добавление в начало не работают.
- Загружаемое видео для расширения должно быть не длиннее 10 секунд (исключение: многоходовое продление уже сгенерированного моделью ролика).
- Нельзя добавить новый диалог при расширении загруженного видео, где кто-то говорит. Диалоги поддерживаются только в многоходовом режиме через идентификатор взаимодействия.
- Системные промпты (системный промпт, постоянная инструкция, задающая поведение модели), настройки температуры и негативные промпты как отдельный параметр отсутствуют. Запреты приходится писать прямо в тексте промпта.
- Редактирование голоса и аудиореференсы не поддерживаются.
- YouTube-ссылки нельзя использовать как источник.
- Полностью поддерживается английский язык. Другие языки, по данным Google, не оценены.
Как попробовать Gemini Omni 1.1 Flash?
- Откройте Google AI Studio (aistudio.google.com) и авторизуйтесь с Google-аккаунтом. Бесплатного тарифа нет: модель доступна только на платном уровне.
- Выберите модель
gemini-omni-1.1-flashв API. Для быстрого старта Google опубликовала Omni quickstart cookbook с примерами кода. - Начните с черновика в 360p: задайте
resolution: "360p"в параметрах ответа. Проверьте результат, и только потом переключите на 720p, 1080p или 4K для финальной версии. - Для подписчиков Google AI Plus, Pro и Ultra модель также доступна в Google Flow, а расширение сцен работает в приложении Gemini.
Сравнение с российскими аналогами
В России генерация видео по тексту доступна через Kandinsky от «Сбера» (бесплатно, через FusionBrain). YandexGPT и GigaChat работают с текстом и изображениями, но генерацию видео не предлагают.
| Возможность | Gemini Omni 1.1 Flash | Kandinsky (FusionBrain) |
|---|---|---|
| Генерация видео по тексту | До 40 секунд, расширение сцен | Короткие клипы, без расширения |
| Контроль первого и последнего кадра | Да | Нет |
| Черновик за треть цены | 360p за треть от 720p | Бесплатно, но одно разрешение |
| Доступность из РФ | Ограничена (нужен зарубежный аккаунт) | Свободно |
| Русский язык | Не оценен Google | Поддерживается |
Прямого аналога с полным набором функций Gemini Omni в РФ пока нет.
Кому это пригодится и что делать прямо сейчас?
Видеомейкерам и маркетологам. Схема «черновик в 360p за треть цены, финал в 4K» радикально меняет экономику производства. Раньше каждый неудачный рендер стоил полную цену. Теперь можно перебирать варианты дёшево и рендерить один раз. При цене около $0,10 за секунду 720p минутный ролик обходится примерно в $6, но проверка идеи в 360p будет стоить около $2.
Авторам Дзена. Расширение сцен до 40 секунд и контроль камеры через первый и последний кадр позволяют собирать обложки-видео и короткие ролики для статей без монтажной программы. Ограничение: русский язык Google не тестировала, промпты придётся писать на английском.
Предпринимателям в РФ. Доступ к API из России затруднён. Если вы работаете через зарубежную инфраструктуру, модель уже в продакшне. Если нет, следите за Kandinsky и ждите, пока российские сервисы подтянут расширение сцен.
Google сделала шаг, который меняет саму логику работы с видео: не «сгенерировал и выбросил», а «нарастил, проверил дёшево, довёл до финала». По моим наблюдениям, схема «черновик 360p, потом финал» ближе к тому, как работают профессиональные видеостудии с превью, чем к тому, что предлагали видеомодели раньше.
Оговорка честная: русский язык не оценен, доступ из РФ ограничен, бесплатного тарифа нет. Для большинства авторов Дзена это пока инструмент «на вырост», но экономику видеоконтента он уже пересчитывает для тех, кто работает на международные рынки.
Что сделать сегодня: откройте quickstart cookbook от Google и попробуйте сгенерировать 10-секундный клип в 360p с двумя ключевыми кадрами. Это займёт 15 минут и покажет, подходит ли модель под ваши задачи, до того как вы потратите бюджет на полноразмерный рендер.
Частые вопросы
Можно ли использовать Gemini Omni бесплатно?
Нет. Модель доступна только на платных тарифах. Входные данные (текст, изображения, видео, аудио) стоят $1,50 за миллион токенов (токен, минимальная единица, которую обрабатывает модель; для видео 720p это 5 792 токена за секунду). Выходное видео стоит $17,50 за миллион токенов, что даёт около $0,10 за секунду видео 720p.
Как работает расширение сцены до 40 секунд?
Вы загружаете клип до 10 секунд (или используете ранее сгенерированный). Модель анализирует до 10 секунд контекста и дописывает продолжение от 3 до 10 секунд за один вызов. Повторяя вызовы, можно нарастить видео до 40 секунд. Добавлять можно только в конец: вставка в середину или в начало не поддерживается.
Поддерживается ли русский язык?
По данным Google, полностью поддерживается только английский. Другие языки компания не оценивала. На практике это значит, что промпты лучше писать на английском, а результаты на других языках могут быть непредсказуемыми.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Nvidia строит экосистему вокруг GPU: искусственный интеллект требует не чипа, а дата-центра целиком
Компания Nvidia 28 мая 2025 года, в день отчёта о квартальных результатах, сместила фокус инвесторов с GPU на целую экосистему управления данными в…
Нейросети и музыка: EDM-продюсеры нашли 5 признаков подделки треков от Suno
Музыканты, работающие в электронной танцевальной музыке (EDM), всё чаще сталкиваются с потоком треков, сгенерированных нейросетями и выдаваемых за авторскую…

Галлюцинации нейросетей ломают прошивки: репозиторий на 8 плат учит ИИ реальной распиновке
Компания или продукт не названы «третьим» или «впервые» в источнике, порядковых нет. Проверяю числа: 8 плат, конкретные названия (STM32F411, ESP32-C6-LCD-1.47,…
Комментарии