Что нового в модели Omni
Контент не содержит достаточной фактической базы для написания новости по формату research. Оригинал представляет собой промо-интервью без цифр, бенчмарков, дат, методов и результатов исследования. Генерация текста с выдуманными данными противоречит правилу достоверности. Отказываюсь генерировать.

Тем не менее, выполняю задание максимально честно, опираясь строго на то, что есть в источнике.
Google представила Gemini Omni Flash, первую версию мультимодальной (работающей сразу с текстом, изображениями и видео) модели Gemini Omni, которая генерирует и редактирует видео в режиме диалога, без точной даты релиза и публичных бенчмарков.
Gemini Omni заявлена как модель, принимающая любой формат на входе и отдающая любой на выходе, включая видео, а генерация и монтаж сводятся к текстовому промпту (инструкции на естественном языке). Если заявления подтвердятся на практике, порог входа в видеопроизводство снизится до умения формулировать запрос.
Команда Google DeepMind рассказала о модели в формате видеоинтервью. Трое участников проекта объяснили, почему начали именно с генерации видео, и показали несколько демонстраций. Конкретных цифр производительности, размеров модели и условий доступа источник не приводит.
| Показатель | Значение | Источник |
|---|---|---|
| Название модели | Gemini Omni | блог Google DeepMind |
| Первая версия | Gemini Omni Flash | блог Google DeepMind |
| Основная задача | генерация и редактирование видео через диалог | блог Google DeepMind |
| Бенчмарки и метрики качества | не раскрыты | блог Google DeepMind |
| Дата публичного запуска | не названа | блог Google DeepMind |
| Цена и условия доступа | не раскрыты | блог Google DeepMind |
Что показали в демо?
Три члена команды Google DeepMind представили модель: исследователь Мохаммад Бабаизаде, продакт-менеджер Аниш Нангия и инженер-исследователь Сара Сюй.
В ходе интервью они проверяли Omni Flash на игровых задачах: поменять причёски между собой, превратить участников в ленивцев, «посадить» кота Сары на стол перед камерой. Все задачи формулировались текстом в диалоге с моделью.
Google позиционирует Omni как инструмент для создателей контента: модель принимает любой ввод (текст, изображение, видео) и отдаёт результат в любом формате, включая видео.
Что известно о возможностях?
- Генерация видео из текста. Пользователь описывает сцену словами, модель создаёт ролик. Технические параметры (разрешение, длительность, частота кадров) источник не раскрывает.
- Редактирование существующего видео через диалог. Можно менять объекты в кадре, добавлять элементы, трансформировать персонажей. Границы возможностей не описаны.
- Мультимодальный вход. Модель заявлена как принимающая «любой ввод». Какие именно форматы поддерживаются, источник не уточняет.
Конкретных бенчмарков, сравнений с конкурентами (Sora от OpenAI, Veo от того же Google, Kling от Kuaishou) и независимых тестов в материале нет. Мохаммад Бабаизаде ограничился фразой: «Здесь нет потолка». Сара Сюй добавила: «Дальше будет только лучше».
Оба высказывания выражают энтузиазм команды, но не содержат проверяемых обещаний.
Источник представляет собой промо-интервью без единой метрики. Нет данных о размере модели, обучающих данных (данных, на которых модель училась), задержке генерации, качестве на стандартных тестах. Демонстрации проведены командой разработчиков в контролируемых условиях. До появления независимых обзоров и публичного доступа оценить реальное качество невозможно.
Что это значит для вас?
Авторам Дзена и видеоблогерам. Если Omni Flash станет публично доступной, появится способ собирать короткие видео из текстового описания без монтажной программы. Для тех, кто пишет тексты и боится камеры, это потенциально снимает барьер. Но пока нет доступа, готовить контент-план под инструмент рано.
Маркетологам. Генерация рекламных роликов через промпт может сократить цикл продакшена с дней до минут. Однако без данных о качестве, водяных знаках и лицензии на коммерческое использование планировать бюджет на инструмент преждевременно.
Тем, кто работает на русском языке. Google не упоминает поддержку кириллицы в промптах и генерируемых субтитрах. Предыдущие модели Gemini работали с русским языком, но качество генерации видео по русскоязычным описаниям пока не проверено ни одним независимым источником. Это ограничение стоит учитывать до первых реальных тестов.
Для тех, кто ищет работающие инструменты прямо сейчас: 70mai модель Dash Cam Omni или X200 и подобные устройства никак не связаны с Gemini Omni от Google, несмотря на совпадение слова «Omni» в названии. Одно записывает видео с дороги, другое генерирует видео из текста.
Я отношусь к анонсу сдержанно. Промо-ролик с тремя сотрудниками, которые превращают себя в ленивцев, это эффектная демонстрация, но не доказательство. Google за последние два года анонсировала несколько генеративных видеомоделей (Imagen Video, Veo, Veo 2), часть из которых так и не получила широкого публичного доступа. До тех пор пока Omni Flash не окажется в руках пользователей и не пройдёт независимые тесты, это заявление о намерениях, а не готовый инструмент. Мы в dzen.guru протестируем модель, как только она станет доступна, и расскажем, работает ли она с русскоязычными промптами.
Финальная рекомендация: не перестраивайте редакционные процессы под инструмент без публичного доступа и проверенных результатов, но добавьте Gemini Omni Flash в список для тестирования, как только Google откроет регистрацию.
По данным блога Google DeepMind

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Needle 2 весит 14 МБ и работает без GPU: лёгкие нейросети дошли до умных часов
Считаю лид: «Компания Cactus Compute в июне 2025 года выпустила Needle 2, открытую нейросеть на 45 миллионов параметров, которая умещается в файл размером 14…

Защита данных LLM на практике: как встроить фильтр без потери стриминга
Компания, стоящая за Guardrails Filter, столкнулась с тем, что замаскировать персональные данные в запросах к большой языковой модели (LLM, нейросеть, которая…

Fine tuning нейросети за вечер: дообучаем модель в Colab бесплатно методом LoRA
Дообучение (fine-tuning) нейросети для задач логического рассуждения на русском языке звучит сложно, но Google Colab, открытый датасет и метод LoRA позволяют…
Комментарии