Разбор устройств

Новостной портал GADGETPAGE » Разбор устройств » Google выпустила Gemini Omni — модель генерирует видео из текста, фото, аудио и других данных
как разобрать, инструкция по разбору

Google выпустила Gemini Omni — модель генерирует видео из текста, фото, аудио и других данных

Google представила семейство генеративных моделей Gemini Omni. Первая доступная версия называется Gemini Omni Flash и предназначена для создания коротких видеороликов на основе разных типов входных данных: текста, изображений, аудио, видео и других материалов.

Главное отличие новой модели — мультимодальность. Она не ограничивается обычным текстовым запросом, а может использовать несколько источников одновременно. Например, пользователь может дать фотографию, описание сцены и аудио, а система соберёт на их основе видеоролик.


Что умеет Gemini Omni Flash

Модель создаёт ролики со звуком продолжительностью до 10 секунд. Google уже работает над увеличением этого лимита, но на старте речь идёт именно о коротких видео.

Gemini Omni Flash может генерировать видео с нуля или редактировать уже существующие кадры. Важная функция — преобразование одного видео в другое. Пользователь может описать изменение обычным языком, а модель должна сохранить логику сцены, движение персонажей и последовательность действий.

Например, можно не пересоздавать ролик заново, а попросить изменить окружение, стиль, объект или отдельную деталь внутри уже готового видео.

Чем модель отличается от Veo

У Google уже есть модель Veo для генерации видео. Gemini Omni отличается тем, что сильнее опирается на общую экосистему Gemini и лучше работает с разными типами входных данных.

Veo в первую очередь воспринималась как видеогенератор. Gemini Omni подаётся шире: как система, которая понимает текст, изображение, звук, видео и контекст запроса одновременно.

Google отдельно подчёркивает, что модель лучше учитывает физику сцены и устройство реального мира. Это должно помогать в роликах, где важны движение жидкости, гравитация, взаимодействие объектов и правдоподобное поведение персонажей.

Что с аватарами и голосом

Пользователи смогут создавать цифровые аватары и озвучивать их своим голосом. Это один из самых чувствительных сценариев, потому что он связан с внешностью и речью реального человека.

Google ограничила возможность изменять чужую речь в видео. Это сделано для снижения риска подделок, когда один человек может быть показан говорящим то, чего он не произносил.

Сгенерированные ролики автоматически получают невидимый цифровой водяной знак SynthID. Он нужен для проверки происхождения контента и помогает отличать созданные ИИ материалы от обычных видео.

Где доступна модель

Gemini Omni Flash уже доступна глобально подписчикам Google AI Plus, Pro и Ultra через приложение Gemini и сервис Google Flow.

Также бесплатный доступ к генератору постепенно открывается в YouTube Shorts и YouTube Create App. Это важная часть запуска: Google явно хочет встроить новую модель не только в профессиональные ИИ-инструменты, но и в массовое создание коротких роликов.

Для авторов Shorts это может стать способом быстро делать визуальные сцены, фоны, вставки и экспериментальные клипы без отдельного видеомонтажа.

Что пока ограничивает запуск

Главное ограничение — длина ролика. 10 секунд подходят для коротких фрагментов, вставок и экспериментов, но этого мало для полноценного видеопроизводства.

Также остаются вопросы к стабильности персонажей, точности деталей, управлению сценой и правам на использование внешности и голоса. Даже сильная видеомодель может ошибаться в движениях, анатомии, логике объектов и последовательности кадров.

Отдельная тема — безопасность. Чем проще создавать ролики с реалистичными людьми и голосами, тем выше риск дипфейков, мошенничества и фальшивых публичных заявлений.

Что будет дальше

Google планирует добавить поддержку вывода аудио и статических изображений, а также расширять длительность видео. Это означает, что Gemini Omni может стать не отдельным видеогенератором, а универсальной системой для создания контента в разных форматах.

Пока модель выглядит как важный шаг в сторону мультимодального видеопроизводства. Она не заменяет полноценный монтаж и режиссуру, но делает генерацию коротких роликов более гибкой: можно работать не только с текстом, а сразу с набором данных, которые задают стиль, образ, звук и контекст сцены.

Остались вопросы? Задавайте их в комментарии, и мы постараемся ответить на них.