Когда исследователь Мохаммад Бабаизаде говорит «нет потолка», это не маркетинговая фраза. Это описание архитектурного выбора. Gemini Omni Flash, первый релиз новой модели, вышедший 13 августа 2026 года, построен так, чтобы принимать любой тип входных данных и выдавать любой тип контента. Генерация видео стала первым публичным применением – и это не случайность.
Продакт-менеджер Аниш Нангия и инженер-исследователь Сара Сюй на круглом столе с командой Google DeepMind объяснили логику: видео – это самый сложный модальный формат. Оно требует понимания движения, временной последовательности, освещения, звука, нарратива. Если модель справляется с видео, остальное – подмножество этой задачи.
Gemini Omni Flash позволяет редактировать и генерировать видео так же, как вести диалог. Не через интерфейс с ползунками и параметрами, а через обычные фразы. «Сделай кошку Сары на столе». «Замени причёски». «Превратите нас в ленивцев». Команда DeepMind буквально проверила это в прямом эфире. Модель справилась.
Это принципиально отличается от пайплайнов генерации видео с аватарами, которые работают по заданным маршрутам: промпт → скрипт → аватар → публикация. Omni Flash пытается убрать маршрут как концепцию вообще. Хотя насколько это работает в промышленных сценариях – пока открытый вопрос.
Команда описывает взаимодействие с моделью именно как «разговор». Не серию запросов, не цепочку команд. Разговор, где контекст накапливается, а модель помнит что вы делали пять итераций назад. Это меняет то, как работают итерации при создании контента – по крайней мере, в теории.
Для понимания масштаба: в пайплайнах контент-завода с автогенерацией видео каждый шаг обычно задаётся отдельно – сценарий, стиль, монтаж, брендинг. Omni предлагает сжать эти шаги в один диалог. Звучит удобно. Насколько это контролируемо для корпоративного использования – другой вопрос, и команда DeepMind на него пока не ответила публично.
Бабаизаде – исследователь, Нангия – продакт, Сюй – инженер. Три разных угла зрения, и в интервью это ощущается. Бабаизаде говорит об архитектуре и границах возможного. Нангия – о том, кому это нужно и зачем. Сюй – о том, как это работает изнутри и что будет дальше. «Дальше будет только лучше», сказала она. Это, конечно, не технический прогноз, но от инженера звучит немного иначе, чем от PR-команды.
Любопытно другое: они тестировали модель на себе. Поменяли причёски, превратились в ленивцев, материализовали воображаемую кошку на столе. Это не демонстрационный кейс из презентации – это скорее попытка показать, что диапазон применений действительно широкий. Gemini Omni генерация видео в такой подаче выглядит как инструмент, который ещё сам не знает, где его предел.
Нангия сфокусировался именно на этой аудитории. Создатели контента тратят огромную часть времени не на творческие решения, а на производственные операции: подобрать референс, описать стиль, перемонтировать, подогнать под формат платформы. Omni Flash нацелен на то, чтобы сократить эту часть до разговора.
Это перекликается с тем, что уже делают промпты для генерации видео из промптов на базе Seedance 2.0 – описываешь сцену, получаешь видео с движением и композицией. Разница в том, что Omni заявляет мультимодальность как базовое свойство, а не надстройку над текстовой моделью.
Если посмотреть на тренд целиком: модели становятся разговорными не только по форме, но и по логике работы. Раньше автоматизация предполагала жёсткий сценарий: если X, то Y, иначе Z. Сейчас граница между «автоматизацией» и «диалогом с моделью» размывается.
Для тех, кто строит авто-блог с генерацией контента, это означает пересмотр архитектуры: часть шагов, которые сейчас кодируются как отдельные узлы, потенциально можно передать в один разговорный контекст с моделью типа Omni. Теоретически. Практически – стабильность вывода в таких системах важнее гибкости, и здесь у новых разговорных моделей ещё есть что доказывать.
Omni Flash – это первый релиз. Google чётко говорит: это начало. Мохаммад Бабаизаде формулирует это как «нет потолка», что в переводе с языка исследователей означает примерно «мы не знаем, где остановимся». Это честно. И это одновременно означает, что строить продакшн-пайплайны на первом релизе Omni прямо сейчас – смелое решение. Подождать второй итерации, судя по словам Сары Сюй, имеет смысл.
Показательно, что Google подаёт Gemini Omni именно через людей – через трёх конкретных человек с именами и ролями, которые тестируют инструмент на себе. Это не случайный формат коммуникации. После нескольких лет споров об AI alignment и ответственности за генерируемый контент, показать авторов – это стратегия. Работает ли она? Ну, вы читаете этот материал.
Если посмотреть на примеры вроде кейса авто-блога на ИИ, становится понятно: реальная ценность не в том, насколько модель умная, а в том, насколько её выход предсказуем и управляем в конкретном бизнес-контексте. Gemini Omni пока отвечает на первый вопрос, со вторым – посмотрим.
Gemini Omni Flash – это заявка на новый класс моделей, где граница между «созданием контента» и «разговором» исчезает. Генерация видео выбрана точкой входа не потому что это проще, а потому что это сложнее всего. Если получается здесь, остальные модальности – дело времени.
Для маркетологов и создателей контента это означает: следите за тем, как развивается разговорный интерфейс к видео. Не потому что Omni Flash уже готов к промышленному использованию – а потому что именно этот вектор задаёт следующие два-три года в инструментах для работы с медиа. Команда DeepMind показала направление. Дальше – практика.
