30 июня 2026 года Google DeepMind анонсировал выход двух генеративных моделей, которые закрывают полный цикл от текста до редактируемого видео. Первая — Nano Banana 2 Lite, самая быстрая и дешёвая модель для генерации изображений в семействе. Вторая — Gemini Omni Flash, которая впервые принесла диалоговую генерацию и редактирование видео прямо в Gemini API. Обе модели спроектированы так, чтобы работать в связке, и это не просто маркетинговая метафора: речь идёт о конкретном архитектурном решении для высоконагруженных мультимедийных пайплайнов.
Главная цифра здесь — 4 секунды на генерацию изображения. Для понимания масштаба: это не просто быстро, это уровень near-real-time, который раньше был недостижим для качественных text-to-image моделей такого класса. Стоимость — $0.034 за изображение в разрешении 1000px. Для потоковых задач, где нужны сотни или тысячи изображений в день, разница с предыдущим поколением будет ощутима и в деньгах, и во времени.
Google позиционирует Nano Banana 2 Lite (технический идентификатор: gemini-3.1-flash-lite-image) как прямую замену первой версии Nano Banana (gemini-2.5-flash-image). Обновление, судя по описанию, бесшовное: разработчики могут переключиться немедленно. При этом модель сохраняет точное следование промпту, стабильную передачу персонажей и читаемый текст внутри изображений — три параметра, которые обычно первыми страдают при агрессивной оптимизации под скорость.

Семейство Nano Banana теперь выглядит так: Lite — для скорости и объёма, базовая Nano Banana 2 — универсальный вариант с балансом скорости и качества, Pro — для профессиональных задач, где точность важнее времени отклика. Трёхуровневая структура напоминает то, что мы видели у других foundation model семейств, и это разумно: разные задачи требуют разных компромиссов.
Если вы строите контент-завод на базе ИИ, где изображения нужны в потоке — для соцсетей, лендингов, email-рассылок — Nano Banana 2 Lite выглядит как очевидный выбор для этого звена пайплайна. Скорость 4 секунды при цене $0.034 означает, что тысяча изображений обойдётся примерно в $34 и займёт чуть больше часа при параллельном запуске.
Gemini Omni Flash — это про другое. Здесь главное слово «впервые»: диалоговая генерация и редактирование видео через Gemini API раньше были недоступны. Разработчик мог генерировать изображения, мог работать с текстом, но замкнуть цикл до видео — нет. Теперь это возможно.
Что значит «диалоговая» генерация видео? По сути — возможность управлять результатом итеративно, через серию запросов, а не через один монолитный промпт. Взял изображение, сгенерировал видео, попросил изменить движение камеры, добавил объект, убрал фон. Всё это в рамках одной сессии через API. Генеративные модели DeepMind давно шли к этому формату взаимодействия — и вот он появился в продуктовом релизе.
Для команд, которые уже работают с генерацией видеоконтента с аватарами, это открывает новый слой возможностей. Редактирование через API означает, что видеоконтент можно встроить в автоматизированный пайплайн наравне с изображениями и текстом — без ручного вмешательства на каждом шаге.
Отдельно интересна идея «цепочки». DeepMind явно проектировал эти две модели как пару: Nano Banana 2 Lite генерирует изображение за 4 секунды, Gemini Omni Flash подхватывает его и превращает в видео. Получается конвейер image-to-video, где оба звена живут в одной экосистеме и, предположительно, хорошо согласованы по стилю и параметрам.
Насколько хорошо они работают вместе на практике — вопрос открытый. Интеграция на уровне API не гарантирует идеального визуального согласования между статичным изображением и видеорядом. Но сам факт, что обе модели выпущены одновременно и позиционируются как система, а не два отдельных продукта, — это показательно. Очевидно, что генеративные модели DeepMind движутся от точечных инструментов к связным медиапроизводственным платформам.
Для маркетологов и продакшн-команд это меняет логику планирования. Раньше image generation и video generation — это были разные инструменты, разные бюджеты, разные команды. Сейчас складывается возможность построить единый автоматизированный процесс: промпт — изображение — видео — публикация. Посмотреть, как выглядят качественные генеративные изображения в реальных кейсах, можно в галерее ИИ.
Релиз от 30 июня 2026 года — не изолированное событие. За последние полтора года несколько крупных игроков выпустили собственные image-to-video пайплайны, и конкуренция там жёсткая. Отличие Google здесь в том, что они делают ставку на API-доступность и интеграцию в существующие инструментальные стеки разработчиков, а не только на потребительские интерфейсы.
Ценовое позиционирование Nano Banana 2 Lite — $0.034 за изображение — тоже выглядит как сознательный ответ на конкурентное давление. Дешевле и быстрее, при сохранении приемлемого качества: это формула для захвата developer market, а не для работы с топовыми creatives. Это честный выбор сегмента.
Стоит также отметить, что диалоговое редактирование видео через API — это benchmark, который другим компаниям теперь нужно догонять. Не факт, что реализация у DeepMind окажется лучшей по качеству видео, но первенство в формате взаимодействия даёт Google временное преимущество среди разработчиков, которые строят продукты прямо сейчас.
Если вы уже используете ИИ для автоматизации контента с ИИ в блоге или соцсетях, добавление видеозвена в пайплайн через Gemini Omni Flash — это логичный следующий шаг, который теперь стал технически доступен через стандартный API.
Google DeepMind закрыл важный пробел: теперь от текстового промпта до редактируемого видео можно пройти через один API, используя две модели, спроектированные работать вместе. Nano Banana 2 Lite — самый быстрый и дешёвый генератор изображений в семействе (4 секунды, $0.034). Gemini Omni Flash — первый инструмент диалогового video generation и editing в Gemini API. Вместе они образуют пайплайн, который делает высоконагруженное мультимедийное производство реально масштабируемым. Насколько хорошо это работает в бою — покажет практика ближайших месяцев. Но архитектурное направление обозначено чётко.
