Если открыть страницу deepmind.google/models сегодня, первое, что бросается в глаза – это не очередной пресс-релиз про «прорыв», а реально разросшийся каталог с разными классами систем. Текстовые модели, мультимодальные, музыкальные, видеогенерация, робототехника. Всё под одной крышей. Попробую объяснить, что тут к чему.
Главная новинка июля 2026 – Gemini 3.5 Flash. Позиционируется как модель, сочетающая «frontier intelligence with action». Это не маркетинговый слоган, а конкретный технический сдвиг: модели семейства Gemini 3.5 стали заметно ориентированы на агентное использование. То есть не просто генерировать текст, а выполнять цепочки действий: использование компьютера (computer use), вызов инструментов, работа внутри Gemini Enterprise Agent Platform.
В июне 2026 DeepMind объявил о поддержке computer use прямо в Gemini 3.5 Flash – модель может управлять интерфейсами, читать экран и выполнять задачи без отдельного «агентного фреймворка». Для тех, кто занимается автоматизацией бизнес-процессов с ИИ, это означает снижение порога входа: одна модель вместо связки из нескольких компонентов.
Да, именно так – Nano Banana 2 Lite. С эмодзи 🍌 на официальной странице. Здесь DeepMind, судя по всему, сознательно уходит от корпоративной серьёзности в сторону пользовательского продукта. Но за названием – конкретная функция: самая быстрая и эффективная модель для генерации и редактирования изображений в экосистеме Gemini.
Запущена в июне 2026 вместе с Gemini Omni Flash. Работает в AI Studio, приложении Gemini и на платформе для агентов. Для маркетинговых команд это, пожалуй, самый практичный инструмент прямо сейчас – скорость и стоимость генерации изображений в такого рода системах часто становятся узким местом.

Gemini Omni описывается как «create anything from anything» – слоган смелый, но за ним есть содержание. Модель умеет работать с видео как входными данными (не только изображениями или текстом) и создавать из этого другой контент. Ключевое слово – «leap in world understanding». Это не перефраз предыдущей версии.
Конкретный кейс из июньских анонсов: Google Flow использует Gemini Omni для создания видео. То есть цепочка «текст – видео» теперь проходит через мультимодальную модель с пониманием контекста, а не просто через генеративную трубу. Это важно для контент-производства в промышленных масштабах – качество «понимания» задания влияет на процент брака в выдаче.
Lyria 3 – третья итерация музыкальной модели. Умеет генерировать музыку с вокалом и работать с акустическими деталями (не просто «создай джингл», а управление тембром, аранжировкой, характером звука). Параллельно существует Gemini Audio – отдельная ветка для работы с голосом в реальном времени. «Advanced real-time audio models, built on Gemini» – это явный сигнал про голосовые агенты и live-переводы. В июне вышел анонс Gemini 3.5 Live Translate с поддержкой естественного голосового перевода.
Честно говоря, аудио-ветка у DeepMind сейчас выглядит скромнее видео-направления по количеству публичных кейсов. Но потенциал для маркетинговых задач – озвучка, подкасты, интерактивные голосовые интерфейсы – очевиден. Вопрос в том, как скоро эти инструменты станут доступны за пределами Google-экосистемы.
Veo – флагманская видеогенерация DeepMind. Доступна через Gemini app, Google Flow и AI Studio. Ориентирована на «кинематографическое» видео – то есть не просто зацикленные клипы, а работа со светом, камерой, нарративом. Imagen – аналог для статичных изображений, text-to-image.
Оба инструмента интегрированы в Gemini Enterprise Agent Platform, что означает возможность встраивания в агентные цепочки. Для автоматических контент-систем – авто-блогов, SMM-конвейеров – это меняет картину: визуальная составляющая теперь может генерироваться той же экосистемой, что и текст, без переключения между платформами.
Отдельно стоит сказать про Gemma 4. Это open-source модели DeepMind, позиционируемые как «наиболее интеллектуальные открытые модели, максимизирующие интеллект на параметр». В июне вышла Gemma 4 12B с унифицированной мультимодальной архитектурой без отдельного энкодера. DiffusionGemma, анонсированная тогда же, показала 4-кратное ускорение генерации текста.
Для компаний, которые не хотят зависеть от облачных API и предпочитают развёртывание на собственной инфраструктуре, Gemma 4 – реальная альтернатива проприетарным моделям. Особенно в контексте требований к обработке данных внутри периметра. Это нишевый, но растущий сегмент запросов.
В каталоге есть раздел «World models & embodied AI» – это Genie 3 и Gemini Robotics. Genie 3 описывается как «новый рубеж для world models» – систем, симулирующих физические среды. Gemini Robotics – vision-language-action модель для роботов.
Честный ответ: для большинства читателей этой статьи данные разработки пока нерелевантны с точки зрения применения в 2026 году. Это скорее индикатор стратегического направления Google DeepMind, чем что-то, что стоит закладывать в бизнес-план прямо сейчас. Хотя Gemini Robotics уже заявлена как «наиболее продвинутая» модель своего класса – значит, через пару лет этот разговор станет другим.
Отдельно в каталоге стоит SynthID – система встраивания водяных знаков в AI-генерированный контент. Для маркетинговых команд это двойной сигнал. Первое: регуляторный контекст ужесточается, разметка AI-контента перестаёт быть «по желанию». Второе: брендам, активно использующим генерацию, стоит понимать, что их материалы потенциально идентифицируемы. Это влияет на стратегию работы с AI-инструментами в агентурном контексте.

Если свести весь каталог к практическому выводу, картина такая. Модели Google DeepMind в 2026 году развиваются по двум осям: мультимодальность (один инструмент для текста, изображений, видео, аудио) и агентность (модели не просто отвечают, а действуют). Это меняет архитектуру того, как компании строят AI-системы.
Раньше нужно было собирать стек из разных поставщиков: один для текста, другой для картинок, третий для автоматизации. Сейчас Google DeepMind предлагает замкнутую экосистему через Gemini Enterprise Agent Platform и AI Studio. Это удобно, но создаёт зависимость. Альтернатива – открытые модели Gemma 4 для тех, кто предпочитает контроль над инфраструктурой.
Для маркетинговых задач: генерация и редактирование изображений (Nano Banana 2 Lite), видеоконтент (Veo через Flow), музыкальное сопровождение (Lyria 3), агентная автоматизация (Gemini 3.5 в Enterprise Platform). Всё это уже доступно. Вопрос не «когда использовать», а «как выстроить процесс так, чтобы это работало без постоянного ручного участия».
