FLUX 3 нейросеть: Black Forest Labs выпустила мультимодальный ИИ для изображений, видео и аудио

Фабио Де ЛукаМаркетинг3 недели назад93 Просмотры

Если вы следили за эволюцией инструментов генерации визуала, то знаете: линейка FLUX.1 и FLUX.2 от Black Forest Labs строилась вокруг одной задачи – картинки. Хорошие картинки, надо признать. Но 23 июля 2026 года компания сделала шаг, который меняет саму логику продукта: представила FLUX 3 нейросеть, где изображение, видео и аудио обучаются совместно в одной архитектуре. Без точки в названии – и это не случайность.

Что такое Self-Flow и почему это важно

Ключевое отличие FLUX 3 от предшественников – метод обучения под названием Self-Flow. Это фреймворк самообучения на основе flow matching, разработанный внутри Black Forest Labs. Звучит абстрактно, но суть прикладная: модель не учится генерировать видео «отдельно» от звука или изображения. Она видит их одновременно и учится понимать связи – как движение объекта соотносится со звуком, как взаимодействуют предметы в кадре.

Отсюда вытекает то, что отличает FLUX 3 от большинства конкурентов. Это не набор специализированных модулей, состыкованных через API, а единая foundation model. Такой подход, теоретически, даёт более согласованный результат: когда модель «помнит», что вода плещется с определённым звуком, генерированное видео выглядит убедительнее.

type=diagram | about=Архитектура Self-Flow: совместное обучение изображений, видео и аудио в единой модели FLUX 3 | steps=Изображение -> Видео -> Аудио -> Единая архитектура Self-Flow -> Расширение: р

Что умеет видеогенерация прямо сейчас

Видео в раннем доступе – это видео до 20 секунд с включённым звуком. Разрешение 720p. Список поддерживаемых сценариев достаточно широкий: генерация по текстовому запросу, по стартовому кадру, по референсному изображению субъекта, по референсному видео с персонажем, по ключевым кадрам, комбинирование нескольких видео. Плюс возможность «дозаписать» продолжение, если вы даёте видео и аудио на вход.

Для маркетологов и контент-продакшнов это практически готовый конвейер. Представьте: референс персонажа из одного видео, стиль из другого, ключевые кадры заданы вручную – и 20 секунд связного ролика с синхронным звуком. Именно такой сценарий открывает новые возможности для контент-завода на нейросетях, где объём важнее ручной доводки каждого кадра.

Цифры: как FLUX 3 выглядит на фоне конкурентов

Black Forest Labs провела человеческую оценку 10-секундных роликов в 720p со звуком. Результаты против трёх конкурентов выглядят так: против Grok Imagine Video – win rate 69%, против Seedance 2.0 – 52%, против Gemini Omni Flash – 52%.

Стоит уточнить: «win rate» в человеческой оценке – это не объективная метрика. Это «предпочтение аннотаторов». Сами представители компании признают, что в инструментарии оценки FLUX 3 есть пространство для улучшения (harness), и обещают рост показателей. Так что эти цифры – скорее ориентир, чем финальный benchmark.

type=chart | about=Win rate FLUX 3 против конкурентов по результатам человеческой оценки 10-секундных видео | headline=FLUX 3 побеждает в 69% случаев | chart_type=bar | data=Grok Imagine Video:69; See

Изображения: чуть позже, но с улучшенным движком

Генерация изображений в раннем доступе появится «в ближайшие несколько недель» – по состоянию на дату анонса. Предварительные оценки, сделанные ещё в процессе обучения, фиксируют заметный прирост по двум направлениям: работа со сложными промптами и рендеринг текста на нескольких языках. Это хорошая новость для тех, кто использует генерацию изображений FLUX в связке с автоматическими контентными системами – поддержка мультиязычного текста в кадре была реальной болью предыдущих версий.

Стили, пропорции, разрешения – всё это поддерживается в широком диапазоне. Насколько именно широком, покажут тесты после релиза. Пока – обещания и несколько примеров на сайте компании.

Роботика: самый неожиданный поворот

Пожалуй, самая нетривиальная часть анонса – сотрудничество с Mimic Robotics. Black Forest Labs исследует применение FLUX 3 как модели предсказания поведения роботов. Логика понятна: если модель умеет предсказывать, как объект будет двигаться в следующем кадре (что и нужно для хорошей видеогенерации), то тот же механизм можно попробовать развернуть для планирования физических действий робота.

Это область AI alignment в широком смысле – попытка перенести визуальное понимание мира в действие. Насколько FLUX 3 окажется рабочей основой для таких задач, пока неясно. Партнёрство с Mimic Robotics находится на исследовательской стадии, доступ к FLUX-mimic и FLUX 3 Action откроется только для избранных исследовательских институтов и коммерческих партнёров.

Дорожная карта на ближайшие месяцы

Black Forest Labs обозначила последовательность выхода продуктов. FLUX 3 Video – видео и аудио через API, уже в раннем доступе. FLUX-mimic и FLUX 3 Action – предсказание поведения роботов, ограниченный доступ через партнёров. FLUX 3 Image – генерация и редактирование изображений через API, раннее доступ через несколько недель. FLUX 3 Dev – открытая мультимодальная основа для видео, аудио, изображений и предсказания действий. Параллельно уже началась разработка следующего поколения модели.

Для команд, строящих автоматический блог с ИИ или другие контентные пайплайны, релевантен в первую очередь FLUX 3 Image – его появление в API открывает апгрейд существующих систем без смены архитектуры.

Что это меняет на практике

Честный ответ: пока не полностью понятно. Win rate 69% против Grok Video – хороший результат, но не разгром. Изображения ещё не вышли. Роботика – это горизонт на годы, не на недели. Но стратегическая логика FLUX 3 нейросеть как единой мультимодальной основы выглядит убедительно: вместо зоопарка специализированных моделей – одна, которая «понимает» мир как связную систему.

Для маркетинговых команд, которые уже работают с видео-контентом в промышленных объёмах, это сигнал: смотреть на генерацию видео с ИИ-аватаром и оценивать, как FLUX 3 ляжет поверх существующих процессов. Не революция с завтрашнего утра, но вектор направления индустрии читается чётко.

Black Forest Labs начинала с того, что несколько бывших разработчиков Stable Diffusion решили сделать лучший генератор изображений. FLUX 3 – это уже совсем другая история: попытка построить один универсальный визуальный движок для всего. Получится или нет – узнаем по мере выхода реальных апдейтов в API.

type=cta | about=Внедрение FLUX 3 и ИИ-инструментов в контент-конвейеры и маркетинговые автоматизации | hook=Хотите FLUX 3 в своём контент-конвейере?

Соц. сети
  • Pinterest1360
  • Youtube1285
  • WhatsApp
  • Telegram1608
  • VKontakte102
  • TikTok1059
Loading Next Post...
Боковая панель Поиск
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...