Если вы следили за эволюцией инструментов генерации визуала, то знаете: линейка FLUX.1 и FLUX.2 от Black Forest Labs строилась вокруг одной задачи – картинки. Хорошие картинки, надо признать. Но 23 июля 2026 года компания сделала шаг, который меняет саму логику продукта: представила FLUX 3 нейросеть, где изображение, видео и аудио обучаются совместно в одной архитектуре. Без точки в названии – и это не случайность.
Ключевое отличие FLUX 3 от предшественников – метод обучения под названием Self-Flow. Это фреймворк самообучения на основе flow matching, разработанный внутри Black Forest Labs. Звучит абстрактно, но суть прикладная: модель не учится генерировать видео «отдельно» от звука или изображения. Она видит их одновременно и учится понимать связи – как движение объекта соотносится со звуком, как взаимодействуют предметы в кадре.
Отсюда вытекает то, что отличает FLUX 3 от большинства конкурентов. Это не набор специализированных модулей, состыкованных через API, а единая foundation model. Такой подход, теоретически, даёт более согласованный результат: когда модель «помнит», что вода плещется с определённым звуком, генерированное видео выглядит убедительнее.

Видео в раннем доступе – это видео до 20 секунд с включённым звуком. Разрешение 720p. Список поддерживаемых сценариев достаточно широкий: генерация по текстовому запросу, по стартовому кадру, по референсному изображению субъекта, по референсному видео с персонажем, по ключевым кадрам, комбинирование нескольких видео. Плюс возможность «дозаписать» продолжение, если вы даёте видео и аудио на вход.
Для маркетологов и контент-продакшнов это практически готовый конвейер. Представьте: референс персонажа из одного видео, стиль из другого, ключевые кадры заданы вручную – и 20 секунд связного ролика с синхронным звуком. Именно такой сценарий открывает новые возможности для контент-завода на нейросетях, где объём важнее ручной доводки каждого кадра.
Black Forest Labs провела человеческую оценку 10-секундных роликов в 720p со звуком. Результаты против трёх конкурентов выглядят так: против Grok Imagine Video – win rate 69%, против Seedance 2.0 – 52%, против Gemini Omni Flash – 52%.
Стоит уточнить: «win rate» в человеческой оценке – это не объективная метрика. Это «предпочтение аннотаторов». Сами представители компании признают, что в инструментарии оценки FLUX 3 есть пространство для улучшения (harness), и обещают рост показателей. Так что эти цифры – скорее ориентир, чем финальный benchmark.

Генерация изображений в раннем доступе появится «в ближайшие несколько недель» – по состоянию на дату анонса. Предварительные оценки, сделанные ещё в процессе обучения, фиксируют заметный прирост по двум направлениям: работа со сложными промптами и рендеринг текста на нескольких языках. Это хорошая новость для тех, кто использует генерацию изображений FLUX в связке с автоматическими контентными системами – поддержка мультиязычного текста в кадре была реальной болью предыдущих версий.
Стили, пропорции, разрешения – всё это поддерживается в широком диапазоне. Насколько именно широком, покажут тесты после релиза. Пока – обещания и несколько примеров на сайте компании.
Пожалуй, самая нетривиальная часть анонса – сотрудничество с Mimic Robotics. Black Forest Labs исследует применение FLUX 3 как модели предсказания поведения роботов. Логика понятна: если модель умеет предсказывать, как объект будет двигаться в следующем кадре (что и нужно для хорошей видеогенерации), то тот же механизм можно попробовать развернуть для планирования физических действий робота.
Это область AI alignment в широком смысле – попытка перенести визуальное понимание мира в действие. Насколько FLUX 3 окажется рабочей основой для таких задач, пока неясно. Партнёрство с Mimic Robotics находится на исследовательской стадии, доступ к FLUX-mimic и FLUX 3 Action откроется только для избранных исследовательских институтов и коммерческих партнёров.
Black Forest Labs обозначила последовательность выхода продуктов. FLUX 3 Video – видео и аудио через API, уже в раннем доступе. FLUX-mimic и FLUX 3 Action – предсказание поведения роботов, ограниченный доступ через партнёров. FLUX 3 Image – генерация и редактирование изображений через API, раннее доступ через несколько недель. FLUX 3 Dev – открытая мультимодальная основа для видео, аудио, изображений и предсказания действий. Параллельно уже началась разработка следующего поколения модели.
Для команд, строящих автоматический блог с ИИ или другие контентные пайплайны, релевантен в первую очередь FLUX 3 Image – его появление в API открывает апгрейд существующих систем без смены архитектуры.
Честный ответ: пока не полностью понятно. Win rate 69% против Grok Video – хороший результат, но не разгром. Изображения ещё не вышли. Роботика – это горизонт на годы, не на недели. Но стратегическая логика FLUX 3 нейросеть как единой мультимодальной основы выглядит убедительно: вместо зоопарка специализированных моделей – одна, которая «понимает» мир как связную систему.
Для маркетинговых команд, которые уже работают с видео-контентом в промышленных объёмах, это сигнал: смотреть на генерацию видео с ИИ-аватаром и оценивать, как FLUX 3 ляжет поверх существующих процессов. Не революция с завтрашнего утра, но вектор направления индустрии читается чётко.
Black Forest Labs начинала с того, что несколько бывших разработчиков Stable Diffusion решили сделать лучший генератор изображений. FLUX 3 – это уже совсем другая история: попытка построить один универсальный визуальный движок для всего. Получится или нет – узнаем по мере выхода реальных апдейтов в API.
