24 июля 2026 года немецкая компания Black Forest Labs анонсировала FLUX 3 – и сразу обозначила смену курса. Предыдущие модели FLUX.1 и FLUX.2 были заточены под генерацию и редактирование изображений. FLUX 3 претендует на роль foundation model для визуального интеллекта в широком смысле: картинки, ролики, звук, а в перспективе – предсказание поведения роботов. Убрали даже точку в названии, словно подчёркивая разрыв с прошлым.
Что здесь технически важно: всё это работает через единую архитектуру, а не через набор склеенных между собой специализированных моделей. Обучение – совместное. Метод называется Self-Flow: это self-supervised framework на основе flow matching, разработанный самой Black Forest Labs. Идея в том, что модель учится на собственных предсказаниях без явной разметки – отсюда «само-». Насколько это даёт реальный выигрыш перед другими подходами, покажут независимые benchmark-оценки, которых пока нет.

Видео уже доступно в режиме раннего доступа. Максимальная длина ролика – 20 секунд, включая звук, разрешение 720p. Набор рабочих сценариев довольно широкий: текст в видео, задание стартового кадра, привязка персонажа через референсное изображение, импорт героя из референсного видео, продолжение по видео и аудио, работа с ключевыми кадрами, склейка нескольких роликов.
Компания опубликовала результаты человеческой оценки на 10-секундных роликах со звуком в 720p. FLUX 3 выиграл у Grok Imagine Video в 69% случаев, у Seedance 2.0 – в 52%, у Gemini Omni Flash – тоже в 52%. Показатели против Seedance и Gemini честно говоря скромные: 52% – это почти монетка. Сам Black Forest Labs признаёт, что «есть куда расти», и ждёт улучшений через обратную связь от программы раннего доступа. Так что воспринимать эти цифры как финальный вердикт не стоит.

Функция генерации изображений в ранний доступ ещё не вышла – по заявлению компании, это произойдёт «в течение нескольких недель». Предварительные оценки во время обучения показали заметный прогресс по сравнению с предыдущими моделями серии: лучше справляется со сложными промптами, улучшен рендеринг многоязычного текста. Посмотреть примеры можно в галерее ИИ-изображений – там хорошо видно, каким уровнем детализации уже владеют современные диффузионные модели.
FLUX 3 мультимодальная модель поддерживает широкий диапазон стилей, форматов и разрешений. Это важно для тех, кто строит на её основе автоматизированные пайплайны: чем гибче модель в форматах выдачи, тем меньше конвертаций и потерь по дороге. Для авто-блога с искусственным интеллектом, например, критична именно эта гибкость – разные посты требуют разных пропорций картинок.
Пожалуй, самое любопытное в анонсе – сотрудничество с Mimic Robotics. Идея в том, чтобы использовать FLUX 3 как модель предсказания поведения робота. Это направление называют FLUX-mimic или FLUX 3 Action, и сейчас оно открыто только для отдельных исследовательских институтов и коммерческих партнёров.
Логика здесь понятна: если модель уже умеет «понимать» визуальные последовательности достаточно хорошо для видео, предсказывать следующее состояние робота – это следующий шаг в той же цепочке. Получается что-то вроде video-action model. Насколько это сработает в реальных промышленных условиях – открытый вопрос. Но сам факт, что компания по генерации изображений движется в сторону физических роботов, говорит о серьёзных амбициях.
Black Forest Labs обозначила несколько этапов. Первый – FLUX 3 Video через API и приватный список ожидания – уже запущен. Далее: FLUX-mimic и FLUX 3 Action для робототехники через партнёров, FLUX 3 Image для генерации и редактирования, FLUX 3 Dev – открытый доступ к мультимодальному backbone для видео, аудио, изображений и предсказания поведения. Параллельно команда уже начала разработку следующего поколения модели.
Для тех, кто строит контентные пайплайны прямо сейчас, это означает следующее: функция генерации изображений FLUX в ближайших проектах будет работать ещё, а вот видеогенерацию имеет смысл держать в поле зрения – через несколько месяцев картина может сильно измениться.
Объединение изображений, видео и аудио в одной модели – это не просто удобство. Это смена архитектуры контент-завода. Сейчас типичный пайплайн выглядит так: отдельная модель для текста, отдельная для картинки, отдельная для видео, отдельная для озвучки. Каждый стык – это потенциальный сбой стиля, разрыв в консистентности, дополнительный шаг настройки.
Единая модель, теоретически, должна держать стилистическую связность лучше – если обучение совместное, то «язык» между модальностями общий. На практике это ещё надо проверить, но направление логичное. Для тех, кто уже строит или планирует строить контент-завод на ИИ, FLUX 3 мультимодальная модель – это один из первых реальных кандидатов на роль такого единого ядра.
Отдельный вопрос – звук. Видео со звуком без отдельного TTS-шага – это реально упрощает производство генерации видеоконтента с ИИ. Хотя качество генерируемого аудио пока не оценено независимо – это один из белых пятен в текущей документации.
FLUX 3 – это заявка на переход от инструмента генерации картинок к универсальному мультимодальному ядру. Компания Black Forest Labs делает ставку на единую архитектуру и метод Self-Flow, который позволяет расширять модель на новые модальности без полного переобучения. Победа 69% над Grok Imagine Video выглядит убедительно; 52% против Seedance 2.0 и Gemini Omni Flash – скромнее, и сами разработчики это признают. Путь до открытого доступа к полному стеку займёт несколько месяцев. Но уже сейчас это одна из наиболее интересных архитектурных ставок в сегменте мультимодальных AI-систем – особенно с учётом того, что она открыта для открытого доступа через FLUX 3 Dev.
