Tongyi Lab открыл публичную бету под идентификатором wan3.0-video. Модель доступна на двух платформах: Alibaba Cloud Model Studio в регионе ap-southeast-1 и Qwen Cloud. Третий маршрут через wan.video анонсирован как «скоро», но будет платным для участников. Полный API-доступ тоже пока не совпадает с бетой — сам Alibaba уточняет, что выкатка продолжается. Это означает: оценивать можно, строить продакшн-пайплайн — рано.
Три вещи, которые Alibaba называет главными изменениями. Первое: нативная генерация 30-секундных роликов без склеек, что вдвое длиннее потолка Wan 2.6 и Wan 2.7 (там было 15 секунд). Второе: то, что компания называет «рендерингом реального уровня» — более выразительные персонажи, более стабильные референсы, лучшая передача цифрового контента в кадре. Третье — и это самое интересное — omni-reference.
Есть ещё четвёртое, которое Alibaba специально не выделяет, но которое для разработчиков важнее всего. Wan 2.7 работал через четыре отдельные модели: text-to-video, image-to-video, генерация по референсам и редактирование. Wan 3.0 объединяет всё в одну. Меньше переключений между моделями, чище архитектура пайплайна.
Тридцать секунд — это инкрементальный шаг. Omni-reference — качественно другое. Ни одна конкурирующая модель на дату выхода Wan 3.0 не принимала документы как творческий материал. Wan 3.0 принимает: doc, xls, ppt, pdf, txt, key, pages. Буквально — Excel-таблицу или Keynote-презентацию.
Подумайте, что это меняет в типичном рабочем процессе. Сейчас создание видео из квартального отчёта выглядит так: прочитать документ, решить, что важно, написать промпт, который это описывает, сгенерировать, проверить, соответствует ли результат источнику. Omni-reference убирает середину этой цепочки. Документ сам становится входными данными.
Правда, здесь есть открытый вопрос — и он реальный, не риторический. Презентация содержит как минимум четыре слоя: аргумент, визуальный дизайн, данные и нарративную последовательность. Что именно извлекает Wan 3.0 при разборе? Парсит текст и игнорирует вёрстку? Или читает структуру слайдов как таковую? Alibaba не отвечает на это в релизных материалах. Это первое, что стоит проверить на практике. Для тех, кто уже строит контент-завод для бизнеса с автогенерацией, это принципиальный вопрос: разница между «фичей для демо» и реальным инструментом.
Ещё один практический нюанс: омни-референс — это возможность самой модели Alibaba. Сторонние платформы интегрируют типы референсов поэтапно. Изображения и видео обычно приходят первыми, парсинг документов — позже. Проверяйте, что именно поддерживает ваш маршрут доступа, прежде чем строить процессы вокруг таблиц.
Alibaba опубликовал тарифы в USD за секунду. При 480p — $0.05 за секунду, итого $1.50 за 30-секундный ролик. При 720p — $0.10 за секунду, $3.00 за ролик. При 1080p — $0.20 за секунду, $6.00 за ролик.
Цифры для 30-секундного клипа — это простая арифметика, не официальные данные прайс-листа, но именно они имеют значение при планировании бюджета. Шесть долларов за 30 секунд в максимальном качестве — конкурентно это или нет, зависит только от реального качества на тридцатой секунде. Никакой спецификационный лист здесь не поможет.
При 480p стоимость в четыре раза ниже, чем при 1080p. Если качество достаточно для превизуализации и итераций, это меняет экономику производственного процесса довольно существенно. Это один из первых тестов, которые стоит провести — тем более если вы сравниваете варианты для генерации видео Seedance 2.0 и других альтернатив.

Месяцами «нативный 4K» кочевал по всем страницам, предсказывавшим Wan 3.0 генерация видео. Прайс-лист с максимумом 1080p расставил точки над i.
Откуда взялось? В документации Alibaba действительно есть упоминание 4K — но для модели wan2.7-image-pro, и только для задач text-to-image без входного изображения и при отключённой массовой генерации. Каждый другой сценарий ограничен 2K. Дальше началась цепочка мутаций: «wan2.7-image-pro поддерживает 4K для text-to-image» превратилось в «Wan 2.7 поддерживает 4K», затем в «Wan поддерживает 4K», затем в «Wan 3.0 будет генерировать 4K видео». На каждом шаге из утверждения выпадал один квалификатор. К четвёртому шагу изменились модель, модальность и версия.
Разрешение Wan 3.0 заморожено на 1080p с сентября 2025 года — с выхода Wan 2.5-Preview. Четыре версии подряд, почти год. Кто ставил на 4K в Wan 3.0, аргументировал против одиннадцати месяцев документированных фактов.
Для удобства — фактические различия двух версий. Максимальная длина клипа: у Wan 2.7 было 15 секунд, у Wan 3.0 — 30. Максимальное разрешение: одинаково, 1080p. Архитектура: четыре отдельные модели против одной. Типы входных референсов: текст, изображение, аудио, видео у Wan 2.7, плюс doc, xls, ppt, pdf, txt, key, pages у Wan 3.0. Редактирование и motion driving у предыдущей версии жили в отдельных моделях, теперь встроены.
Ключевой вывод здесь простой: апгрейд — это длительность, гибкость входных данных и унификация. Не пиксели. Это то место, где большинство прогнозов ошиблись.
Несколько вещей, которые меняют подход к промптингу в Wan 3.0. Поля для негативного промпта нет — исключения нужно вписывать прямо в основной текст в виде инструкций («без текста на экране», «не менять одежду персонажа»). Если переносите библиотеку промптов с другой модели, это первое, что придётся переписать.
Для клипов длиннее примерно десяти секунд описание действия постадийно — с чёткой целью каждого этапа и финальным состоянием сцены — даёт более когерентный результат, чем один плотный абзац. Это логично: чем длиннее ролик, тем больше места для дрейфа временных ошибок. Персонаж, костюм, пространство, камера, освещение — всё труднее удержать к тридцатой секунде. Такая же история с генерацией видеоаватаров: стабильность персонажа на протяжении всего ролика остаётся главной технической задачей.
Контроль первого и последнего кадра доступен, но с оговоркой: при включении режима multi-image reference он может стать недоступным. Два инструмента не всегда работают одновременно. Соотношение сторон — либо автоматически из промпта (вертикальный, квадратный, горизонтальный), либо фиксированно: 16:9, 9:16, 1:1. Аудио описывается текстом, не загружается — диалог нужно прописать дословно, звуковую среду и экшн-реплики назвать явно.
Ни весов, ни лицензии, ни репозитория с запуском не появилось. Wan 3.0 — четвёртый подряд закрытый релиз. Alibaba не открывал видеомодель Wan с версии 2.2 в июле 2025 года. Wan 2.5 анонсировался как открытый — веса так и не появились. Wan 2.6 и Wan 2.7 вышли закрытыми. На GitHub с сентября 2025 года висят нерассмотренные вопросы об open-source Wan 2.5.
Из предыдущего цикла Wan 2.7 стоит взять одно правило: если веса не появились в течение 30 дней после релиза — считайте ожидание открытого кода оптимистичными мечтами, не планами.
Документ-в-видео — самый очевидный новый сценарий. Подать квартальный отчёт или продуктовую презентацию напрямую как референс и убрать этап ручного написания промпта — это реальное сокращение workflow, если парсинг работает на уровне смысла, а не только текста.
Создателям коротких форматов: 30 секунд в один проход покрывают полный Reels, Shorts или TikTok-ролик без склеек. Именно склейки чаще всего создают ошибки непрерывности, так что выигрыш здесь вполне конкретный. Для рекламных и e-commerce команд Alibaba называет эти сценарии целевыми напрямую — единая модель с референсами и редактированием означает, что согласованность продукта и правки живут в одном месте. Для тех, кто строит автоматический блог с ИИ и думает о видеоконтенте как следующем шаге, Wan 3.0 генерация видео становится логичным API для экспериментов.
Разработчикам — идентификатор модели существует, строить можно. Но полный API ещё не выкачен, и идентификатор wan3.0-video, скорее всего, получит датированный суффикс при GA (по аналогии с Wan 2.7, где шёл wan2.7-i2v-2026-04-25). Устаревший идентификатор возвращает просто 404 без полезного сообщения об ошибке. Оценивать и прототипировать — сейчас. Шипить клиентский пайплайн против бета-идентификатора без fallback-пути — рано.
Тем, кто рассчитывал на локальный инференс: ничего не изменилось. Весов нет, репозитория нет.
Теперь, когда Wan 3.0 генерация видео доступна в бете, вопросы стали эмпирическими. Что сохраняет консистентность к тридцатой секунде — возьмите одного персонажа и сравните первый и последний кадры. Как модель на самом деле разбирает документы — подайте презентацию и посмотрите, отражает ли результат аргумент или только дизайн. Насколько 480p пригодна для итераций — при четырёхкратной разнице в цене это меняет экономику всего процесса. Держит ли унифицированная модель планку редактирования, которую ставила отдельная editing-модель Wan 2.7 — это открытый вопрос, который никакой анонс не закрывает.
Wan 3.0 — это не революция пикселей. Это более длинный ролик, более широкий вход и более чистый пайплайн. Для части рабочих процессов — вполне достаточный шаг вперёд. Для части — пока бета с открытыми вопросами.
