Alibaba последовательно теснит американских игроков на всех фронтах ИИ. Сначала – модель Qwen3.7-Max, которая в мае 2026 года обошла ChatGPT и Gemini на coding benchmark-ах. Теперь – нейросеть Alibaba Wan 3.0, которая метит в сегмент видеогенерации. Релиз состоялся 24 августа 2026 года через Alibaba Cloud Model Studio, а публичная бета открылась ещё 6 августа. Посмотрим, что здесь реально интересно, а что – маркетинг.
Главная техническая новость – длина клипа. Wan 2.7 генерировал максимум 15 секунд за один проход. Wan 3.0 выдаёт 30 секунд за один раз. Удвоение – это не косметика, это другой класс задач: короткий рекламный ролик, объяснялка для соцсетей, видеослайд для презентации.
Поддерживаемые форматы входных данных – вот где модель реально выделяется. Текст, изображения, аудио, видео – это стандарт для рынка. Но Wan 3.0 добавляет PDF, PPT, DOC, XLS и веб-страницы. Загрузил отчёт – получил видео. Это не просто удобство: для маркетологов, которые работают с готовыми материалами, это меняет рабочий процесс целиком. Если вам интересно, как это встраивается в потоки создания контента, стоит посмотреть на контент-завод для генерации видео – там как раз про подобные сценарии автоматизации.
По качеству картинки: разрешение до 1080p, синхронизация микровыражений лиц, многоязычная озвучка. Модель держит консистентность персонажей, объектов и фонов на протяжении всего клипа – что исторически было слабым местом видеогенерации вообще.

$0.05 за секунду видео в 480p. $0.10 – в 720p. $0.20 – в 1080p. Для сравнения: Google Veo 3.1 на стандартном тарифе стоит $0.40 за секунду. То есть 30-секундный ролик в 1080p через Wan 3.0 обойдётся в $6. Через Veo 3.1 – в $12. Разница в два раза при сопоставимом качестве – это аргумент, который сложно игнорировать.
Alibaba применяет ту же логику, что и с языковыми моделями: выходить на рынок с ценой ниже американских аналогов. Стратегия не новая, но работает. Особенно когда за плечами – обязательство вложить 380 миллиардов юаней в AI-инфраструктуру за три года и только что закрытое размещение акций на $10.2 миллиарда в Гонконге, деньги от которого пойдут целиком на ИИ.
Представьте: у вас есть квартальный отчёт в PDF или презентация для инвесторов. Wan 3.0 теоретически превращает её в видео без промежуточного шага – вручную переносить данные в скрипт не нужно. Это сценарий, который раньше требовал либо человека-редактора, либо сложной цепочки инструментов. Сейчас – один API-запрос. Для тех, кто строит автоматизации создания видеоконтента, появление такого инструмента меняет архитектуру пайплайнов.
Видеоконтент из текстовых материалов – это отдельный сценарий для тех, кто ведёт систему авто-блога на ИИ. Статья превращается в видеосопровождение для той же страницы. Поведенческие метрики растут, позиции – тоже.
Загрузить инструкцию в DOC и получить обучающий ролик с озвучкой на нужном языке – это уже не фантастика. Многоязычная поддержка здесь критична: Alibaba явно думала о глобальном рынке, а не только о китайском.
Wan 3.0 – не изолированный продукт. Это часть экосистемы, которую Alibaba строит методично. Qwen3.7-Max для кода и рассуждений, Wan 3.0 для видео, облачная инфраструктура через Model Studio. Компания закрывает сегменты один за другим, каждый раз с ценой ниже рыночной.
Честно скажу: пока это публичная бета, и реальные benchmark-и по качеству видео в открытом доступе скудные. Заявленные характеристики – консистентность персонажей, микровыражения, многоязычная озвучка – звучат убедительно, но проверить их на реальных задачах пока сложно. Те, кто работает с промптами для генерации видео, знают: разрыв между маркетинговым описанием и реальным выходом бывает значительным. Wan 3.0 нужно тестировать.
Тем не менее ценовой аргумент ($0.20 против $0.40 за секунду в 1080p) и уникальная возможность работать с документами напрямую – это два конкретных преимущества, которые не зависят от субъективной оценки качества картинки. Рынок видеогенерации становится теснее, и Alibaba в нём уже не аутсайдер.
