VibeWorlding: мультимодальный агентный фреймворк, который строит 3D-миры по команде

7 мин чтения
Поделиться
Сейчас читаетеЧто такое VibeWorlding и зачем он нужен

Команда HKUST (Гуанчжоу) совместно с Tencent AI Platform выпустила VibeWorlding - открытый мультимодальный агентный фреймворк для построения интерактивных 3D-миров через диалог с ИИ. Обученная на нём модель VibeWorlder-30B-A3B обошла GPT-5.5 и Qwen3.8-Max по ключевому показателю Pass@1. Разбираем, как это работает и почему это важнее, чем кажется.

Представьте: вы пишете в чат «создай мрачный пустынный храм», и через несколько секунд в браузере появляется трёхмерная сцена с расставленными объектами, проверенными на коллизии и выровненными по стилю. Без редактора уровней, без скриптов. Именно это обещает VibeWorlding - и, судя по цифрам из опубликованной 26 августа 2026 года статьи, обещание не пустое.

Vibe Coding уже приучил нас к тому, что код можно диктовать. VibeWorlding переносит ту же логику в трёхмерное пространство: агент сам ищет 3D-активы, расставляет их, проверяет физику и корректирует результат по рендеру. Человек формулирует намерение, машина занимается пространственной механикой.

Что такое VibeWorlding и зачем он нужен

Строительство интерактивных 3D-миров - дорогое и трудоёмкое занятие. Игровые уровни, цифровые двойники производств, симуляционные среды для роботов - всё это традиционно требует команды художников и технических дизайнеров. Попытки автоматизировать процесс с помощью ИИ уже были, но упирались в два системных ограничения.

Первое: существующие бенчмарки тестировали модели на искусственно упрощённых запросах, далёких от того, как реальные люди описывают сцены - размыто, противоречиво, с неявными ожиданиями. Второе: почти все фреймворки оставались закрытыми, что делало честное сравнение невозможным.

VibeWorlding решает оба вопроса сразу. Это не просто «текст в 3D» - это полноценный мультимодальный агентный фреймворк с открытым кодом, бенчмарком и обучающей средой. Агент получает запрос, вызывает инструменты (поиск актива, добавление, перемещение, поворот, удаление), смотрит на многовидовой рендер и повторяет цикл до получения приемлемого результата.

type=diagram | about=цикл работы агента VibeWorlding: запрос - инструменты - рендер - верификация - результат | steps=Запрос пользователя -> Планирование агента -> Вызов MCP-инструментов -> Рендер сце

VWE-Bench: 6828 запросов и 2616 активов

Бенчмарк VWE-Bench строился по принципу «человек плюс машина». Сначала художники-аннотаторы определили 3148 концептуальных 3D-активов, Gemini 3.1-flash-image сгенерировал референсные изображения, а Hunyuan3D 3.1 от Tencent перевёл их в 3D-меши. После фильтрации осталось 2616 активов, охватывающих 20 семантических категорий.

Затем профессиональные художники вручную собрали 323 «зерновых» мира - от простых (8 объектов) до сложных (258 объектов). На их основе мультимодальная языковая модель синтезировала запросы «в обратную сторону»: читала готовый мир и формулировала, как его можно было бы описать или отредактировать. Итог - 6828 запросов шести типов.

Часть запросов относится к категории Verified: у них есть точный ground-truth, с которым можно сравнить результат напрямую. Остальные - Unverified - оцениваются по четырём критериям через MLLM-судью: экологическая логика сцены, понимание 3D-структуры, пространственное рассуждение, качество поиска активов.

Двойной верификатор: физика и смысл

Здесь стоит уточнить один принципиальный момент. Большинство систем оценивают либо физическую корректность (нет ли объектов, парящих в воздухе или проходящих сквозь друг друга), либо семантическое соответствие запросу. VibeWorlding требует одновременного прохождения обоих тестов.

Физическая часть - чистый Python: геометрическая проверка коллизий и высот без участия нейросети. Семантическая часть - MLLM-оценка по четырём измерениям. Только одновременное прохождение обоих фильтров засчитывается как успех. Это жёстче, чем большинство существующих подходов, и, возможно, именно поэтому даже GPT-5.5 не дотягивает до 60%.

Как открытая модель обошла GPT-5.5

Команда протестировала 8 закрытых frontier-моделей (GPT-5.5, Gemini 3.1-Pro, Gemini 3.5-Flash, Kimi-K3, Qwen3.8-Max и другие), три готовых агентных фреймворка для 3D-сцен, а также серию открытых моделей VibeWorlder после разных этапов дообучения.

Цифры говорят сами за себя. Базовая Qwen3-VL-30B-A3B без обучения набирает 13,6% по Pass@1. После холодного старта SFT - 34,5%. После reinforcement learning - 59,3%. GPT-5.5 при этом показывает 57,3%, Qwen3.8-Max - 56,9%.

type=chart | about=сравнение Pass@1 ключевых моделей на VWE-Bench после RL-дообучения | headline=VibeWorlder-30B обходит GPT-5.5 | chart_type=bar | data=VibeWorlder-30B-A3B:59.3; GPT-5.5:57.3; Qwen3.8

Меньшая модель VibeWorlder-8B (41,4%) уже догоняет Gemini 3.1-Pro (42,7%), а на дорожке Verified откровенно её обходит: 59,3% против 44,4%. Это тот самый open-source момент, когда правильно подобранный обучающий сигнал оказывается важнее размера модели.

Что именно улучшил RL - и где по-прежнему больно

Команда разложила результаты по шести измерениям: отсутствие коллизий, корректность высот, экологическая логика, 3D-понимание, 3D-рассуждение, качество поиска.

Самый впечатляющий прирост - в пространственном рассуждении: базовая модель справлялась с ним на 6-20%, после RL - на 56-85%. VibeWorlder-30B-A3B достигает 85%, опережая Gemini 3.1-Pro с его 62%. Поиск активов после обучения вырос до 91-99% - выше, чем у всех закрытых моделей.

Общее слабое место - коллизии. Даже у лучшей обученной модели показатель держится в диапазоне 59-68%. Точное пространственное размещение объектов без взаимного пересечения остаётся потолком для всех участников теста, независимо от того, открытая модель или нет.

Два типичных провала: координаты и лишние удаления

Авторы вручную разобрали типичные ошибки. Два паттерна встречаются чаще всего.

Первый - неверное направление при точном редактировании расстояний. Пример: пользователь просит сдвинуть камень «на 7 метров вперёд». Модель правильно вычисляет величину смещения, но путает направление оси - итоговая ошибка позиции составляет 14 метров. Это не арифметическая ошибка, а непонимание системы координат сцены.

Второй - избыточное редактирование. Пользователь просит «добавить дерево рядом с ящиком». Агент добавляет дерево корректно, но попутно удаляет другое дерево, которое уже стояло в сцене. Инструмент отработал правильно, но агент не удержал в памяти состояние объектов, которые трогать не следовало.

Оба сценария указывают на одно: семантическое понимание у современных агентов уже достаточно зрелое, а вот точное пространственное исполнение и сохранение состояния между итерациями - нет. Именно здесь, по мнению авторов, лежит главный потенциал для дальнейшего развития.

CLI-прототип: не только бенчмарк

Чтобы показать, что VibeWorlding - не просто инструмент для получения высоких баллов в таблицах, команда выпустила рабочий командный прототип с рендером в браузере в реальном времени. Пишешь команду в терминал - агент думает, вызывает инструменты, сцена обновляется в окне браузера.

В демо-сценарии «с нуля» агент строит ферму по описанию: находит активы амбара, деревьев, заборов, раскладывает их по зонам, замечает по рендеру, что забор вышел слишком высоким, уменьшает его, потом подрезает крону дерева, которая перекрыла амбар. Весь цикл «мысль - действие - рендер - коррекция» идентичен тому, что использовалось при обучении.

Во втором сценарии агент работает с готовым городским кварталом: удаляет машину с дороги и два зелёных здания, не трогая остальные объекты, и подтверждает результат многовидовым рендером. Прототип уже открыт для сообщества.

Что мешает «настоящему» Vibe Worlding

Авторы честно перечисляют открытые вопросы. Инструменты пока атомарные: есть добавить, удалить, сдвинуть, повернуть - но нет «засеять лесом прямоугольную область» или «разложить предметы по периметру». Самые сложные миры в VWE-Bench содержат 258 активов - для реальных открытых миров этого недостаточно, там, вероятно, понадобится многоагентная координация.

Сигнал вознаграждения при RL-обучении пока грубый: одна оценка на всю траекторию. Более детальный кредит за каждый шаг - «коллизия возникла именно здесь, на третьей итерации» - мог бы ускорить обучение. Наконец, библиотека активов тяготеет к мультяшному стилю и пока не поддерживает генерацию мира из изображения или видео.

Глубже всего лежит проблема пространственного рассуждения как такового. Авторы полагают, что её не решить одним только RL-дообучением - нужно вводить 3D-пространственные данные уже на стадии предобучения foundation model. Это честное признание предела текущего подхода.

Почему это важно за пределами 3D-игр

Паттерн, который демонстрирует VibeWorlding, шире конкретной задачи построения сцен. Комбинация «верифицируемая среда + надёжный сигнал вознаграждения + открытая модель среднего размера» раз за разом показывает, что можно конкурировать с закрытыми гигантами без доступа к их вычислительным ресурсам. Это та же траектория, по которой шёл Vibe Coding в программировании.

Для практиков в области маркетинга, архитектурной визуализации или обучения персонала это означает: интерактивные 3D-среды, которые сегодня создаются неделями, через несколько лет могут генерироваться по текстовому брифу за минуты. Мультимодальный агентный фреймворк такого рода - не академическая игрушка, а прообраз производственного инструмента.

Итог

VibeWorlding не объявляет проблему построения 3D-миров решённой. Даже GPT-5.5 не преодолевает порог 60% на VWE-Bench - это честная оценка текущего состояния задачи. Но проект доказывает кое-что более практически значимое: открытая модель на 30 миллиардов параметров, обученная с правильным верификатором и алгоритмом GRPO, способна превзойти лучшие закрытые системы на конкретном benchmark. Пространственное рассуждение выросло с 6% до 85%, поиск активов - до 99%.

Коллизии пока остаются общей болью. Точное управление координатами в 3D - это, похоже, следующий рубеж для всего направления. Но инфраструктура - бенчмарк, обучающая среда, двойной верификатор, CLI-прототип - уже открыта. Сообщество получило всё необходимое, чтобы двигаться дальше.

type=cta | about=внедрение мультимодальных агентных фреймворков и ИИ-автоматизации в бизнес-процессы | hook=Хотите ИИ-агентов в своём бизнесе?

Проверить факты

Источники и материалы

Материалы, на которые опирается статья.

  1. 01 finance.sina.com.cnVibeWorlding: мультимодальный агентный фреймворк, который строит 3D-миры по команде

Читайте также

30.08.2026Локальный искусственный интеллект в августе 2026: три флагмана за четыре дня и гонка рантаймов 30.08.2026Генерация видео Alibaba Wan3: 30 секунд из PDF, цена вчетверо ниже Google 29.08.2026Выход ИИ из-под контроля: в июле 2026 года зафиксировано более 300 инцидентов за месяц

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.