Команда HKUST (Гуанчжоу) совместно с Tencent AI Platform выпустила VibeWorlding - открытый мультимодальный агентный фреймворк для построения интерактивных 3D-миров через диалог с ИИ. Обученная на нём модель VibeWorlder-30B-A3B обошла GPT-5.5 и Qwen3.8-Max по ключевому показателю Pass@1. Разбираем, как это работает и почему это важнее, чем кажется.
Представьте: вы пишете в чат «создай мрачный пустынный храм», и через несколько секунд в браузере появляется трёхмерная сцена с расставленными объектами, проверенными на коллизии и выровненными по стилю. Без редактора уровней, без скриптов. Именно это обещает VibeWorlding - и, судя по цифрам из опубликованной 26 августа 2026 года статьи, обещание не пустое.
Vibe Coding уже приучил нас к тому, что код можно диктовать. VibeWorlding переносит ту же логику в трёхмерное пространство: агент сам ищет 3D-активы, расставляет их, проверяет физику и корректирует результат по рендеру. Человек формулирует намерение, машина занимается пространственной механикой.
Что такое VibeWorlding и зачем он нужен
Строительство интерактивных 3D-миров - дорогое и трудоёмкое занятие. Игровые уровни, цифровые двойники производств, симуляционные среды для роботов - всё это традиционно требует команды художников и технических дизайнеров. Попытки автоматизировать процесс с помощью ИИ уже были, но упирались в два системных ограничения.
Первое: существующие бенчмарки тестировали модели на искусственно упрощённых запросах, далёких от того, как реальные люди описывают сцены - размыто, противоречиво, с неявными ожиданиями. Второе: почти все фреймворки оставались закрытыми, что делало честное сравнение невозможным.
VibeWorlding решает оба вопроса сразу. Это не просто «текст в 3D» - это полноценный мультимодальный агентный фреймворк с открытым кодом, бенчмарком и обучающей средой. Агент получает запрос, вызывает инструменты (поиск актива, добавление, перемещение, поворот, удаление), смотрит на многовидовой рендер и повторяет цикл до получения приемлемого результата.
VWE-Bench: 6828 запросов и 2616 активов
Бенчмарк VWE-Bench строился по принципу «человек плюс машина». Сначала художники-аннотаторы определили 3148 концептуальных 3D-активов, Gemini 3.1-flash-image сгенерировал референсные изображения, а Hunyuan3D 3.1 от Tencent перевёл их в 3D-меши. После фильтрации осталось 2616 активов, охватывающих 20 семантических категорий.
Затем профессиональные художники вручную собрали 323 «зерновых» мира - от простых (8 объектов) до сложных (258 объектов). На их основе мультимодальная языковая модель синтезировала запросы «в обратную сторону»: читала готовый мир и формулировала, как его можно было бы описать или отредактировать. Итог - 6828 запросов шести типов.
Часть запросов относится к категории Verified: у них есть точный ground-truth, с которым можно сравнить результат напрямую. Остальные - Unverified - оцениваются по четырём критериям через MLLM-судью: экологическая логика сцены, понимание 3D-структуры, пространственное рассуждение, качество поиска активов.
Двойной верификатор: физика и смысл
Здесь стоит уточнить один принципиальный момент. Большинство систем оценивают либо физическую корректность (нет ли объектов, парящих в воздухе или проходящих сквозь друг друга), либо семантическое соответствие запросу. VibeWorlding требует одновременного прохождения обоих тестов.
Физическая часть - чистый Python: геометрическая проверка коллизий и высот без участия нейросети. Семантическая часть - MLLM-оценка по четырём измерениям. Только одновременное прохождение обоих фильтров засчитывается как успех. Это жёстче, чем большинство существующих подходов, и, возможно, именно поэтому даже GPT-5.5 не дотягивает до 60%.
Как открытая модель обошла GPT-5.5
Команда протестировала 8 закрытых frontier-моделей (GPT-5.5, Gemini 3.1-Pro, Gemini 3.5-Flash, Kimi-K3, Qwen3.8-Max и другие), три готовых агентных фреймворка для 3D-сцен, а также серию открытых моделей VibeWorlder после разных этапов дообучения.
Цифры говорят сами за себя. Базовая Qwen3-VL-30B-A3B без обучения набирает 13,6% по Pass@1. После холодного старта SFT - 34,5%. После reinforcement learning - 59,3%. GPT-5.5 при этом показывает 57,3%, Qwen3.8-Max - 56,9%.
Меньшая модель VibeWorlder-8B (41,4%) уже догоняет Gemini 3.1-Pro (42,7%), а на дорожке Verified откровенно её обходит: 59,3% против 44,4%. Это тот самый open-source момент, когда правильно подобранный обучающий сигнал оказывается важнее размера модели.
Что именно улучшил RL - и где по-прежнему больно
Команда разложила результаты по шести измерениям: отсутствие коллизий, корректность высот, экологическая логика, 3D-понимание, 3D-рассуждение, качество поиска.
Самый впечатляющий прирост - в пространственном рассуждении: базовая модель справлялась с ним на 6-20%, после RL - на 56-85%. VibeWorlder-30B-A3B достигает 85%, опережая Gemini 3.1-Pro с его 62%. Поиск активов после обучения вырос до 91-99% - выше, чем у всех закрытых моделей.
Общее слабое место - коллизии. Даже у лучшей обученной модели показатель держится в диапазоне 59-68%. Точное пространственное размещение объектов без взаимного пересечения остаётся потолком для всех участников теста, независимо от того, открытая модель или нет.
Два типичных провала: координаты и лишние удаления
Авторы вручную разобрали типичные ошибки. Два паттерна встречаются чаще всего.
Первый - неверное направление при точном редактировании расстояний. Пример: пользователь просит сдвинуть камень «на 7 метров вперёд». Модель правильно вычисляет величину смещения, но путает направление оси - итоговая ошибка позиции составляет 14 метров. Это не арифметическая ошибка, а непонимание системы координат сцены.
Второй - избыточное редактирование. Пользователь просит «добавить дерево рядом с ящиком». Агент добавляет дерево корректно, но попутно удаляет другое дерево, которое уже стояло в сцене. Инструмент отработал правильно, но агент не удержал в памяти состояние объектов, которые трогать не следовало.
Оба сценария указывают на одно: семантическое понимание у современных агентов уже достаточно зрелое, а вот точное пространственное исполнение и сохранение состояния между итерациями - нет. Именно здесь, по мнению авторов, лежит главный потенциал для дальнейшего развития.
CLI-прототип: не только бенчмарк
Чтобы показать, что VibeWorlding - не просто инструмент для получения высоких баллов в таблицах, команда выпустила рабочий командный прототип с рендером в браузере в реальном времени. Пишешь команду в терминал - агент думает, вызывает инструменты, сцена обновляется в окне браузера.
В демо-сценарии «с нуля» агент строит ферму по описанию: находит активы амбара, деревьев, заборов, раскладывает их по зонам, замечает по рендеру, что забор вышел слишком высоким, уменьшает его, потом подрезает крону дерева, которая перекрыла амбар. Весь цикл «мысль - действие - рендер - коррекция» идентичен тому, что использовалось при обучении.
Во втором сценарии агент работает с готовым городским кварталом: удаляет машину с дороги и два зелёных здания, не трогая остальные объекты, и подтверждает результат многовидовым рендером. Прототип уже открыт для сообщества.
Что мешает «настоящему» Vibe Worlding
Авторы честно перечисляют открытые вопросы. Инструменты пока атомарные: есть добавить, удалить, сдвинуть, повернуть - но нет «засеять лесом прямоугольную область» или «разложить предметы по периметру». Самые сложные миры в VWE-Bench содержат 258 активов - для реальных открытых миров этого недостаточно, там, вероятно, понадобится многоагентная координация.
Сигнал вознаграждения при RL-обучении пока грубый: одна оценка на всю траекторию. Более детальный кредит за каждый шаг - «коллизия возникла именно здесь, на третьей итерации» - мог бы ускорить обучение. Наконец, библиотека активов тяготеет к мультяшному стилю и пока не поддерживает генерацию мира из изображения или видео.
Глубже всего лежит проблема пространственного рассуждения как такового. Авторы полагают, что её не решить одним только RL-дообучением - нужно вводить 3D-пространственные данные уже на стадии предобучения foundation model. Это честное признание предела текущего подхода.
Почему это важно за пределами 3D-игр
Паттерн, который демонстрирует VibeWorlding, шире конкретной задачи построения сцен. Комбинация «верифицируемая среда + надёжный сигнал вознаграждения + открытая модель среднего размера» раз за разом показывает, что можно конкурировать с закрытыми гигантами без доступа к их вычислительным ресурсам. Это та же траектория, по которой шёл Vibe Coding в программировании.
Для практиков в области маркетинга, архитектурной визуализации или обучения персонала это означает: интерактивные 3D-среды, которые сегодня создаются неделями, через несколько лет могут генерироваться по текстовому брифу за минуты. Мультимодальный агентный фреймворк такого рода - не академическая игрушка, а прообраз производственного инструмента.
Итог
VibeWorlding не объявляет проблему построения 3D-миров решённой. Даже GPT-5.5 не преодолевает порог 60% на VWE-Bench - это честная оценка текущего состояния задачи. Но проект доказывает кое-что более практически значимое: открытая модель на 30 миллиардов параметров, обученная с правильным верификатором и алгоритмом GRPO, способна превзойти лучшие закрытые системы на конкретном benchmark. Пространственное рассуждение выросло с 6% до 85%, поиск активов - до 99%.
Коллизии пока остаются общей болью. Точное управление координатами в 3D - это, похоже, следующий рубеж для всего направления. Но инфраструктура - бенчмарк, обучающая среда, двойной верификатор, CLI-прототип - уже открыта. Сообщество получило всё необходимое, чтобы двигаться дальше.
