Август 2026 года у xAI вышел плотным. Компания выкатила обновления сразу по нескольким направлениям, и если смотреть на них по отдельности, каждое кажется точечным улучшением. Но вместе они складываются в довольно чёткую картину: xAI планомерно закрывает разрывы с OpenAI и Google по базовым пользовательским сценариям – изображения, голос, видео, создание приложений. Посмотрим на каждое обновление отдельно.
7 августа 2026 года xAI объявила о запуске Imagine Image 2.0 в качестве нового режима Quality Mode на grok.com/imagine и в мобильных приложениях. Звучит как маркетинговый анонс, но за ним стоит кое-что конкретное.
Модель занимает второе место в мире одновременно по text-to-image и по редактированию изображений – по данным Arena Image Edit и Text-to-Image leaderboards на дату релиза (7 августа 2026). Это реальный benchmark, а не самооценка. Второе место, не первое, – xAI честно указывает это в релиз-нотах, что само по себе необычно.

Что практически важно в Image 2.0: инструмент magic wand точечно редактирует только указанную область, не трогая остальное. Это звучит тривиально, но именно здесь традиционно ломались все генераторы – попросишь перекрасить куртку, модель перерисовывает лицо. Плюс multi-ref editing: до пяти входных изображений в одной генерации, без ручного монтажа. Для тех, кто строит контент-завод на ИИ, это прямая польза: консистентный визуальный стиль без дорогого пост-продакшна.
Добавили шаблоны под конкретные задачи: фото продукта, хедшоты, иконки, игровые ассеты. Каждый шаблон – это уже настроенный рабочий процесс, в который подставляешь входные данные. Smart resize растягивает одно изображение под любой формат кадра, дорисовывая края. API пока недоступен, но анонсирован.
29 июля 2026 года xAI объявила Grok Voice Think Fast 2.0 – речевую модель типа speech-to-speech. Цена: $0.08 за минуту аудио. С 5 августа 2026 года grok-voice-latest автоматически переключился на эту версию.
Интересная техническая деталь здесь – модель рассуждает параллельно с речью, а не после. Это означает, что tool calls обычно завершаются до конца первой фразы агента. Для голосовых агентов это критично: пауза в разговоре раздражает сильнее, чем неточный ответ.
Точность транскрипции – отдельный предмет для разговора. В оценке по тысячам коротких фраз на 24 языках xAI заявляет улучшение в 1.5-2.0 раза относительно Deepgram Nova 3 и ElevenLabs Scribe v2, и в 1.4 раза относительно предыдущей версии – Grok Voice Think Fast 1.0. В зашумлённых условиях разрыв с моделями speech-to-text вырастает примерно до 10 раз. Цифры сильные, хотя независимой верификации пока нет.
Показательный кейс из релиз-нотов: xAI тестировала 2.0 на реальных звонках Starlink (телефон поддержки +1 888 GO STARLINK) и зафиксировала рост конверсии продаж и containment rate. Это A/B-тест на настоящем трафике, а не синтетический benchmark – такие данные стоят внимания.
Для тех, кто думает о ИИ-аватаре для видео или голосовых интерфейсах в продукте, – обновлённая модель закрывает одну из самых болезненных проблем: звонки с реальными помехами и компрессией телефонии. Раньше там всё сыпалось.
31 июля 2026 года получила развитие модель видеогенерации. Imagine Video 1.5 существовала и раньше, но теперь добавили: text-to-video, image и voice references, нативный 1080p.
До семи референсных изображений за одну генерацию – это много. Каждый референс фиксирует что-то одно: лицо персонажа, локацию, объект. Можно держать персонажа и менять сцену, можно держать сцену и менять персонажа, можно зафиксировать обоих и менять только действие. Voice consistency работает аналогично: передаёшь фото персонажа и голосовой референс – и то, и другое сохраняется от сцены к сцене.
Text-to-video под капотом работает как text-to-image с последующим image-to-video, что технически честно указано в документации. Для конечного пользователя разницы нет, для разработчика API – важно понимать цепочку.
Запуск шёл поэтапно: image и voice references стартовали 31 июля для SuperGrok Heavy и SuperGrok Plus в США на grok.com/imagine и iOS, затем разворачивались на остальные тиры. В API: image references, text-to-video и 1080p уже доступны, voice reference – по запросу.
Это самый неочевидный, но, возможно, самый любопытный релиз августа. Если говорить о релиз-ноты xAI август 2026 в целом, именно Build Mode лучше всего отражает, куда смотрит компания.
Build Mode запущен 28 июля 2026 года в Early Beta для подписчиков SuperGrok Heavy. Идея простая: описываешь задачу в чате, Grok пишет код и показывает рабочий превью прямо в разговоре. Потом публикуешь по ссылке grok.me или на собственный домен. Устанавливать ничего не нужно.
Что реально собирают пользователи: лендинги, портфолио, внутренние утилиты, планировщики, симуляции, аркадные игры, интерактивные дашборды с реальными данными из подключённых коннекторов. Звучит как Replit или Cursor в браузере – и это честное сравнение. xAI входит на зрелый рынок vibe coding, а не изобретает жанр.
7 августа 2026 года вышел Grok Build 1.0.0 – CLI-версия того же инструмента. Список правок длинный, но несколько пунктов заслуживают внимания: поддержка CJK-текста в терминале, корректная работа с большими сессиями и git-репозиториями, remote resume без риска подтянуть лишний код, чистые баннеры вместо сырых JSON-ответов об ошибках. Это патч-релиз, который закрывает реальные раздражители разработчика, а не украшательства.

Пять продуктов за месяц – темп высокий. Но важнее другое: xAI закрывает не экзотические функции, а базовые рабочие сценарии. Редактирование изображений без побочных эффектов. Голосовые агенты, которые не ломаются на фоновом шуме. Видео с консистентными персонажами. Приложения без установки среды разработки.
Для маркетинговых команд особенно релевантны Image 2.0 и Video 1.5 в паре: единый визуальный стиль через multi-ref, референсные персонажи, которые узнаются от ролика к ролику. Если вы уже смотрите в сторону автоматического блога с ИИ, то обновление Image 2.0 с шаблонами под продуктовые съёмки – прямой аргумент пересмотреть пайплайн генерации иллюстраций.
Build Mode пока в Early Beta и только для SuperGrok Heavy. Ограничение реальное. Но направление очевидно: xAI хочет, чтобы нетехнические пользователи собирали рабочие продукты без посредников. Получится ли – увидим по следующим итерациям.
Grok Voice Think Fast 2.0 по заявленным показателям превосходит специализированные speech-to-text модели в сложных условиях. Если это подтвердится независимыми тестами, телефония и голосовые агенты для колл-центров получают интересный новый вариант. Кейс со Starlink здесь важен именно потому, что это реальный трафик, а не лаборатория.
В целом август 2026 у xAI выглядит как сознательный марш-бросок по базовым возможностям. Компания не пытается удивить одной прорывной фичей – она закрывает сразу несколько пробелов, которые раньше отправляли пользователей к конкурентам. Это не всегда эффектно, зато практично. Посмотрим, сохранится ли такой темп в сентябре.
