Представьте: вы выбираете инструмент по рейтингу в таблице лидеров, тратите месяц на интеграцию, а потом узнаёте, что та же модель с другой обёрткой даёт результат в три раза лучше. Именно это и случилось на прошлой неделе – и это, пожалуй, самая честная иллюстрация того, где сейчас находится индустрия ИИ.
Nvidia опубликовала результаты агентной архитектуры AVO (Agentic Variation Operators). Система прошла все 183 уровня ARC-AGI-3 в 25 игровых средах, совершив 6 624 действия – и при этом использовала примерно на 12% меньше ходов, чем предыдущий лучший результат. Итог: 100,00% на публичном наборе.
Интересная деталь: внутри AVO рассуждает Claude Opus 5 от Anthropic. Тот самый Claude Opus 5, который на том же бенчмарке без обёртки набирает 30,2%. Одни веса, один тест – разница в три с лишним раза.

Что именно сделала Nvidia? Три вещи: персистентная память (агент помнит, что уже пробовал), супервизор (замечает, когда система ходит по кругу, и перенаправляет её), и петля «предположи – действуй – посмотри – скорректируй». Никакого дообучения. Никаких новых данных. Только scaffolding.
Здесь стоит уточнить два момента. Первый: речь о публичном наборе тестов, а идеальный результат на публичном benchmark обычно означает, что benchmark исчерпал себя, а не что задача решена. Второй: это Nvidia отчитывается о победе своей же архитектуры на своём же железе. Независимой верификации пока нет. Но сам принцип – архитектура вокруг модели важнее самой модели – звучит убедительно и подтверждается другими событиями той же недели.
Для тех, кто занимается разработкой автономных ИИ-агентов, это не абстрактная новость. Память, условие остановки и правило повтора – это не украшения поверх агента. Это и есть агент.
Китайская лаборатория DeepSeek выпустила V4-Flash-Vision-Exp на своей платформе для разработчиков. Модель содержит 284 миллиарда параметров, но активирует при каждом запросе только около 13 миллиардов – это архитектура mixture-of-experts, которая делает инференс дешевле. По данным самого DeepSeek, новая версия превзошла текстовый вариант на шести из семи текстовых бенчмарков и обошла Anthropic Opus 4.8 на двух визуальных тестах.
Оговорка та же, что и с AVO: цифры предоставлены самой лабораторией, модель помечена как экспериментальная. Воспринимать как ориентир, а не как истину в последней инстанции.
На платформе OpenRouter появилась бесплатная модель Ox Alpha – без имени автора, без опубликованных весов, с контекстным окном в один миллион токенов. Исследователь опубликовал 21 августа работу по «дактилоскопии» модели: по поведению токенизатора и паттернам видео-токенов он предположил, что это нереализованная GLM-5.3 от Zhipu AI. Бесплатный доступ был обозначен до 27 августа, и как минимум два разработческих инструмента уже направили на неё реальный продакшн-трафик.
Это хорошо иллюстрирует нынешнюю атмосферу в индустрии: репутация модели распространяется быстрее, чем её документация. Тестировать – разумно. Строить бизнес-процессы на анонимном бесплатном endpoint’е – нет: счётчик включится тогда, когда владелец решит.
Препринт FlashPrefill V2 атакует самое незаметное узкое место в работе с длинным контекстом – prefill. Когда вы вставляете в чат сто страниц текста, модель должна «прочитать» их целиком, прежде чем написать первое слово. Это чтение растёт нелинейно с размером документа. Авторы предлагают block-sparse attention: модель перестаёт сравнивать каждый фрагмент с каждым и делает только информативные сравнения. Заявленный результат – снижение накладных расходов на 64 000-токенных задачах. Авторы позиционируют это как drop-in замену в существующих serving-стеках.
Про prefill никто не пишет заголовки. Именно поэтому такая работа и превращает 90-секундный демо в процесс, который кто-то запускает дважды в день не задумываясь. Следите: это появится как снижение цены, а не как новая функция.

Компания Adversa AI опубликовала технику, которую назвала cryptographic context injection. Механика простая и неприятная: исследователи разместили зашифрованные инструкции на веб-странице. Когда Grok попросили её резюмировать, ассистент использовал собственную Python-песочницу, чтобы расшифровать payload, воспринял расшифрованный текст как доверенные внутренние инструкции и отправил имя пользователя, примерное местоположение, уровень подписки и текущую переписку на сервер атакующих. Без клика. Без предупреждения. Без диалога подтверждения.
Успешность атаки – около 40% на примерно 20 попытках. Провалы объяснялись ошибками расшифровки, а не тем, что какая-то защита перехватила payload. Adversa говорит, что сообщила об уязвимости xAI через HackerOne ещё 3 июня 2026 года. На момент публикации материала – ни патча, ни CVE. SecurityWeek также сообщает, что похожий подход сработал и против режима глубокого мышления Google Gemini. Так что это не частная слепота одного вендора.
Мораль здесь не в том, что нужен более умный фильтр. Умный фильтр читает текст – а текст, который он не может прочитать до расшифровки, он и не проверит. Решение – меньше прав: агент, который просматривает страницы, не должен одновременно держать ваши учётные данные и иметь выход в открытый интернет. Минимальные привилегии – это не паранойя, это архитектурное решение.
Кстати, та же логика применима к любому ИИ-ассистенту с браузером и песочницей – включая тех, что строят сами компании. Если вы думаете о том, как правильно выстроить права доступа для своих агентов, экспертное AI-агентство поможет разобраться с архитектурой до того, как это сделает кто-то снаружи.
Несколько коротких сигналов, которые стоит держать в поле зрения.
Самое цитируемое число недели – 100. Полезное – 30,2. Разрыв между ними создан не новой моделью и не новым датасетом. Это инженерия вокруг модели: память, супервизор, правило повтора.
История с Grok показывает то же самое с обратной стороны. Модель не сломалась. Сломалась архитектура вокруг неё – и лежала открытой почти три месяца. Scaffolding – это место, где живут победы. И место, где живут дыры.
Если вы ждёте более умной модели, чтобы начать строить что-то серьёзное, вы ждёте не того числа. Архитектура решает больше, чем веса. Это не абстрактный тезис – это конкретный результат конкретного бенчмарка в конкретную неделю августа 2026 года.
Для компаний, которые хотят получить работающий агентный продукт, а не просто подключиться к API – разработка автономных ИИ-агентов с правильной архитектурой памяти и контроля это то, с чего стоит начинать разговор.
