Август 2026 года оказался насыщенным: сразу несколько крупных релизов, заметное снижение цен на инференс и первые реальные санкции со стороны регуляторов. Разбираем, что изменилось и почему цифры в пресс-релизах стоит проверять самостоятельно.
Рынок больших языковых моделей движется сразу по нескольким осям одновременно. Одни лаборатории публикуют веса моделей с триллионами параметров, другие режут цены на API, третьи получают первые предупреждения от регуляторов. Картина пёстрая - и именно поэтому стоит разложить её по полочкам, а не довольствоваться заголовками.
Что вышло: от 750 млрд до 2,8 трлн параметров
За последние недели open-weight сегмент пополнился сразу несколькими крупными моделями. Moonshot AI 27 июля 2026 года опубликовала веса Kimi K3: 2,8 трлн параметров суммарно, 104 млрд активных на каждый токен, контекстное окно в 1 048 576 токенов. Репозиторий на Hugging Face весит около 1,56 ТБ - уже один этот факт ограничивает круг тех, кто реально сможет развернуть модель локально.
Alibaba пошла другим путём. 3 августа компания открыла доступ к Qwen3.8-Max через API и анонсировала выход открытых весов на следующей неделе; 12 августа веса Qwen3.8-2.4T-A95B (2,4 трлн параметров, 95 млрд активных) появились публично. Лицензия, правда, с оговоркой: компаниям с выручкой от модельных сервисов свыше $50 млн в год нужен отдельный договор. Мелочь - но важная.
На более скромном конце шкалы - Thinking Machines Lab с Inkling (975 млрд суммарных, 41 млрд активных, Apache 2.0) и LG AI Research с K-EXAONE 2.0 (750 млрд суммарных, 37 млрд активных, тоже Apache 2.0). LG заявляет об ускорении инференса в 3-5 раз за счёт multi-token prediction и DSpark speculative decoding - цифра интересная, хотя пока только со слов самой компании.
Отдельно стоит упомянуть IBM: 25 августа вышла Granite 4.2 в трёх вариантах (3B, 8B и 30B параметров) под Apache 2.0 с поддержкой reasoning, инструментов и кодирования. Скромнее по масштабу, но ориентирована на корпоративных агентов - и это уже другой разговор.
Цены падают - но не везде одинаково
30 июля OpenAI срезала цены на GPT-5.6 Terra на 20% (теперь $2 за млн входных токенов и $12 за млн выходных) и на Luna сразу на 80% - до $0,20 и $1,20 соответственно. Anthropic выпустила Claude Opus 5 ещё 24 июля по $5/$25 за млн токенов - то же, что у Opus 4.8, и вдвое дешевле Claude Fable 5. 22 августа OpenAI дополнительно снизила цены на GPT-5.6 Sol: $4 за млн входных и $20 за млн выходных токенов (против прежних $5/$30).
Здесь стоит уточнить один нюанс. OpenAI сообщила, что Sol-оптимизация ядра снизила её собственные расходы на обслуживание на 20%, а улучшенный draft-model поднял эффективность генерации токенов больше чем на 15%. Хорошие цифры. Но цены для клиентов при этом не изменились - значит, провайдер просто улучшил маржу. Это не упрёк, это напоминание: стоимость у провайдера и прайс-лист - разные вещи.
Grok 4.6 от xAI вышел 12 августа с ценой $2/$6 за млн токенов и контекстным окном 500 000 токенов. Artificial Analysis оценил модель в 61 балл по своему Intelligence Index - наравне с GPT-5.6 Sol. Для тех, кто строит агентные пайплайны, это уже рабочая альтернатива.
Бенчмарки: почему одно число ничего не значит
Новости больших языковых моделей в последние месяцы всё чаще упираются в один и тот же вопрос: можно ли доверять опубликованным результатам? Ответ неудобный.
Lasso Security провела эксперимент: взяла 100 пар «модель + задача», зафиксировала всё - промпты, инструменты, цели, судью - и изменила только harness. Из 1000 атак средний процент успеха почти не сдвинулся (около 21% и 19%). Но 43 из 100 пар полностью перешли из категории «хотя бы один успех» в «ноль успехов». Независимый судья отклонил 155 из 303 побед, о которых заявил атакующий агент. Это значит, что бенчмарк измеряет систему целиком, а не модель как таковую.
DeepSeek 31 июля выпустила V4-Flash-0731, которую Artificial Analysis оценил в 50 баллов по Intelligence Index - на 10 выше предыдущей версии. Но часть заявленных улучшений в кодировании опирается на внутренние тест-сеты и нераскрытую инфраструктуру оценки. Верить или нет - решайте сами, но воспроизвести пока нельзя.
Arena сообщила изданию Let's Data Science, что OpenAI - единственный провайдер, который стабильно улучшает фактическую точность на протяжении длительного периода. Большинство open-source моделей теряют позиции, когда в оценку добавляют вес фактической корректности. Это не приговор открытым моделям, но повод не игнорировать метрику.
Представьте ситуацию: вы планируете продуктовую архитектуру под конкретную модель, опираясь на опубликованный benchmark. Потом оказывается, что результат зависел от harness, который вы не воспроизвели. Бюджет и сроки пересчитываются. Совет прямой: прогоняйте бенчмарки в своей инфраструктуре до того, как принимаете архитектурные решения.
Математика, Lean и нераскрытая модель
1 августа OpenAI сообщила, что внутренняя версия Astra получила десять результатов в математике и теоретической информатике, включая три решения задач Эрдёша - проблем, по которым, по словам компании, не было прогресса минимум десятилетие. Люди готовили аргументы в виде рукописей, модель формализовала их в Lean.
Lean-формализации - это проверяемые артефакты, в отличие от benchmark-баллов. Корректность можно верифицировать. Новизну и значимость - нет, для этого нужна экспертная рецензия. При этом OpenAI не опубликовала ни общий процент успеха по всем задачам, ни model card, ни дату релиза. Astra остаётся закрытой. Так что сигнал есть, но его масштаб пока неизвестен.
Регуляторика: ЕС включил механизм, США пока нет
2 августа 2026 года вступили в силу полномочия Европейской комиссии в отношении провайдеров general-purpose AI. Теперь Комиссия может запрашивать информацию, проводить оценки моделей, требовать корректирующих мер или вывода с рынка, а также штрафовать - до 15 млн евро или 3% мирового годового оборота. Это не новые обязательства, а механизм их исполнения: обязанности действуют с августа 2025 года, теперь за их нарушение реально наказывают.
В США картина иная. Предложение о создании регулятора по образцу FINRA, подотчётного SEC, всё ещё на стадии обсуждения и, по данным Bloomberg, не рассматривалось президентом Трампом. Крис Фолл ушёл с поста директора Центра стандартов и инноваций в области ИИ примерно через три месяца после назначения. Центр работает под временным руководством.
Отдельный тревожный сигнал - доклад Jamestown Foundation от 30 июля: китайские военные и связанные с силовыми структурами организации используют дистилляцию, в том числе на основе выходных данных моделей OpenAI и Anthropic, для обучения специализированных систем в области обороны, наблюдения и кибератак. Это задокументированные исследовательские намерения, а не подтверждённое боевое применение - но игнорировать их сложно.
Что со всем этим делать на практике
Три вещи, которые сейчас важнее всего для тех, кто строит продукты на LLM.
- Фиксируйте версии моделей. Провайдеры меняют модели под теми же именами. GPT-5.6 Sol после снижения цен в августе - это другой контракт, чем был неделю назад.
- Воспроизводите бенчмарки внутри своей инфраструктуры. Эксперимент Lasso Security показал: смена harness при фиксированной модели меняет результат кардинально. Ваш harness - ваша реальность.
- Считайте стоимость по фактическому потреблению. Luna подешевела на 80% - это не значит, что ваш счёт упадёт на 80%. Зависит от того, какую долю занимает этот тип запросов в вашей нагрузке.
Рынок не замедляется. За август вышли Granite 4.2, Grok 4.6, Gemini 3.7 Flash, Qwen3.8-27B, GLM-5.3 и ещё с десяток моделей поменьше. Следить за каждым релизом - занятие бесполезное. Полезное - понимать, по каким осям реально идёт конкуренция: цена токена, качество инструментального вызова, поведение под нагрузкой и соответствие регуляторным требованиям вашего рынка.
Именно это разделяет команды, которые строят устойчивые продукты на ИИ, и те, кто каждый месяц переписывает архитектуру под новый хайп.
