Обзор моделей LLM август 2026: Claude Opus 5, GPT-5.6 и ценовая война на рынке AI

Фабио Де ЛукаБизнесYesterday17 Просмотры

Фронтир стал дешевле. Это хорошая новость с неудобным подтекстом: скидки не применяются сами собой, и большинство команд уже платят по новым ценам – не зная об этом. Давайте разберёмся с каждой из ключевых новинок июля 2026, и посмотрим, что реально стоит пересчитать в своём стеке.

Claude Opus 5: та же цена, совсем другая модель

Anthropic выпустил Claude Opus 5 24 июля 2026 года. Цена – $5 за входящий миллион токенов и $25 за исходящий – осталась идентичной Opus 4.8. Но на этом сходство заканчивается.

Самая интересная часть – не бенчмарки сами по себе, а то, как Anthropic их представил: в стоимости на задачу, а не в абстрактных баллах. На CursorBench 3.2 при максимальных настройках Opus 5 уложился в 0,5% от пикового результата Claude Fable 5 – при вдвое меньших затратах на задачу. На OSWorld 2.0 он превзошёл Fable 5 примерно за треть стоимости. На Frontier-Bench v0.1 набрал вдвое больше очков, чем Opus 4.8, при меньших затратах. На ARC-AGI 3 Anthropic отчитывается о результате в три раза выше следующего участника рейтинга.

Если вы сейчас платите $10/$50 за Fable 5 на агентном кодировании – есть прямой аргумент для пересмотра. Opus 5 поставляется с контекстным окном в 1 миллион токенов, максимальным выводом 128K и пятиступенчатым регулятором усилий (low / medium / high / xhigh / max). Этот регулятор позволяет одной и той же моделью обслуживать дешёвые высокочастотные вызовы и дорогие длинные агентные задачи. Такой гибкости у Opus 4.8 просто не было.

Тут стоит уточнить одну деталь, которую легко проглядеть. Claude 4.7 и более поздние модели используют новый токенизатор, который выдаёт примерно на 30% больше токенов для того же текста. Формальное сравнение по ставке за токен занижает реальную стоимость запроса. Иными словами: ставка на карточке и ставка в счёте – разные числа. Внедрение ИИ-агентов с правильным инструментарием мониторинга позволяет увидеть этот зазор раньше, чем он проявится в выставленном счёте.

Один явный пробел Anthropic признаёт сам: Opus 5 уступает Mythos 5 на задачах кибербезопасности и разработки эксплойтов. Для большинства коммерческих применений это несущественно, но знать стоит.

type=chart | about=сравнение цен на модели Anthropic и OpenAI в августе 2026 | headline=Фронтир подешевел вдвое | chart_type=bar | data=Fable 5 input:10; Opus 5 input:5; GPT-5.6 Sol input:5; GPT-5.6 T

GPT-5.6: общая доступность и неожиданная скидка

9 июля 2026 OpenAI перевёл GPT-5.6 из ограниченного доступа примерно для 20 организаций в полноценную публичную доступность. Семейство состоит из трёх уровней: Sol (флагман), Terra (баланс), Luna (быстрый и дешёвый).

Через три недели, 30 июля, случилось то, что большинство команд пропустило: OpenAI урезал цены на два из трёх уровней. Luna подешевела на 80% – с $1,00/$6,00 до $0,20 за входящий и $1,20 за исходящий миллион токенов. Terra – на 20%, с $2,50/$15,00 до $2,00/$12,00. Sol остался на $5,00/$30,00.

Это не округление. 80% на высокочастотном уровне – это другая экономика продукта. Если вы гоните через Luna классификацию, извлечение или суммаризацию, ваши юнит-экономики изменились 30 июля. Вне зависимости от того, заметил это кто-то в команде или нет.

OpenAI объяснил снижение эффективностью обслуживания, достигнутой в ходе разработки GPT-5.6: примерно 20% снижение сквозных затрат на обслуживание и более 15% улучшение эффективности генерации токенов. Аналитики и медиа единодушно трактуют это как реакцию на конкуренцию со стороны китайских и открытых моделей. Скорее всего, и то и другое правда одновременно.

Остальное поле: Grok, Meta и открытые веса

Июль вышел одним из самых плотных по релизам месяцев за всё время наблюдений. Картина складывается в единый тренд: возможности распределились горизонтально, цена упала.

Grok 4.5 от xAI

Вышел 8 июля по $2/$6. Это MoE-модель на 1,5 триллиона параметров, обученная совместно с Cursor. Контекстное окно 500K токенов, кешированный ввод за $0,50. На Terminal-Bench 2.1 показывает 83,3% – реально конкурентные результаты по кодированию при средней ценовой точке. Любопытный факт: совместная разработка с конкретным инструментом кодирования – это сигнал о том, куда движется специализация моделей.

Meta Muse Spark 1.1

9 июля Meta запустила Muse Spark 1.1 и, что важнее, первый платный developer API по $1,25/$4,25 с контекстом в 1 миллион токенов. До этого Meta публиковала веса, но не продавала инференс. Это структурное изменение рынка, а не просто очередная модель. Когда компания с таким масштабом данных и вычислений начинает выставлять счета разработчикам, конкурентная динамика меняется.

Gemini 3.6 Flash от Google

Вышел 21 июля по $1,50/$7,50. Продолжает линейку рабочих лошадей для высокого объёма. Интересная деталь: примерно на 17% меньше исходящих токенов, чем у 3.5 Flash, для той же работы. Это реальное снижение стоимости, которое никогда не появится в официальной карточке ставок – только в счёте.

Открытые веса на уровне фронтира

27 июля Moonshot выпустил Kimi K3 – полные веса модели с 2,8 триллиона параметров (104 миллиарда активных), контекст 1 миллион токенов. Thinking Machines выпустил Inkling под Apache 2.0, затем Inkling-Small за $0,30/$1,20. Meituan выставил LongCat-2.0, обученный на китайских ASIC, по цене около $0,038 за миллион токенов.

Разрыв между «самым дешёвым приемлемым» и «новейшим лучшим» сейчас составляет примерно 150 раз по стоимости входящих токенов: LongCat-2.0 против Fable 5. Это больше, чем в любой другой момент за историю наблюдений. Какой конец этого диапазона обслуживает ваш трафик – сейчас более значимое решение по стоимости, чем любой инфраструктурный выбор в этом квартале.

Именно здесь помогает автогенерация контента с правильно подобранным маршрутизатором моделей: дешёвые задачи на дешёвых моделях, сложные на дорогих, и это всё должно работать автоматически.

Что случилось с правительственными ограничениями доступа

Для тех, кто следит с прошлого месяца: история с экспортным контролем, по всей видимости, закрылась. Приказ Министерства торговли США от 12 июня 2026 года, который приостановил доступ иностранных граждан к Claude Fable 5 и Mythos 5, был отменён 30 июня. Fable 5 вернулся в глобальный доступ 1 июля, GPT-5.6 достиг общей доступности 9 июля.

Claude Mythos 5 по-прежнему ограничен для утверждённых клиентов в рамках Project Glasswing. Это коммерческое ограничение, а не регуляторное.

Устойчивый вывод из этого эпизода, который останется актуальным независимо от дальнейшего развития событий: доступность модели может измениться быстрее, чем ваш цикл релизов. Модель за продакшн-фичей должна быть конфигурационным значением, а не захардкоженным именем в коде.

Таблица актуальных моделей на август 2026

Ниже – ставки на 2 августа 2026 года по данным официальных страниц вендоров. Цены меняются без предупреждения.

  • Claude Mythos 5 (Anthropic) – $10/$50, ограниченный доступ (Project Glasswing)
  • Claude Fable 5 (Anthropic) – $10/$50, глобально с 1 июля, контекст 1M
  • Claude Opus 5 (Anthropic) – $5/$25, новинка от 24 июля, контекст 1M, регулятор усилий
  • Claude Sonnet 5 (Anthropic) – $2/$10 вводная цена до 31 августа, с 1 сентября $3/$15
  • GPT-5.6 Sol (OpenAI) – $5/$30, GA с 9 июля, цена не изменилась
  • GPT-5.6 Terra (OpenAI) – $2/$12, снижена на 20% с 30 июля (была $2,50/$15)
  • GPT-5.6 Luna (OpenAI) – $0,20/$1,20, снижена на 80% с 30 июля (была $1/$6)
  • Gemini 3.6 Flash (Google) – $1,50/$7,50, новинка от 21 июля, контекст 1M
  • Grok 4.5 (xAI) – $2/$6, новинка от 8 июля, контекст 500K
  • Muse Spark 1.1 (Meta) – $1,25/$4,25, первый платный API Meta, контекст 1M

Для практического обзора моделей LLM август 2026 эта таблица – отправная точка. Но только отправная: реальные затраты зависят от токенизатора конкретной модели, настроек контекста и логики маршрутизации трафика.

Что из этого реально важно для команд

Скидки не применяются сами

Ставки изменились дважды за один месяц: 24 июля и 30 июля. Ни одно из этих изменений не требовало действий от вашей команды – и ни одно не отразится нигде, кроме счёта, если вы не отслеживаете расходы по модели. Это конкретная, неромантичная проблема. Хорошая новость превращается в невидимую экономию.

Запланированное повышение цены на Sonnet 5

Вводная цена Claude Sonnet 5 в $2/$10 заканчивается 31 августа 2026 года. С 1 сентября трафик тарифицируется по $3/$15. Это рост на 50% для уровня, на котором многие команды тихо стандартизировались. Если вы запускаете контент-завод на ИИ или другую высокочастотную систему – дата в календарь.

Пять уровней усилий и токенизатор ломают сравнение ставок

Регулятор усилий Opus 5 и новый токенизатор Anthropic с +30% токенами для того же текста вместе означают: ставка за токен больше не предсказывает стоимость запроса. Предсказывает только наблюдаемые расходы. Это весь аргумент в пользу инструментации AI-расходов на уровне модели.

Премиальный уровень теперь необязателен в большем числе случаев

Opus 5 по $5/$25, выполняющий работу уровня Fable 5 вдвое дешевле, – самая очевидная возможность понизить модель без потери качества за этот год. Но только если кто-то в команде измерил дельту качества на вашей конкретной нагрузке, а не на абстрактном бенчмарке.

Вот где стоит сделать паузу и задать себе вопрос: когда последний раз ваша команда пересматривала маршрутизацию моделей не в ответ на сломанную функцию, а проактивно? Если ответ – «никогда» или «не помню» – это нормально, но это дорого обходится. Наше ИИ-агентство видит это постоянно: компании переплачивают за GPT-4-класс там, где GPT-3.5 класс справился бы с тем же качеством.

Итог: рынок переписал условия, пока вы работали

Июль 2026 не был месяцем какого-то одного прорыва. Это был месяц, когда несколько разных давлений – ценовая конкуренция, открытые веса на уровне фронтира, Meta с первым коммерческим API – одновременно сдвинули точку равновесия рынка.

Настоящий обзор моделей LLM август 2026 – это не список победителей. Победителя нет: есть правильный инструмент для каждого типа задачи. Luna за $0,20/$1,20 на классификацию. Opus 5 за $5/$25 на агентный код. Kimi K3 или Inkling там, где бюджет жёстко ограничен. Выбор модели – это теперь инженерная задача с экономическими последствиями, а не единовременное решение.

Разрыв между самой дешёвой и самой дорогой моделью достиг 150-кратного по стоимости входящих токенов. Это не курьёз – это условие задачи. Команды, которые научатся маршрутизировать трафик по этому диапазону осмысленно, получат структурное преимущество перед теми, кто гоняет всё через один флагман по привычке.

type=cta | about=внедрение ИИ-агентов с правильной маршрутизацией моделей и мониторингом расходов | hook=Переплачиваете за токены? Пора считать правильно.

Соц. сети
  • Pinterest1360
  • Youtube1285
  • WhatsApp
  • Telegram1608
  • VKontakte102
  • TikTok1059
Loading Next Post...
Боковая панель Поиск
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...