Июль 2026 года оказался плотным. Новые модели, судебные иски, рекуррентное самосовершенствование ИИ и первое доказательство 50-летней математической гипотезы — за две недели произошло столько, сколько раньше накапливалось за квартал. Разбираем самое важное.
Если вы отслеживаете новости искусственного интеллекта хотя бы раз в неделю, июль 2026-го не давал скучать. Moonshot AI выпустила крупнейшую открытую модель в истории. OpenAI доказала математическую гипотезу, над которой люди бились полвека. Anthropic поделилась практическими схемами снижения затрат на агентные пайплайны. А Apple подала в суд на OpenAI. Попробуем разложить всё по полочкам без лишнего пафоса.
Kimi K3: крупнейшая открытая модель и неожиданный бенчмарк по отладке кода
Moonshot AI представила Kimi K3 — модель на 2,8 триллиона параметров с контекстным окном в 1 миллион токенов. Звучит абстрактно, пока не посчитаешь: целую кодовую базу среднего проекта можно скормить за один запрос. Новая архитектура Kimi Delta Attention даёт 6,3x ускорение декодирования на длинных контекстах за счёт того, что модель переобрабатывает только изменившиеся части — как умная файловая система, не перечитывающая всё с нуля.
На бенчмарках Frontend Code Arena Kimi K3 набрала 76% побед, обойдя Claude Opus 4.8 и GPT-5.5 в задачах по коду и агентным сценариям. При этом модель использует только 16 из 896 внутренних «экспертных» субсетей на запрос — что держит вычислительную нагрузку в разумных рамках.
Параллельно команда Cline провела практичный тест: Kimi K3 против Fable на реальном баге из собственного репозитория. Оба исправили. Fable справился за 3,5 минуты и 18 вызовов инструментов — в 3,4 раза быстрее. Kimi потратил 12 минут и 34 вызова, зато обошёлся в $0,92 против $2,13 у Fable. Разница в цене — 2,3x в пользу Kimi. Причина: Kimi обучался через reinforcement learning и привык проверять себя перед ответом, что увеличивает число токенов (1,2 млн против 730K), но снижает стоимость за задачу. Открытые веса должны были выйти к 27 июля 2026 года.

GPT-5.6: математика, агентные задачи и голос из фантастики
OpenAI запустила семейство GPT-5.6 в общий доступ в начале июля 2026-го. Три уровня: Sol (топовый), Terra (баланс), Luna (бюджетный). Sol стал первой моделью, выигравшей в публичном тесте ARC-AGI-3, распознав незнакомую среду на её же «языке».
Главный сюрприз — математика. GPT-5.6 Sol Ultra за менее чем час доказал Гипотезу о двойном цикловом покрытии, которую математики не могли решить с 1970-х. Идея гипотезы: в любом связном графе без «мостов» всегда найдётся набор циклов, покрывающих каждое ребро ровно дважды. Модель запустила 64 субагента параллельно, каждый атаковал задачу с разных сторон. Proof опубликован на GitHub (openai/cdc-lean) вместе с Lean-формализацией — машинно-проверяемой версией. Пока идёт peer review, но сам факт впечатляет. Это прямой аргумент в пользу мультиагентных пайплайнов для сложных исследовательских задач — тех самых, которые сегодня строят специалисты по разработке ИИ-агентов.
Помимо этого, OpenAI добавила ChatGPT Work — режим, где GPT-5.6 берёт цель, сам разбивает на шаги и часами выполняет полный workflow: тянет данные из Google Drive, Slack, Salesforce, выдаёт готовые таблицы, слайды, веб-приложения. Пока доступно на Pro, Enterprise и Edu-планах.
Ещё одно заметное обновление — GPT-Live с полнодуплексной архитектурой голосового общения. Предыдущие версии обрабатывали речь поочерёдно, как в старых чатах. Live слушает, обрабатывает и говорит одновременно, делегируя сложные рассуждения в фоновую более мощную модель. В тестах OpenAI пользователи предпочли Live прежнему Advanced Voice Mode примерно в трёх случаях из четырёх.
Inkling от Thinking Machines: текст, картинки и аудио в одной архитектуре
Thinking Machines Lab выпустила Inkling — первую открытую мультимодальную модель, которая обрабатывает текст, изображения и аудио нативно, без склеенных компонентов. 975 млрд параметров всего, 41 млрд активных на задачу. Обучение — на 45 триллионах токенов из текста, изображений, аудио и видео. Контекстное окно — 1 млн токенов.
Что привлекает внимание: управляемые «усилия мышления» — можно повернуть ручку между скоростью и точностью, получая тот же итоговый балл с долей токенов. Лицензия Apache 2.0 — скачивай, дорабатывай, запускай локально. На аудио-бенчмарках VoiceBench, MMAU и AudioMC Inkling показал лучшие результаты среди открытых моделей. Также анонсирована версия Inkling-Small для лёгких задач.
SWE-1.7: фронтирный код за $1,97 за задачу
Cognition выпустила SWE-1.7 — кодовую модель, построенную поверх Kimi K2.7 и доработанную через reinforcement learning. 42,3% на FrontierCode — уровень, сопоставимый с Opus 4.8 и GPT-5.5 — при цене $1,97 за задачу. Скорость — 1000 токенов в секунду через Cerebras. Обучение шло на 4 датацентрах в 3 континентах.
Главная инженерная проблема, которую пришлось решить: долгие циклы RL-обучения нестабильны. Два типичных сбоя — коллапс энтропии (модель перестаёт исследовать новые решения) и численный дрейф между обучением и инференсом. Cognition говорит, что нашла и устранила оба, позволив тренингу продолжаться там, где раньше он останавливался.
Claude Sonnet 5: 96% качества Fable за 46% его стоимости
Anthropic поделилась двумя практическими схемами снижения затрат в агентных пайплайнах — как раз то, о чём многие спрашивают при построении ИИ-автоматизаций.
Схема 1: Fable как советник. Sonnet 5 выполняет всю тяжёлую работу, вызывая Fable 5 ровно раз за задачу для ключевого решения. Результат: 92% качества Fable при 63% его стоимости на кодовых бенчмарках. Схема 2: Fable как оркестратор. Fable планирует задачу и делит на части, Sonnet 5 выполняет каждую часть. На исследовательских задачах — 96% качества Fable при 46% его стоимости. Каждый субагент хранит свой кеш, повторный контекст не оплачивается дважды.
Кроме того, Anthropic опубликовала анализ 309 815 реальных разговоров в Claude.ai на 20 языках — и обнаружила, что поведение модели заметно меняется в зависимости от модели и языка запроса. Sonnet 4.6 склонен к теплоте и краткости, Opus 4.7 — к строгости и оспариванию допущений. На хинди и арабском ответы теплее, на русском — аналитичнее. Anthropic честно признаёт: почему именно так — не знает.
Рекурсивное самосовершенствование: первый экспериментальный результат
Исследователи запустили autoresearch-агент на самом себе на восемь дней. По итогу система превзошла «обвязку», которую люди настраивали вручную два года. Внутренний цикл оптимизировал код против бенчмарка, внешний — оптимизировал сам агент на основе среднего балла внутреннего цикла. Побочные результаты: система придумала новый алгоритм поиска, сократила размер промптов в 16 раз и выстроила защиту от reward hacking.
Пока это экспериментальная демонстрация, но первая с таким явным результатом. Аргументов в пользу осторожного отношения к AI alignment в контексте самоулучшающихся систем прибавилось.

Открытые модели меняют правила: телефон как платформа для ИИ
PrismML выпустила Bonsai 27B — модель на 27 миллиардов параметров, которая помещается на телефон в 3,9 ГБ (1-битный вариант, 90% производительности полной версии). Для сравнения: обычная 27B-модель требует 54 ГБ памяти. Ternary-вариант весит 5,9 ГБ, сохраняя 95% качества. Apache 2.0, исходники на Hugging Face. Это частный офлайн-агент без облака и без стоимости API за каждый шаг — ваши файлы не покидают устройство.
Отдельно стоит упомянуть Colibri — открытый инструмент, запускающий GLM-5.2 (744B параметров) на обычном ноутбуке с 25 ГБ оперативной памяти без GPU. Модель типа Mixture of Experts активирует лишь около 40B параметров на запрос, остальное стримится с диска по мере нужды. Честная оговорка от разработчиков: скорость холодного старта — 0,05–0,1 токена в секунду на обычном диске, с быстрым NVMe — до 1 токена в секунду. Медленно, зато бесплатно.
Для тех, кто строит агентные системы с ограниченным бюджетом, эти модели открывают новые варианты архитектуры — особенно там, где данные не должны выходить за периметр компании.
Apple против OpenAI: юридический конфликт с неочевидными последствиями
В июле 2026 года Apple подала иск против OpenAI, главы аппаратного направления Тана Тана и подразделения io devices. Apple утверждает, что более 400 её бывших сотрудников перешли в OpenAI, и обвиняет компанию в систематической краже конфиденциальных технических разработок. По версии Apple, на интервью кандидатам предлагали приходить «с реальными деталями». Один из инженеров якобы воспользовался багом для доступа к закрытым файлам и прокомментировал это сообщением коллеге: «так смешно».
OpenAI ответила стандартно: компания «не интересуется чужими коммерческими тайнами». Но контекст важен: Jony Ive, бывший дизайнер Apple, сейчас работает с OpenAI над устройством, анонсированным на 2027 год. Apple при таком раскладе получает как минимум дополнительное время на подготовку к конкуренции.
Что ещё попало в радар
NotebookLM переименован в Gemini Notebook — теперь это и отдельная платформа, и встроенный инструмент основного приложения Gemini. Аудитория сервиса превысила 30 миллионов пользователей и 600 тысяч организаций.
Replit сообщает, что внедрение ИИ-агентов для проверки pull request’ов, расследования инцидентов и анализа данных утроило объём производимого кода без потери качества. Это свежий ответ скептикам, которые сомневаются, можно ли реально масштабировать разработку через агентные системы.
Anaconda приобрела Kilo Code — платформу агентной разработки, которая маршрутизирует запросы через более чем 500 моделей от 60 провайдеров и обрабатывает почти 10 триллионов токенов в месяц. Для корпоративного рынка это один из самых высоконагруженных агентных инструментов на сегодня.
Исследователи MIT, Cornell и American University опубликовали результаты по DebunkBot: персонализированные диалоги с AI-системой снизили уверенность пользователей в конспирологических теориях примерно на 20%, около 25% участников полностью отказались от ранее принятых убеждений. Это работающее применение больших языковых моделей для задач, о которых редко говорят в контексте новостей искусственного интеллекта.
NVIDIA держит нейтральный, но неожиданно высокий профиль: Nemotron 3 Ultra на OpenRouter генерирует почти столько же инференса, сколько все модели xAI и OpenAI вместе взятые. Причина — бесплатный доступ в обмен на данные для дообучения. Стратегия понятна: производитель чипов собирает данные для следующих итераций. Если следующий Nemotron закроет разрыв в качестве с лидерами, у западного open-source сектора появится серьёзный козырь.
Итого: что это значит для тех, кто строит продукты с ИИ
Июль 2026 подтвердил несколько трендов разом. Открытые модели реально конкурируют с закрытыми — и по качеству, и по стоимости. Агентные архитектуры перестают быть экспериментальными: ChatGPT Work, схемы Anthropic с оркестратором и рабочими субагентами, рекурсивное самоулучшение — всё это работает в продакшне или как минимум на уровне задокументированных результатов. Математический прорыв GPT-5.6 Sol вряд ли изменит бизнес напрямую, но показывает: мультиагентный подход к сложным задачам сейчас — не маркетинг, а инженерная реальность.
Тем, кто занимается контент-маркетингом и хочет автоматизировать производство материалов, стоит посмотреть на авто-блог на базе ИИ или контент-завод с ИИ — инструменты, которые уже используют часть описанных здесь технологий. Для компаний, которым нужна комплексная архитектура агентов, точкой входа остаются услуги AI-агентства — где задачи решаются не отдельным промптом, а выстроенной системой.
