Август 2026 года выдался странным: модели выходили быстрее, чем рантаймы успевали их поддержать, а облачные провайдеры дружно напомнили, что цена на арендованный ИИ – это не ваше решение. С 24 по 26 августа вышли сразу три серьёзных открытых модели. Потом ещё несколько. Потом подтянулись движки. Если вы следите за полем локального искусственного интеллекта, эта неделя была из тех, что запоминаются.
Z.ai выпустила GLM-5.3-Flash – 320 миллиардов параметров, 18 миллиардов активных, нативная мультимодальность, контекст в 1 миллион токенов, лицензия MIT. На OpenRouter она неделю жила под псевдонимом «Ox Alpha», пока не раскрылась. API-цена около $0.15 за миллион входящих и $0.50 за миллион исходящих токенов, вдвое дешевле до 9 сентября по акции запуска.
Alibaba выкатила Qwen3.8-Flash-Next – 125 миллиардов параметров в формате mixture-of-experts, всего 6 миллиардов активных, плюс таблица эмбеддингов на 51 миллиард параметров, которая живёт в системной оперативной памяти, а не в видеопамяти. Контекст 262K с растяжкой до 1M. Поддержка в основной ветке llama.cpp появилась меньше чем через 24 часа после релиза – что само по себе рекорд. Но минимальный рабочий квант весит 72.5 ГБ. Это рабочая станция, не ноутбук.
Poolside выпустила Laguna S 2.1 – 118 миллиардов параметров, 8 миллиардов активных, кодинговая модель под лицензией OpenMDW. Все три – открытые веса. Все три пока загружаются только через форки вендора или Unsloth, основные pull request-ы ещё на ревью.
Здесь стоит уточнить один момент, который часто упускают: открытые веса – это необходимое, но недостаточное условие. Владеть моделью значит, что веса у вас, и движок умеет их загрузить на вашем железе. Вторая половина этого уравнения решается в дни после релиза, а не в момент объявления.

26 августа вышел vLLM 0.28.0. 584 коммита – это не опечатка. В релиз вошли: сквозная поддержка sparse attention для DeepSeek V4, ускорение Kimi K3, спекулятивное декодирование DFlash2, Model Runner V2 с разделением prefill и decode, и disk-backed KV-cache – на случай, когда контекст не помещается в память. Для тех, кто гоняет большие модели на потребительском железе, последнее особенно актуально.
llama.cpp добавил архитектуру qwen4exp – без этого Qwen3.8-Flash-Next просто не загружается. Плюс новый метод спекулятивного декодирования и флаг per-slot KV-cache. Ollama 0.33.1 от 26 августа поддержал Qwen3.8-Flash-Next через MLX и починил таймауты Metal GPU при загрузке с медленного хранилища. ExLlamaV3 1.4.4 исправил баг корректности в split mixture-of-experts CPU offload – именно тот режим, на который вы переключаетесь, когда модель чуть не влезает в видеопамять.
Ни один из этих релизов не попал в тренды в день выхода. Это тот слой, который определяет, запустится ли модель, которую вы уже скачали, на GPU, который у вас уже есть. В одну неделю он стал лучше сразу на четырёх фронтах. Именно поэтому создание автономных ИИ-агентов на локальном железе сейчас выглядит реалистичнее, чем год назад.
13 августа DeepSeek-V4-Pro-0813 стал официальным, не preview-релизом флагмана. Mixture-of-Experts примерно на 1.7 триллиона параметров, контекст в миллион токенов, лицензия MIT – никаких ограничений по использованию, никаких порогов выручки. Честный компромисс: самые мощные открытые модели, которые можно полностью контролировать, весят сотни гигабайт даже после квантизации. Это серверное железо. Если его нет – V4-Flash из июля по-прежнему актуален.
10 августа Meta Superintelligence Labs выпустила Muse Glimmer – 30 миллиардов параметров, мультимодальная, под чистой лицензией Apache 2.0. Без порогов выручки, без rider-а по допустимому использованию. При 4-битной квантизации – меньше 20 ГБ, комфортно на карте с 24 или 32 ГБ. Meta тестировала на M4 Max, M5 Max и RTX 5090. Ollama добавил поддержку через MLX в версии 0.32.7 в тот же день. Это примечательно само по себе: лаборатория, которая два года определяла, как далеко можно заходить с ограничениями, выпустила модель без ограничений. Продолжит ли она в том же духе – отдельный вопрос.
5 августа DeepGrove выпустила Maple-Preview – 20 миллиардов параметров MoE, около 1 миллиарда активных, обученная с тернарными весами изначально, а не сжатая post-factum. Чекпоинт 5.31 ГБ, контекст 131K, MIT-лицензия, поддержка llama.cpp, Ollama, LM Studio и Jan с первого дня. Авторы заявляют больше 200 токенов в секунду на M4 Mac mini и в 5-16 раз выше скорость по сравнению с Gemma 4, Qwen3.5 и gpt-oss на устройстве. Оговорка честная: это preview с минимальным агентным дообучением, для сырого рассуждения, не для автономного кодинга. Но нативно-тернарная MIT-модель, которая умещается в 5 ГБ – интересная точка на карте локального искусственного интеллекта.
2 августа Thinking Machines Lab выпустила Inkling-Small – sparse MoE с 276 миллиардами параметров и около 12 миллиардами активных на токен (каждый токен роутится к 6 из 256 экспертов плюс 2 общих). Apache 2.0, мультимодальный вход: текст, изображения, аудио. Самооцениваемый SWE-bench Verified – 80.2%, AIME 2026 – 95.5%, GPQA Diamond – 89.5%. Вендорские бенчмарки стоит воспринимать как отправную точку, не как приговор. Честная ремарка та же, что у старшей версии: 276B суммарных параметров – это серверная загрузка, «можно владеть» и «можно запустить на ноутбуке» здесь не синонимы.
4 августа вышла LFM2.5-2.6B – 2.69 миллиарда параметров, гибридная архитектура (22 блока короткой свёртки плюс 8 блоков grouped-query attention), контекст 128K, менее 2.5 ГБ памяти. Около 220 токенов в секунду на M5 Max и примерно 30 на телефоне. ToolSandbox benchmark – 77.83, лучше моделей в несколько раз крупнее. 12 августа добавилась LFM2.5-VL-3B с поддержкой зрения, заточенная под понимание экранов, grounding и function calling. Обе модели поддерживаются llama.cpp, MLX, vLLM, SGLang и ONNX с первого дня. Лицензия – собственная LFM1.0, не Apache и не MIT, так что перед коммерческим использованием стоит прочитать условия.
6 августа DeepSeek предупредила разработчиков о «значительном» росте цен на API – без конкретных цифр и дат. 13 августа цифры появились. С 16 августа в 16:00 UTC API перешёл на пиковое и внепиковое тарифицирование. Пиковые часы – 01:00-04:00 и 06:00-10:00 UTC. Цена исходящих токенов V4-Flash выросла с плоских $0.28 за миллион до $0.66 в непик и $1.32 в пик – в 2.4 и 4.7 раза выше прежнего. V4-Pro: с $0.87 до $1.98 в непик и $3.96 в пик. Даже $1.32 за миллион исходящих токенов дешевле большинства закрытых лабораторий. Но суть не в абсолютных числах: цена, которую вам предложили как ориентир для планирования, оказалась предложением, а не договором.
Та же история с Anthropic: запланированный рост цен на Claude Sonnet 5 с $2/$10 до $3/$15 за миллион токенов, ожидавшийся с 1 сентября, был отменён – нынешняя цена стала постоянной. xAI запустила Grok 4.6 по $2 за миллион входящих и $6 за миллион исходящих. Дешевле – хорошая новость. Но оба числа установлены в одностороннем порядке, и в следующем квартале их можно пересмотреть так же легко. Разница между арендованной моделью и собственной именно в этом: цена модели на вашей машине – не чужое решение. Если вам нужен предсказуемый бюджет, стоит посмотреть на то, чтобы развернуть собственный ИИ портал с подключёнными локальными моделями.
Не все «открытые» модели одинаково открыты – это важно понимать перед тем, как строить на них продукт. Qwen3.8-27B от 14 августа – честный Apache 2.0, без порогов, без rider-а, можно хостить и продавать. Qwen3.8-2.4T-A95B (2.4 триллиона параметров, 95 миллиардов активных) вышел под новой «Qwen3.8-Max License»: обязательная атрибуция при превышении 100 миллионов MAU или $20 миллионов месячной выручки, отдельная платная лицензия при перепродаже хостинга с выручкой свыше $50 миллионов за 12 месяцев. Обе модели называются открытыми. Только одна из них ведёт себя так.
Отдельная тема – «uncensored» версии. После выхода Qwen3.8-27B под Apache 2.0 как минимум пять групп опубликовали свои abliterated-версии. SuperQwen 3.8 27B Abliterated от Jiunsong – репрезентативный пример: правка rank-4 в пространстве отказов, автор заявляет о сохранении vision tower и tool use, доступны GGUF и MLX кванты. Модели реальные и запускаются. Проблема – в честности: все заявления о возможностях и безопасности таких версий самооценочные, проверенные на скриптах автора, без независимого аудита. «Работает на вашей машине» и «можно доверять тому, что она говорит» – разные гарантии.
С 19 по 21 августа вышел кластер инструментов для кодинга с поддержкой собственных моделей. Cline 4.1.11 и 4.1.12 добавили генерацию изображений прямо в задаче и корпоративный контроль над разрешёнными MCP-серверами. Kilo Code 7.4.23 добавил треды ревью pull request-ов и субагентные сессии в Agent Manager. Zed 1.17 подхватил DeepSeek V4 и Gemini 3.6 Flash. OpenCode продолжил шипить возобновляемые ID субагентных задач. Общий вектор: субагенты и ревью PR переходят из разряда новинок в базовые возможности. Это хорошая новость для тех, кто строит авто-блог на базе ИИ или другие автоматизированные рабочие процессы на собственных ключах и собственном железе.
Отдельно стоит упомянуть Cursor: 17 августа компания запустила Origin – платный бета-хостинг репозиториев, pull request-ов и CI с синхронизацией через GitHub. Через два дня добавились облачные агенты, которые подписываются на PR и Slack. Читать это можно двояко: логичное расширение AI-редактора, или – предложение передать код и рабочий процесс на чужие серверы. Второй вариант прямо противоположен логике локального инструмента.
Ollama за август прошёл заметный путь. В версиях 0.32.14 и 0.32.15 (15 и 19 августа) закешировались метаданные моделей: время до первого токена при холодном старте сократилось примерно с 995 мс до 524 мс по собственным замерам Ollama. В 0.33.0-rc2 (21 августа) появилась интеграция с Claude Desktop и поверхность «connect your apps». Ollama начинался как раннер, на который указывали другие инструменты – теперь он тянется стать приложением, которое используют напрямую. Для тех, кто строит контент-завод для бизнеса на локальных моделях, это снижает порог входа.

25 августа Zed закрыл escape из файловой системной песочницы в своей системе расширений (версия 1.16.2) и перевёл агентный инструмент ask_user в состояние «выключено» по умолчанию. Реальный риск в AI-инструментах для кодинга чаще живёт не в модели, а в обвязке вокруг неё – расширениях и агентах, которые трогают файлы и шелл. Пофикшенный escape – хорошая новость. Регулярный поток таких escapе-ов – аргумент за то, что песочница должна быть настройкой по умолчанию, а не опцией, которую нужно вспомнить включить.
Отдельная находка из собственного релиза Bodega One Code beta.38: если у вас была установлена переменная OPENAI_API_KEY в окружении, она отправлялась на каждый OpenAI-совместимый эндпоинт, не только на OpenAI. Починено. Такие баги не громкие, но именно они разрушают доверие к self-hosted инструментам.
Август 2026 года показал несколько вещей одновременно. Открытые веса выходят быстро и становятся серьёзнее – GLM-5.3-Flash, Muse Glimmer, Inkling-Small, Maple-Preview закрывают разные ниши от серверного до телефонного класса. Рантаймы не отстают: vLLM, llama.cpp, Ollama и ExLlamaV3 за одну неделю стали заметно лучше на конкретном железе. Облачные провайдеры напомнили, что их цены – это их цены, а не ваши. И лицензии по-прежнему требуют внимательного чтения, особенно если вы строите коммерческий продукт.
Локальный искусственный интеллект перестал быть уделом энтузиастов с серверными стойками. 5-гигабайтная модель с MIT-лицензией на M4 Mac mini, 30-миллиардная Apache-модель на 24-гигабайтной карте, субагентные инструменты с поддержкой собственных ключей – это уже рабочий стек для бизнеса. Вопрос не в том, возможно ли это технически. Вопрос в том, кто будет строить на этом первым.
