10 сентября 2026 года DeepSeek объявила о запуске V4.1-Flash — самой компактной модели в новом семействе архитектур с нативной мультимодальностью. Одновременно компания вывела из оборота V4-Flash и объявила о постепенном прекращении V4-Pro.
Архитектура: асимметричный MoE с новым декодером
V4.1-Flash построена на архитектуре Causal Encoder–Decoder с 552 миллиардами параметров в формате MoE. Асимметрия здесь принципиальная: на входе активируются 8B параметров, на выходе — 16B. По заявлению DeepSeek, такая схема обеспечивает более высокую производительность при меньших вычислительных затратах по сравнению с классическим симметричным MoE.
KV-кэш стал заметно компактнее. Компания сообщает, что по сравнению с предыдущим поколением V4.1-Flash требует лишь 1/4 объёма HBM и 1/8 объёма SSD-хранилища. Для агентных сценариев это существенно: DeepSeek прямо указывает, что расходы на cache-hit составляют значительную долю стоимости агентных запросов.
Модель поддерживает нативное понимание изображений — без дополнительных адаптеров. Если вы строите AI-агентов для бизнеса, мультимодальность прямо из коробки меняет архитектурные решения.
API: что изменилось и когда
С 04:00 UTC 10 сентября 2026 года V4.1-Flash доступна через DeepSeek API под именем deepseek-flash. Модели V4-Flash и V4-Flash-Vision-Exp выведены из оборота; имена deepseek-v4-flash и deepseek-v4-flash-vision-exp временно перенаправляются на V4.1-Flash для обратной совместимости.
С 04:00 UTC 14 сентября 2026 года все запросы к deepseek-v4-pro также маршрутизируются на V4.1-Flash по тарифам V4.1-Flash — и так будет до выхода V4.1-Pro. По утверждению DeepSeek, тесты нескольких независимых сторон ставят V4.1-Flash выше V4-Pro по производительности, стоимости, скорости и суммарному времени выполнения.
Ценообразование
Компания сохранила пиковое и внепиковое ценообразование. Внепиковые тарифы составляют 50% от пиковых. Новые цены вступили в силу одновременно с релизом — 10 сентября 2026 года. Конкретные значения в долларах или рублях в официальном анонсе не приводятся; актуальные цифры стоит проверять напрямую в документации API.
Гибкие фоновые задачи — генерация контента, пакетная обработка документов, AI-авто-блог — логично переносить во внепиковые окна, чтобы сократить расходы вдвое.
Партнёры и открытый исходный код
Партнёры WorkBuddy (включая CodeBuddy) и OpenCode уже поддерживают V4.1-Flash. Веса модели опубликованы на Hugging Face; DeepSeek заявляет о намерении работать с open-source сообществом над поддержкой инференса и дополнительными вариантами развёртывания. Для крупных инсталляций от 2000 GPU с кластером хранения компания предлагает прямые переговоры.

Технический отчёт по V4.1-Flash опубликован на сайте DeepSeek и доступен на Hugging Face.
