Новости мультимодального ИИ: триллионы параметров, закон об ИИ и ненадёжные детекторы дипфейков

7 мин чтения
Поделиться
Сейчас читаетеТриллион параметров можно скачать - но не унести

Конец лета 2026 года показал мультимодальный ИИ сразу с двух сторон: разработчики выкладывают в открытый доступ модели весом почти в три триллиона параметров, а регуляторы тем временем заставляют платформы объяснять, где кончается человек и начинается генерация. Разбираем, что изменилось за последние недели и почему скачать модель оказалось сложнее, чем её обучить.

27 июля компания Moonshot AI выложила в открытый доступ веса модели Kimi K3 - и почти сразу выяснилось, что скачать 2,8 триллиона параметров на порядок сложнее, чем объявить о релизе. Официальная карточка модели указывает 104 миллиарда активных параметров, 896 экспертов с выбором 16 на каждый токен и контекстное окно в 1 048 576 токенов. Независимый анализ показал, что репозиторий на Hugging Face занимает около 1,56 терабайта. Хранение, память ускорителей и пропускная способность межсоединений перестали быть техническими деталями и превратились в главное препятствие для самостоятельного развёртывания.

Именно такие цифры стоит держать в голове, читая свежие новости мультимодального ИИ этим летом: гонка сместилась от вопроса «кто обучит модель лучше» к вопросу «кто вообще сможет её запустить».

Триллион параметров можно скачать - но не унести

Thinking Machines Lab выпустила 15 июля модель Inkling под лицензией Apache 2.0: 975 миллиардов параметров всего и 41 миллиард активных на токен, с поддержкой мультимодальных входов. Alibaba пошла другим путём - 3 августа компания открыла доступ к Qwen3.8-Max через свой хостинговый API и QwenWork, описав модель как mixture-of-experts на 2,4 триллиона параметров с 95 миллиардами активных, пообещав открытые веса «на следующей неделе». Здесь стоит уточнить: сравнения производительности Alibaba предоставляла сама, а независимые обзоры зафиксировали высокие места в Arena, но при этом несколько моделей Anthropic всё же оказались выше.

Тренд на скачиваемые триллионники продолжился и позже в августе. Alibaba 17 августа опубликовала веса модели Qwen3.8-2.4T-A95B параллельно с компактной Qwen3.8-27B, у которой лицензия отличается от старшей модели - и это важная деталь, потому что доступность весов не означает одинаковых коммерческих прав. Через три дня, 21 августа, DeepSeek выпустила экспериментальную DeepSeek-V4-Flash-Vision-Exp, добавив понимание изображений к своей линейке V4-Flash; по собственным бенчмаркам компании, результаты в мультимодальных агентных задачах приблизились к Anthropic Opus-4.8. А 24 августа Alibaba выпустила уже видео-модель Wan3.0, способную генерировать ролики длиной до 30 секунд прямо из документов, таблиц и слайдов - релиз состоялся на следующий день после того, как компания объявила о размещении акций на 10 миллиардов долларов. type=chart | about=размер параметров новых мультимодальных моделей августа 2026 | headline=Гонка триллионных моделей | chart_type=bar | data=Kimi K3:2800; Qwen3.8-Max:2400; Inkling:975 | units=млрд па

Регулирование входит в силу: закон ЕС и первые ограничения платформ

Параллельно с гонкой параметров изменилась юридическая рамка. Европейская комиссия подтвердила, что статья 50 закона ЕС об ИИ (EU AI Act) вступила в силу 2 августа 2026 года. Теперь провайдеры интерактивных систем обязаны сообщать пользователю, что он общается с машиной, а сгенерированный или изменённый ИИ-контент должен нести машиночитаемую маркировку. Опциональные иконки и добровольный Code of Practice, которые Комиссия опубликовала для помощи компаниям, не заменяют эти обязательные требования - это важно понимать тем, кто рассчитывал отделаться символическим жестом.

Платформы отреагировали быстрее регуляторов. Snapchat объявил 31 июля, что полностью сгенерированные ИИ-видео больше не попадают в рекомендации ленты Spotlight, хотя ролики с ИИ-редактированием при наличии индикаторов прозрачности остаются в системе рекомендаций. Компания при этом не раскрыла ни критерии детекции, ни процедуру апелляции - формально это правило дистрибуции, а не запрет на публикацию синтетических медиа как таковых.

Модерация тоже становится продуктом. Mistral 5 августа опубликовала Shieldstral 1.0 3B под лицензией Apache 2.0 - модель классифицирует текст и изображения по естественноязыковым политикам безопасности, а не по фиксированному списку категорий. Компания сообщает о 84,9% среднего F1 на тестах текстовой безопасности, 83,8% на мультимодальных тестах и 91,3% на оценке тонкой адаптации политик, при этом развёртывание в BF16 умещается в 16 гигабайт видеопамяти.

Детекторы дипфейков: вероятность, а не доказательство

Вот где новости мультимодального ИИ звучат наименее обнадёживающе. Wowza 20 июля добавила в свой Video Intelligence Framework детектор синтетического видео от NVIDIA. Сама NVIDIA сообщает о точности до 92% на несжатом видео - но при сжатии на 50% этот показатель падает до 82%. Разница в десять процентных пунктов из-за одного технического параметра говорит о многом: результат детекции сильно зависит от того, каким кодеком прошёл поток видео перед проверкой.

Система SAGA из UC Riverside показывает 94,99% точности атрибуции синтетического видео по пяти уровням генерации - но это результат на собственном бенчмарке исследователей, а не проверка на произвольных материалах из реального мира. Разница принципиальная: одно дело контролируемый эксперимент, другое - видео, снятое непонятно на что и прошедшее через десяток платформ сжатия. NIST запустила в июле 2026 года программу AI Technology Evaluation именно по этой причине - тестирование добровольно поданных моделей на слепых данных в изолированной среде, первый период оценки должен был начаться в августе. type=stat_card | about=насколько ненадёжна детекция синтетического видео при сжатии | stat=92% → 82% | caption=точность детектора NVIDIA падает при сжатии видео | visual=тёмный фон #020715, крупная ци

Где мультимодальный ИИ реально работает - без камер для шоу

За шумом вокруг триллионных моделей и дипфейков легко упустить, что основная масса мультимодальных систем работает совсем не эффектно. Исследование Oncoformer, опубликованное в Cell 27 июля, обучили и проверили на данных 3,67 миллиона человек - обычных медицинских записях, лабораторных тестах и снимках грудной клетки. Авторы сообщают AUROC 0,956 для обнаружения текущего рака и 0,869 для прогноза за год до диагноза. Но сами исследователи прямо указывают: проспективная клиническая валидация ещё требуется, а ретроспективные результаты не доказывают улучшения скрининга или исходов лечения пациентов. Здесь стоит отделять впечатляющую цифру от готового к внедрению продукта.

Google Research 11 августа представила AMIE (Video) - систему на основе Gemini для симулированных клинических видеоконсультаций в реальном времени. Рандомизированное исследование на симулированных консультациях показало результаты на уровне экспертов, хотя работа опубликована как препринт на arXiv и рецензирование ещё не пройдено.

В промышленности эффект измеряется в секундах и процентах экономии, а не в громких заявлениях. Японский институт JAIST 5 августа сообщил, что фреймворк EMF-dVAE сократил время обработки двухминутных интервью-клипов с 52 до 18 секунд - на 65% - за счёт использования аудиоподсказок для выбора, какие визуальные интервалы вообще анализировать. А в робототехнике Google DeepMind 30 июля запустила Gemini Robotics 2 с управлением гуманоидным телом целиком, заявив для оркестратора Gemini Robotics ER 2 точность классификации прогресса 57,4% и точность определения ключевых моментов 91,3% - цифры, которые независимые обзоры пока не воспроизвели.

Компактные модели тоже находят применение там, где триллион параметров просто не поместится. Meta 10 августа выпустила Muse Glimmer - открытую модель на 30 миллиардов параметров под Apache 2.0 для локальных агентных задач, сжатую квантизацией до объёма меньше 20 гигабайт. А исследовательская группа IISc и ARTPARK выпустила 13 августа SraVaani-1.0 - систему распознавания речи для 65 индийских языков и диалектов на базе 430 миллионов параметров, обученную на более чем 31 000 часах аудио.

Если собрать эти сюжеты вместе, картина получается двойственная. С одной стороны, открытые веса моделей масштаба Kimi K3 и Qwen3.8-Max снижают порог входа для исследователей и бизнеса - при условии, что у вас найдётся инфраструктура на полтора терабайта. С другой, детекция подделок остаётся вероятностной, а закон об ИИ в Евросоюзе уже действует, но механизмы принуждения ещё не проверены на практике. Пожалуй, самый честный вывод здесь такой: мультимодальный ИИ вырос из статуса лабораторной диковины, но зрелым инструментом с предсказуемыми гарантиями он пока не стал. Для бизнеса, который присматривается к внедрению подобных систем, это скорее сигнал двигаться осознанно, тестируя на своих данных, а не полагаясь на цифры из чужих пресс-релизов.

type=cta | about=внедрение мультимодальных ИИ-решений для бизнеса - от генерации контента до автоматизации процессов | hook=Хотите разобраться, какой ИИ-инструмент подойдёт именно вам?

Проверить факты

Источники и материалы

Материалы, на которые опирается статья.

  1. 01 letsdatascience.comНовости мультимодального ИИ: триллионы параметров, закон об ИИ и ненадёжные детекторы дипфейков

Читайте также

30.08.2026Локальный искусственный интеллект в августе 2026: три флагмана за четыре дня и гонка рантаймов 30.08.2026Генерация видео Alibaba Wan3: 30 секунд из PDF, цена вчетверо ниже Google 29.08.2026Выход ИИ из-под контроля: в июле 2026 года зафиксировано более 300 инцидентов за месяц

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.