Когда Google объявляет о новой speech-to-text модели, реакция рынка обычно сдержанная: ну ещё одна, подумаешь. Gemini 3.5 Transcribe – другой случай. Здесь речь идёт не просто об улучшенном распознавании слов, а о модели, которая понимает намерение говорящего, убирает мусор из речи и форматирует результат без участия человека. Разница ощутимая.
Традиционные системы распознавания речи работают линейно: слышат слово, пишут слово. Если вы сказали «эм, встретимся во вторник, нет, в среду» – именно это и появится в тексте. Gemini 3.5 Transcribe обрабатывает такие случаи иначе: самоисправления исчезают, слова-паразиты отфильтровываются, итоговый текст выглядит как написанный, а не надиктованный.
Цифры говорят сами за себя. По данным Artificial Analysis, средний Word Error Rate (WER) составляет 4,0% для потокового режима и 2,6% для предзаписанного аудио. На бенчмарке FLEURS по топовым языкам и локалям модель достигает 5,50% WER в потоковом режиме и 5,04% в непотоковом. По сравнению с предыдущей моделью Chirp 3 время до финальной транскрипции сократилось на 70%.
Модель поддерживает более 85 языков с автоматическим определением – без ручного выбора. Региональные акценты и диалекты тоже учитываются. Для многоязычных команд или международных колл-центров это практически меняет расчёт стоимости транскрипции.
Разработчикам доступны два отдельных API, и выбор между ними зависит от задачи.
Модель gemini-3.5-transcribe-live работает через Live API с двусторонней потоковой передачей и задержкой менее секунды. Это режим для голосовых агентов, систем субтитрирования в реальном времени, интерактивных интерфейсов. Представьте систему, которая слышит вопрос клиента и немедленно передаёт чистый текст в CRM – без паузы, без постобработки.
Именно такой сценарий лежит в основе создания умных ИИ-агентов: голосовой ввод становится полноценным интерфейсом, а не костылём к клавиатуре.
Модель gemini-3.5-transcribe через Interactions API обрабатывает готовые аудиофайлы: записи встреч, логи звонков, подкасты. Ключевые возможности – разделение речи по спикерам (до трёх, поддержка большего числа в экспериментальном режиме) и временны́е метки на уровне слов. Это делает постобработку звонков и совещаний по-настоящему автоматической.
Кстати, именно такая схема лежит в основе кейса с голосовым ИИ-агентом для отчётов: записал голосовое – получил структурированный документ. С точностью WER 2,6% это уже не эксперимент, а рабочий инструмент.
Распознавание речи Gemini 3.5 Transcribe – это не только перевод звука в буквы. Несколько функций заслуживают отдельного внимания.
Модель умеет делегировать сложные задачи другим моделям Gemini через function calls. Пользователь говорит голосом – модель понимает намерение и передаёт задачу нужному инструменту. Пока это доступно в приложении Gemini на macOS, но направление очевидно: голос становится универсальным интерфейсом управления.
Специализированная лексика – давняя боль корпоративных систем транскрипции. Медицинские термины, названия продуктов, внутренние коды – всё это традиционно вызывало ошибки. Gemini 3.5 Transcribe адаптирует транскрипцию под предоставленный словарь. Почтовые индексы, артикулы заказов, нестандартные написания – модель с ними справляется.
На платформе Google Antigravity модель получает доступ к контексту экрана и истории чата (с разрешения пользователя). Это позволяет точно транскрибировать имена файлов, термины из открытых документов, специфические названия. Не просто «слышу слова» – а «понимаю, о чём идёт речь».
Google интегрировала распознавание речи Gemini 3.5 Transcribe сразу в несколько продуктов.
Разработчики, строящие голосовые интерфейсы на базе Gemini Live API, уже получили поддержку от платформ Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Компании Vivo, Intellitek Health и Lingopal публично отметили качество задержки, точность и охват языков.
Честный ответ: порог входа для голосовых приложений только что заметно снизился. Раньше построить нормальный voice agent требовало либо дорогого стороннего провайдера транскрипции, либо мирились с ошибками. Теперь в Gemini API через Google AI Studio есть модель с WER 2,6%, поддержкой 85+ языков и атрибуцией спикеров – в публичном превью.
Для enterprise-сегмента доступен Gemini Enterprise Agent Platform, а поддержка Gemini Enterprise for Customer Experience анонсирована как «скоро». Колл-центры, медицинская документация, юридические транскрипты – сценарии, где точность критична, теперь получают foundation model уровня, который раньше требовал отдельных специализированных решений.
Если вы строите специализированные ИИ-порталы с голосовым интерфейсом, или планируете автоматический блог на базе нейросетей с возможностью голосового ввода контента – Gemini 3.5 Transcribe открывает технические возможности, которых месяц назад просто не было в таком качестве.
Распознавание речи Gemini 3.5 Transcribe – не инкрементальное улучшение. Сокращение времени транскрипции на 70% относительно Chirp 3, WER ниже 3% для предзаписанного аудио, умная обработка дисфлюэнций, кастомный словарь и 85+ языков в одной модели – это benchmark-сдвиг для индустрии.
Скептики скажут: посмотрим, как это работает в реальных условиях, а не в пресс-релизе. Справедливо. Но независимые замеры Artificial Analysis и публичные отзывы корпоративных клиентов дают основания относиться к цифрам серьёзно. Следующие несколько месяцев покажут, насколько быстро разработчики начнут строить на этой базе.
