Распознавание речи Gemini 3.5 Transcribe: что умеет новая модель Google

Фабио Де ЛукаИИ и автоматизация5 часов назад6 Просмотры

Когда Google объявляет о новой speech-to-text модели, реакция рынка обычно сдержанная: ну ещё одна, подумаешь. Gemini 3.5 Transcribe – другой случай. Здесь речь идёт не просто об улучшенном распознавании слов, а о модели, которая понимает намерение говорящего, убирает мусор из речи и форматирует результат без участия человека. Разница ощутимая.

Что такое Gemini 3.5 Transcribe и зачем он нужен

Традиционные системы распознавания речи работают линейно: слышат слово, пишут слово. Если вы сказали «эм, встретимся во вторник, нет, в среду» – именно это и появится в тексте. Gemini 3.5 Transcribe обрабатывает такие случаи иначе: самоисправления исчезают, слова-паразиты отфильтровываются, итоговый текст выглядит как написанный, а не надиктованный.

Цифры говорят сами за себя. По данным Artificial Analysis, средний Word Error Rate (WER) составляет 4,0% для потокового режима и 2,6% для предзаписанного аудио. На бенчмарке FLEURS по топовым языкам и локалям модель достигает 5,50% WER в потоковом режиме и 5,04% в непотоковом. По сравнению с предыдущей моделью Chirp 3 время до финальной транскрипции сократилось на 70%.

Модель поддерживает более 85 языков с автоматическим определением – без ручного выбора. Региональные акценты и диалекты тоже учитываются. Для многоязычных команд или международных колл-центров это практически меняет расчёт стоимости транскрипции.

Два режима работы: реальное время и постобработка

Разработчикам доступны два отдельных API, и выбор между ними зависит от задачи.

Live API – потоковая транскрипция

Модель gemini-3.5-transcribe-live работает через Live API с двусторонней потоковой передачей и задержкой менее секунды. Это режим для голосовых агентов, систем субтитрирования в реальном времени, интерактивных интерфейсов. Представьте систему, которая слышит вопрос клиента и немедленно передаёт чистый текст в CRM – без паузы, без постобработки.

Именно такой сценарий лежит в основе создания умных ИИ-агентов: голосовой ввод становится полноценным интерфейсом, а не костылём к клавиатуре.

Interactions API – работа с записями

Модель gemini-3.5-transcribe через Interactions API обрабатывает готовые аудиофайлы: записи встреч, логи звонков, подкасты. Ключевые возможности – разделение речи по спикерам (до трёх, поддержка большего числа в экспериментальном режиме) и временны́е метки на уровне слов. Это делает постобработку звонков и совещаний по-настоящему автоматической.

Кстати, именно такая схема лежит в основе кейса с голосовым ИИ-агентом для отчётов: записал голосовое – получил структурированный документ. С точностью WER 2,6% это уже не эксперимент, а рабочий инструмент.

Умные функции: за пределами простой транскрипции

Распознавание речи Gemini 3.5 Transcribe – это не только перевод звука в буквы. Несколько функций заслуживают отдельного внимания.

Function calling

Модель умеет делегировать сложные задачи другим моделям Gemini через function calls. Пользователь говорит голосом – модель понимает намерение и передаёт задачу нужному инструменту. Пока это доступно в приложении Gemini на macOS, но направление очевидно: голос становится универсальным интерфейсом управления.

Кастомный словарь

Специализированная лексика – давняя боль корпоративных систем транскрипции. Медицинские термины, названия продуктов, внутренние коды – всё это традиционно вызывало ошибки. Gemini 3.5 Transcribe адаптирует транскрипцию под предоставленный словарь. Почтовые индексы, артикулы заказов, нестандартные написания – модель с ними справляется.

Контекстная точность

На платформе Google Antigravity модель получает доступ к контексту экрана и истории чата (с разрешения пользователя). Это позволяет точно транскрибировать имена файлов, термины из открытых документов, специфические названия. Не просто «слышу слова» – а «понимаю, о чём идёт речь».

Где уже работает: от Gboard до Chrome

Google интегрировала распознавание речи Gemini 3.5 Transcribe сразу в несколько продуктов.

  • Gboard на Android – функция Rambler превращает надиктованный текст в отформатированный, убирает слова-паразиты, позволяет голосом редактировать написанное и менять стиль текста.
  • Приложение Gemini на macOS – голосовые команды плюс контекст экрана: можно суммировать локальные файлы, генерировать изображения, перерабатывать текст между приложениями – только голосом.
  • Google AI Studio – в режиме Build можно vibe code приложения голосом на лету. Для разработчиков, которые хотят прототипировать быстро, это серьёзное ускорение.
  • Chrome – скоро: диктовка в любое веб-поле. Ответы на письма, публикации, промпты Gemini – всё голосом.

Разработчики, строящие голосовые интерфейсы на базе Gemini Live API, уже получили поддержку от платформ Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Компании Vivo, Intellitek Health и Lingopal публично отметили качество задержки, точность и охват языков.

Что это означает для разработчиков и бизнеса

Честный ответ: порог входа для голосовых приложений только что заметно снизился. Раньше построить нормальный voice agent требовало либо дорогого стороннего провайдера транскрипции, либо мирились с ошибками. Теперь в Gemini API через Google AI Studio есть модель с WER 2,6%, поддержкой 85+ языков и атрибуцией спикеров – в публичном превью.

Для enterprise-сегмента доступен Gemini Enterprise Agent Platform, а поддержка Gemini Enterprise for Customer Experience анонсирована как «скоро». Колл-центры, медицинская документация, юридические транскрипты – сценарии, где точность критична, теперь получают foundation model уровня, который раньше требовал отдельных специализированных решений.

Если вы строите специализированные ИИ-порталы с голосовым интерфейсом, или планируете автоматический блог на базе нейросетей с возможностью голосового ввода контента – Gemini 3.5 Transcribe открывает технические возможности, которых месяц назад просто не было в таком качестве.

Итог: это меняет планку

Распознавание речи Gemini 3.5 Transcribe – не инкрементальное улучшение. Сокращение времени транскрипции на 70% относительно Chirp 3, WER ниже 3% для предзаписанного аудио, умная обработка дисфлюэнций, кастомный словарь и 85+ языков в одной модели – это benchmark-сдвиг для индустрии.

Скептики скажут: посмотрим, как это работает в реальных условиях, а не в пресс-релизе. Справедливо. Но независимые замеры Artificial Analysis и публичные отзывы корпоративных клиентов дают основания относиться к цифрам серьёзно. Следующие несколько месяцев покажут, насколько быстро разработчики начнут строить на этой базе.

type=cta | about=разработка голосовых ИИ-агентов и автоматизаций на базе Gemini 3.5 Transcribe для бизнеса | hook=Хотите голосового ИИ-агента для вашего бизнеса?

Предыдущая статья
Следующая статья
Соц. сети
  • Pinterest1360
  • Youtube1285
  • WhatsApp
  • Telegram1608
  • VKontakte102
  • TikTok1059
Loading Next Post...
Боковая панель Поиск
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...