Google представила Gemini 3.5 Transcribe для расшифровки аудио более чем на 85 языках
Новая модель преобразует речь в текст, различает говорящих и делает сбивчивую речь более понятной
26 августа 2026 года Google официально представила Gemini 3.5 Transcribe — модель преобразования речи в текст, которая поддерживает более 85 языков и предназначена как для расшифровки в реальном времени, так и для обработки записанных аудиофайлов.
Ключевые возможности модели — Speaker Diarization, определяющая, кому из говорящих принадлежит каждый фрагмент, и Smart Transcription, автоматически оформляющая расшифровку для удобного чтения. Модель не только записывает услышанное, но и обрабатывает запинки, слова-паразиты и путаные фразы, преобразуя их в более понятный текст.
Gemini 3.5 Transcribe лежит в основе функции Rambler для Android, представленной Google на Google I/O 2026 и впервые появившейся в Pixel 11. Поэтому модель предназначена не только для дословной расшифровки, но и для преобразования естественной устной речи в текст, готовый к чтению или дальнейшему использованию.
Разработчики могут обращаться к модели через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Live API поддерживает потоковую расшифровку в реальном времени, а Interactions API предназначен для обработки записанных аудиофайлов.
Поддержка более 85 языков может расширить применение модели для встреч, интервью и создания субтитров. Однако качество расшифровки тайской речи в реальных условиях ещё предстоит проверить.