ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Модели и исследования ИИVerified

Google представила Gemini 3.5 Transcribe для расшифровки аудио более чем на 85 языках

Новая модель преобразует речь в текст, различает говорящих и делает сбивчивую речь более понятной

📅 28 авг. 2026 г., 00:54
Google представила Gemini 3.5 Transcribe для расшифровки аудио более чем на 85 языках

26 августа 2026 года Google официально представила Gemini 3.5 Transcribe — модель преобразования речи в текст, которая поддерживает более 85 языков и предназначена как для расшифровки в реальном времени, так и для обработки записанных аудиофайлов.

Ключевые возможности модели — Speaker Diarization, определяющая, кому из говорящих принадлежит каждый фрагмент, и Smart Transcription, автоматически оформляющая расшифровку для удобного чтения. Модель не только записывает услышанное, но и обрабатывает запинки, слова-паразиты и путаные фразы, преобразуя их в более понятный текст.

Gemini 3.5 Transcribe лежит в основе функции Rambler для Android, представленной Google на Google I/O 2026 и впервые появившейся в Pixel 11. Поэтому модель предназначена не только для дословной расшифровки, но и для преобразования естественной устной речи в текст, готовый к чтению или дальнейшему использованию.

Разработчики могут обращаться к модели через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Live API поддерживает потоковую расшифровку в реальном времени, а Interactions API предназначен для обработки записанных аудиофайлов.

Why it matters
Поддержка более 85 языков может расширить применение модели для встреч, интервью и создания субтитров. Однако качество расшифровки тайской речи в реальных условиях ещё предстоит проверить.
#กูเกิล#Gemini 3.5#ถอดเสียง#ปัญญาประดิษฐ์
Sources (rewritten & summarized from): Blognone · blog.google · google.dev · datanorth.ai · google.dev · mlq.ai

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated