Google 发布 Gemini 3.5 Transcribe,支持转录超过 85 种语言
新模型可将语音转换为文字、区分说话者,并将停顿或不连贯的表达整理得更易读
📅 2026年8月28日 00:54
Google 于 2026 年 8 月 26 日正式发布 Gemini 3.5 Transcribe。这是一款支持超过 85 种语言的 Speech-to-text(语音转文字)模型,适用于实时语音及录音文件转录。
该模型的亮点包括 Speaker Diarization(识别不同说话者对应的内容)和 Smart Transcription(自动整理转录文本,使其更易阅读)。除了逐字转录,它还能处理口吃、语气词和迂回表达,并将内容整理成更清晰易懂的文字。
Gemini 3.5 Transcribe 也是 Android 功能 Rambler 背后的模型。Google 在 Google I/O 2026 上发布该功能,并率先搭载于 Pixel 11。因此,它不仅用于逐字转录,也能将自然口语转换成便于阅读或继续使用的文本。
开发者可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 调用该模型。Live API 支持实时流式转录,Interactions API 则用于处理录音文件。
Why it matters
支持超过 85 种语言,使该模型有望更广泛地用于会议、采访和字幕制作。不过,其在真实场景中的泰语转录质量仍需进一步测试。
支持超过 85 种语言,使该模型有望更广泛地用于会议、采访和字幕制作。不过,其在真实场景中的泰语转录质量仍需进一步测试。
Sources (rewritten & summarized from): Blognone · blog.google · google.dev · datanorth.ai · google.dev · mlq.ai