Google stellt Gemini 3.5 Transcribe vor: Transkription in über 85 Sprachen
Neues Speech-to-Text-Modell erkennt Sprecher und glättet Versprecher für besser lesbare Texte.
Google hat am 26. August 2026 offiziell Gemini 3.5 Transcribe vorgestellt. Das Speech-to-Text-Modell unterstützt über 85 Sprachen und ist sowohl für Live-Transkriptionen als auch für vorab aufgezeichnete Audiodateien konzipiert.
Zu den Kernfunktionen gehören Speaker Diarization (Sprechertrennung) sowie Smart Transcription. Neben der reinen Audio-Transkription bereinigt das Modell Versprecher, Füllwörter sowie verschachtelte Sätze und formuliert daraus leicht verständliche Texte.
Gemini 3.5 Transcribe bildet auch die Basis für das Android-Feature „Rambler“, das auf der Google I/O 2026 vorgestellt und zuerst für das Pixel 11 veröffentlicht wurde. Der Fokus liegt nicht nur auf wortgetreuen Transkripten, sondern darauf, natürliche gesprochene Sprache in direkt lesbaren und weiterverwendbaren Text umzuwandeln.
Entwickler können über die Gemini API in Google AI Studio und auf der Gemini Enterprise Agent Platform auf das Modell zugreifen. Dabei unterstützt die Live API Echtzeit-Streaming, während die Interactions API für die Verarbeitung gespeicherter Audiodateien gedacht ist.
Mit der Unterstützung von über 85 Sprachen erweitert das Modell die Einsatzmöglichkeiten bei Meetings, Interviews und Untertiteln erheblich. Wie präzise die Erkennung bei komplexen Sprachmustern in der Praxis abschneidet, müssen weiterführende Tests zeigen.