Google lance Gemini 3.5 Transcribe, capable de transcrire plus de 85 langues
Le nouveau modèle convertit la parole en texte, distingue les intervenants et reformule les hésitations pour faciliter la lecture.
Google a officiellement lancé Gemini 3.5 Transcribe le 26 août 2026. Ce modèle de Speech-to-text (technologie de conversion de la parole en texte) prend en charge plus de 85 langues et permet de transcrire aussi bien en direct que depuis des fichiers audio enregistrés.
Ses principales fonctions sont Speaker Diarization (identification de l’intervenant correspondant à chaque passage) et Smart Transcription (mise en forme automatique des transcriptions pour en faciliter la lecture). Au-delà de la transcription littérale, le modèle gère les hésitations, les mots parasites et les phrases décousues, puis les reformule en un texte plus clair.
Gemini 3.5 Transcribe est le modèle qui alimente Rambler sur Android, une fonctionnalité présentée par Google lors de Google I/O 2026 et intégrée pour la première fois au Pixel 11. Il ne vise donc pas seulement la transcription mot à mot, mais transforme aussi le langage parlé naturel en texte prêt à être lu ou réutilisé.
Les développeurs peuvent accéder au modèle via Gemini API dans Google AI Studio et Gemini Enterprise Agent Platform. Live API permet la transcription en streaming en temps réel, tandis qu’Interactions API traite les fichiers audio enregistrés.
La prise en charge de plus de 85 langues pourrait élargir son usage aux réunions, aux entretiens et au sous-titrage. La qualité de la transcription en thaï dans des conditions réelles devra toutefois être évaluée plus en détail.