Google presenta Gemini 3.5 Transcribe, que transcribe más de 85 idiomas
El nuevo modelo convierte voz en texto, distingue a los hablantes y reformula el habla entrecortada para facilitar su lectura
Google presentó oficialmente Gemini 3.5 Transcribe el 26 de agosto de 2026. Es un modelo de Speech-to-text (tecnología que convierte voz en texto) compatible con más de 85 idiomas y diseñado para transcribir tanto en directo como desde archivos de audio grabados.
Entre sus principales funciones están Speaker Diarization (identificar qué fragmentos corresponden a cada hablante) y Smart Transcription (dar automáticamente un formato legible a la transcripción). Además de reproducir lo dicho, el modelo puede procesar interrupciones, muletillas y frases confusas para convertirlas en texto más claro.
Gemini 3.5 Transcribe es el mismo modelo que impulsa Rambler en Android, una función presentada por Google en Google I/O 2026 y estrenada en Pixel 11. Por ello, no se limita a transcribir palabra por palabra, sino que transforma el lenguaje oral natural en texto listo para leer o reutilizar.
Los desarrolladores pueden acceder al modelo mediante Gemini API en Google AI Studio y Gemini Enterprise Agent Platform. Live API admite transcripción en streaming en tiempo real, mientras que Interactions API procesa archivos de audio grabados.
La compatibilidad con más de 85 idiomas podría ampliar su uso en reuniones, entrevistas y subtítulos. Sin embargo, la calidad de la transcripción en tailandés aún deberá comprobarse con más pruebas en situaciones reales.