Google Luncurkan Gemini 3.5 Transcribe, Dukung Transkripsi Lebih dari 85 Bahasa
Model speech-to-text baru ini mampu membedakan pembicara dan merapikan ucapan yang terbata-bata agar lebih mudah dibaca.
Google resmi meluncurkan Gemini 3.5 Transcribe pada 26 Agustus 2026. Model speech-to-text ini mendukung lebih dari 85 bahasa dan dirancang untuk transkripsi langsung (real-time) maupun dari rekaman audio.
Keunggulan utama model ini mencakup Speaker Diarization (pemisahan suara antar-pembicara) dan Smart Transcription (pemformatan transkrip otomatis agar mudah dibaca). Selain mentranskripsikan ucapan secara akurat, model ini juga dapat menangani ucapan terbata-bata, jeda ragu, serta kalimat berbelit-belit sebelum menyusunnya menjadi teks yang lebih mudah dipahami.
Gemini 3.5 Transcribe merupakan model yang menggerakkan fitur Rambler di Android, yang diperkenalkan Google pada ajang Google I/O 2026 dan pertama kali disematkan pada Pixel 11. Kemampuan ini tidak hanya berfokus pada transkripsi kata demi kata, melainkan juga mengubah bahasa lisan natural menjadi teks yang siap dibaca atau digunakan.
Pengembang dapat mengakses model ini melalui Gemini API di Google AI Studio dan Gemini Enterprise Agent Platform. Live API mendukung transkripsi streaming secara real-time, sedangkan Interactions API digunakan untuk memproses berkas rekaman audio.
Dukungan lebih dari 85 bahasa berpotensi memperluas pemanfaatan model ini untuk kebutuhan rapat, wawancara, hingga pembuatan takarir. Kendati demikian, kualitas transkripsi bahasa Thai dalam skenario penggunaan nyata masih memerlukan pengujian lebih lanjut.