กูเกิลเปิดตัว Gemini 3.5 Transcribe ถอดเสียงกว่า 85 ภาษา
โมเดลใหม่แปลงเสียงพูดเป็นข้อความ แยกผู้พูดและเรียบเรียงคำพูดที่ติดขัดให้อ่านเข้าใจง่ายขึ้น
กูเกิลเปิดตัว Gemini 3.5 Transcribe อย่างเป็นทางการเมื่อวันที่ 26 สิงหาคม 2026 โดยเป็นโมเดล Speech-to-text (เทคโนโลยีแปลงเสียงพูดเป็นข้อความ) ที่รองรับมากกว่า 85 ภาษา และออกแบบมาสำหรับการถอดความทั้งแบบสดและจากไฟล์เสียงที่บันทึกไว้
จุดเด่นของโมเดลคือ Speaker Diarization (การแยกว่าข้อความช่วงใดมาจากผู้พูดคนไหน) และ Smart Transcription (การจัดรูปแบบบทถอดเสียงให้อ่านง่ายโดยอัตโนมัติ) นอกจากถอดคำพูดตามเสียงแล้ว โมเดลยังรับมือกับการพูดติดขัด คำอ้ำอึ้ง และประโยคที่วกวน ก่อนเรียบเรียงให้เป็นข้อความที่เข้าใจง่ายขึ้น
Gemini 3.5 Transcribe เป็นโมเดลเดียวกับที่อยู่เบื้องหลังฟีเจอร์ Rambler บน Android ซึ่งกูเกิลเปิดตัวในงาน Google I/O 2026 และนำมาใช้กับ Pixel 11 เป็นรุ่นแรก ความสามารถดังกล่าวจึงไม่ได้มุ่งเพียงการทำบทถอดเสียงแบบคำต่อคำ แต่ยังช่วยเปลี่ยนภาษาพูดตามธรรมชาติให้เป็นข้อความที่พร้อมอ่านหรือใช้งานต่อ
นักพัฒนาสามารถเรียกใช้โมเดลผ่าน Gemini API ใน Google AI Studio และ Gemini Enterprise Agent Platform โดย Live API รองรับการถอดเสียงแบบสตรีมตามเวลาจริง ส่วน Interactions API ใช้ประมวลผลไฟล์เสียงที่บันทึกไว้
การรองรับมากกว่า 85 ภาษาทำให้โมเดลนี้อาจช่วยงานประชุม สัมภาษณ์ และทำคำบรรยายได้กว้างขึ้น อย่างไรก็ตาม คุณภาพการถอดเสียงภาษาไทยในสถานการณ์จริงยังต้องดูจากการทดสอบเพิ่มเติม