ทันเอไอ

ข่าว AI & ไอที ระดับโลก แปลเป็นไทย อ่านสบายตา · ตรวจสอบแหล่งทุกข่าว

🌐ติดตาม
← กลับหน้าข่าว
LINE Facebook X
โมเดล & วิจัย AIยืนยันแล้ว

กูเกิลเปิดตัว Gemini 3.5 Transcribe ถอดเสียงกว่า 85 ภาษา

โมเดลใหม่แปลงเสียงพูดเป็นข้อความ แยกผู้พูดและเรียบเรียงคำพูดที่ติดขัดให้อ่านเข้าใจง่ายขึ้น

📅 28 ส.ค. 2569 00:54 น.
กูเกิลเปิดตัว Gemini 3.5 Transcribe ถอดเสียงกว่า 85 ภาษา

กูเกิลเปิดตัว Gemini 3.5 Transcribe อย่างเป็นทางการเมื่อวันที่ 26 สิงหาคม 2026 โดยเป็นโมเดล Speech-to-text (เทคโนโลยีแปลงเสียงพูดเป็นข้อความ) ที่รองรับมากกว่า 85 ภาษา และออกแบบมาสำหรับการถอดความทั้งแบบสดและจากไฟล์เสียงที่บันทึกไว้

จุดเด่นของโมเดลคือ Speaker Diarization (การแยกว่าข้อความช่วงใดมาจากผู้พูดคนไหน) และ Smart Transcription (การจัดรูปแบบบทถอดเสียงให้อ่านง่ายโดยอัตโนมัติ) นอกจากถอดคำพูดตามเสียงแล้ว โมเดลยังรับมือกับการพูดติดขัด คำอ้ำอึ้ง และประโยคที่วกวน ก่อนเรียบเรียงให้เป็นข้อความที่เข้าใจง่ายขึ้น

Gemini 3.5 Transcribe เป็นโมเดลเดียวกับที่อยู่เบื้องหลังฟีเจอร์ Rambler บน Android ซึ่งกูเกิลเปิดตัวในงาน Google I/O 2026 และนำมาใช้กับ Pixel 11 เป็นรุ่นแรก ความสามารถดังกล่าวจึงไม่ได้มุ่งเพียงการทำบทถอดเสียงแบบคำต่อคำ แต่ยังช่วยเปลี่ยนภาษาพูดตามธรรมชาติให้เป็นข้อความที่พร้อมอ่านหรือใช้งานต่อ

นักพัฒนาสามารถเรียกใช้โมเดลผ่าน Gemini API ใน Google AI Studio และ Gemini Enterprise Agent Platform โดย Live API รองรับการถอดเสียงแบบสตรีมตามเวลาจริง ส่วน Interactions API ใช้ประมวลผลไฟล์เสียงที่บันทึกไว้

ทำไมถึงสำคัญ
การรองรับมากกว่า 85 ภาษาทำให้โมเดลนี้อาจช่วยงานประชุม สัมภาษณ์ และทำคำบรรยายได้กว้างขึ้น อย่างไรก็ตาม คุณภาพการถอดเสียงภาษาไทยในสถานการณ์จริงยังต้องดูจากการทดสอบเพิ่มเติม
#กูเกิล#Gemini 3.5#ถอดเสียง#ปัญญาประดิษฐ์
ที่มา (เรียบเรียง+สรุปจาก): Blognone · blog.google · google.dev · datanorth.ai · google.dev · mlq.ai

ความคิดเห็น

กำลังโหลดความคิดเห็น…

ไม่ต้องสมัครสมาชิก · ระบบกรองคำหยาบอัตโนมัติ และผู้ดูแลลบความคิดเห็นได้