กูเกิลเปิดตัว Gemini 3.8 Flash TTS โมเดลสร้างเสียงพูด รองรับกว่า 100 ภาษา
กูเกิลขยายตระกูลโมเดลเสียงด้วย Gemini 3.8 Flash TTS และ Flash-Lite TTS รองรับการสร้างเสียงคุณภาพสูงกว่า 100 ภาษา
กูเกิลเดินหน้าขยายไลน์ผลิตภัณฑ์โมเดลปัญญาประดิษฐ์เฉพาะทางอย่างต่อเนื่อง ล่าสุดได้เปิดตัวโมเดลแปลงข้อความเป็นเสียงพูด (Text-to-Speech หรือ TTS) สองรุ่นใหม่ ได้แก่ Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS เมื่อวันที่ 23 กันยายน 2026 โดยโมเดลทั้งสองรุ่นนี้เปิดให้ใช้งานจริงแล้ว (Generally Available) สำหรับนักพัฒนาผ่านทาง Gemini API และ Google AI Studio
การเปิดตัวครั้งนี้ต่อยอดมาจากโมเดลถอดเสียงเป็นข้อความ Gemini 3.5 Transcribe ที่เปิดตัวไปก่อนหน้านี้ สำหรับความสามารถของ Gemini 3.8 Flash TTS เน้นไปที่การสร้างเสียงคุณภาพสูงสำหรับงานโปรดักชัน เช่น การพากย์เสียงตัวละครในเกม การอ่านหนังสือเสียง และการผลิตพ็อดแคสต์ โดยมีความสามารถเด่นคือ Generative Voice Design ที่เปิดให้ผู้ใช้กำหนดบทบาท สำเนียง และลักษณะน้ำเสียงผ่านการป้อนคำสั่ง (Prompt)
นอกจากนี้ โมเดลยังรองรับการกำกับการอ่านแบบรายบรรทัด (Line-by-line direction) สามารถแทรกเสียงประกอบธรรมชาติ เช่น เสียงหัวเราะหรือเสียงถอนหายใจ รวมถึงรองรับการโคลนเสียง (Voice Replication) จากคลิปเสียงตัวอย่างความยาวเพียง 30 วินาที รองรับภาษากว่า 100 ภาษา และมีคลังเสียงสำหรับงานโปรดักชันมากกว่า 2,000 เสียง
ในด้านสถานะของโมเดล Gemini 3.8 Flash TTS ถือเป็นโมเดลรุ่นล่าสุดในกลุ่มสร้างเสียงพูดของกูเกิลในขณะนี้ ควบคู่ไปกับการเปิดตัวตระกูลโมเดลอื่นๆ เช่น Gemini 3.8 Live ในช่วงเวลาไล่เลี่ยกัน ขณะที่โมเดลรุ่นใหญ่สุดของค่ายนั้น มีรายงานว่ากำลังอยู่ในระหว่างการพัฒนาสำหรับตระกูล Gemini 4 ในอนาคต
ช่วยให้นักพัฒนาและผู้สร้างคอนเทนต์ชาวไทยเข้าถึงเครื่องมือสร้างเสียงพูด AI คุณภาพสูงที่รองรับภาษาไทย ปรับแต่งสำเนียงและอารมณ์ของเสียงได้สมจริงยิ่งขึ้นสำหรับงานโปรดักชันต่างๆ