Hugging Face เผยผลวิจัยชี้ AI ถอดเสียงอาจไม่ได้เก่งจริง แค่ท่องจำข้อสอบมาตรฐาน
รายงานล่าสุดจาก Hugging Face ชี้โมเดลจดจำเสียง (ASR) ทำคะแนนเบนช์มาร์กสูงลิ่วเพราะจำรูปแบบข้อสอบ ไม่ใช่ทักษะการฟังที่แท้จริง
วันที่ 21 สิงหาคม 2026 ทาง Hugging Face ได้เผยแพร่บทความชื่อ "Measuring benchmark optimization in speech recognition" ซึ่งตีแผ่ปัญหาการปรับแต่งประสิทธิภาพโมเดล (Benchmark Optimization) ในระบบจดจำเสียงหรือ ASR (Automatic Speech Recognition) ที่ปัจจุบันมักทำคะแนนในแบบทดสอบสาธารณะได้สูงจนดูราวกับเทียบเท่ามนุษย์ แต่กลับไม่สะท้อนการใช้งานจริง
จากการศึกษาและวิเคราะห์ร่วมกับ Artificial Analysis ซึ่งตรวจสอบโมเดลโอเพนซอร์ส (Open-source) ASR จำนวน 11 รุ่น พบพฤติกรรมน่าสนใจว่า โมเดลเหล่านี้มักถอดความตามชุดข้อมูลทดสอบ เช่น VoxPopuli แม้ว่าเสียงจริงในไฟล์จะไม่ตรงกับข้อความในชุดทดสอบนั้นก็ตาม
นอกจากนี้ งานวิจัยยังพบข้อผิดพลาดในข้อมูลอ้างอิง (Reference errors) ของชุดทดสอบ VoxPopuli สูงถึง 40% และสิ่งที่น่าตกใจคือ โมเดลที่ทำคะแนนได้ดีที่สุด กลับเป็นโมเดลที่ถอดความผิดพลาดตามชุดทดสอบดังกล่าวสูงถึง 18 ถึง 30 เปอร์เซ็นต์ของกรณีที่ทดสอบ
เพื่อแก้ปัญหานี้ ทีมผู้เขียนได้แนะนำให้นักพัฒนาหลีกเลี่ยงการพึ่งพาชุดทดสอบแบบสุ่ม (IID) เพียงอย่างเดียว แต่ควรหันมาแบ่งข้อมูลทดสอบตามช่วงเวลา (Temporal) หรือตามผู้พูด (Speaker) แทน เพื่อป้องกันไม่ให้โมเดลถูกจูนเข้ากับชุดทดสอบเฉพาะกิจ
สะท้อนปัญหาความน่าเชื่อถือของผลทดสอบ AI ที่นักพัฒนาและผู้ใช้งานชาวไทยควรระวัง เมื่อคะแนนสูงบนกระดาษอาจไม่ตรงกับการใช้งานจริงในภาษาไทย