เปิดตัว Real-SWE เกณฑ์วัดศักยภาพ AI ด้วยโค้ดธุรกิจจริง ป้องกันปัญหารู้ข้อสอบล่วงหน้า
Specific Labs เปิดตัว Real-SWE ชุดทดสอบความสามารถปัญญาประดิษฐ์ด้านวิศวกรรมซอฟต์แวร์ที่ใช้โค้ดลับระดับองค์กรเป็นโจทย์
วงการพัฒนาซอฟต์แวร์และปัญญาประดิษฐ์กำลังให้ความสนใจชุดประเมินผล (Benchmark) ตัวใหม่ที่มีชื่อว่า Real-SWE ซึ่งพัฒนาโดย Specific Labs บริษัทในเครือ Y Combinator โดยถูกออกแบบมาเพื่อทดสอบประสิทธิภาพของโมเดล AI ในการทำงานด้านวิศวกรรมซอฟต์แวร์โดยเฉพาะ
จุดเด่นสำคัญของ Real-SWE คือการแก้ปัญหาข้อจำกัดของชุดทดสอบเดิมอย่าง SWE-bench ที่มักใช้ซอร์สโค้ดแบบเปิดเผย (Open Source) บน GitHub ซึ่งมีความเสี่ยงที่โมเดล AI จะเคยผ่านตาข้อมูลชุดนั้นมาแล้วในช่วงฝึกฝน (Data Contamination) ทำให้ผลคะแนนอาจสะท้อนความจำมากกว่าความสามารถในการแก้ปัญหาจริง ทาง Real-SWE จึงเปลี่ยนมาใช้ซอร์สโค้ดที่เป็นความลับและเป็นกรรมสิทธิ์ขององค์กร (Private, Real-world, Enterprise Codebases) ที่ได้รับอนุญาตอย่างถูกต้องแทน
โจทย์ทดสอบในระบบนี้จำลองมาจากงานจริงที่วิศวกรซอฟต์แวร์ต้องเผชิญในองค์กร เช่น การแก้ไขระบบคิดเงิน (Billing) การจัดการระบบภาษี และการย้ายข้อมูลลูกค้า ซึ่งมีความซับซ้อนเฉพาะตัวและไม่สามารถหาคำตอบสำเร็จรูปได้ทั่วไป
จากการทดสอบเบื้องต้นพบว่า โมเดลที่ทำคะแนนได้สูงสุดในขณะนี้ ซึ่งเป็นการทำงานร่วมกันระหว่างระบบ Fable 5.1 และเครื่องมือ Claude Code มีอัตราการแก้ปัญหาสำเร็จ (Resolution Rate) อยู่ที่ 38.8% ซึ่งสะท้อนให้เห็นว่าแม้ AI จะพัฒนาไปมาก แต่โจทย์ทางธุรกิจที่ซับซ้อนในโลกจริงยังคงเป็นความท้าทายสำคัญ
ช่วยให้วงการพัฒนาซอฟต์แวร์และนักพัฒนาไทยมีมาตรฐานที่แม่นยำยิ่งขึ้นในการวัดผลความสามารถของ AI ว่าจะนำมาใช้งานจริงในระบบธุรกิจที่มีความซับซ้อนสูงได้มากน้อยแค่ไหน