นักวิจัยเปิดตัว SkillScriptBench ชุดทดสอบประเมินความสามารถ AI ในการพัฒนาและซ่อมแซมแพ็กเกจทักษะอัตโนมัติ
ทีมนักวิจัยเผยแพร่ชุดทดสอบใหม่ SkillScriptBench สำหรับวัดประสิทธิภาพโมเดลภาษาในการปรับปรุงและซ่อมแซมแพ็กเกจทักษะสำหรับเอเจนต์โดยไม่กระทบระบบเดิม
วงการปัญญาประดิษฐ์ก้าวไปอีกขั้นเมื่อทีมนักวิจัยนำโดย ยวี้เซวียน หลิว (Yuxuan Liu) และคณะจากมหาวิทยาลัยวิทยาศาสตร์และเทคโนโลยีฮ่องกง (The Hong Kong University of Science and Technology) รวมถึงสถาบันอื่นๆ ได้เปิดตัว "SkillScriptBench" ชุดทดสอบ (Benchmark) รูปแบบใหม่สำหรับประเมินความสามารถในการวิวัฒนาการตนเอง (Self-Evolution) ของแพ็กเกจทักษะเอเจนต์ที่ทำงานได้จริง (Executable Agent Skill Packages)
ในปัจจุบัน เอเจนต์ปัญญาประดิษฐ์ (LLM Agents) นิยมใช้แพ็กเกจทักษะที่รวมเอาคำแนะนำภาษาธรรมชาติเข้ากับสคริปต์เพื่อให้ทำงานซ้ำๆ ได้ แต่การปรับปรุงหรือแก้ไขแพ็กเกจเหล่านี้มักเป็นเรื่องท้าทาย เนื่องจาก AI ต้องแก้ไขข้อผิดพลาดโดยไม่ไปทำลายพฤติกรรมเดิมที่ถูกต้อง ชุดทดสอบที่มีอยู่เดิมยังไม่สามารถแยกแยะการซ่อมแซมเอกสาร การซ่อมแซมสคริปต์ และการรักษาฟังก์ชันการทำงานเดิมออกจากกันได้อย่างเป็นระบบ
เพื่อแก้ปัญหานี้ ทีมวิจัยจึงได้สำรวจแพ็กเกจทักษะจากโครงการบนกิทฮับ (GitHub) มากกว่า 35,000 รายการ คัดเลือกออกมา 100 แพ็กเกจ และสร้างเป็น "SkillScriptBench" ซึ่งประกอบด้วยงานทดสอบ (Tasks) รวมทั้งหมด 350 งาน โดยแบ่งออกเป็น 2 กลุ่มหลัก ได้แก่ กลุ่มงานซ่อมแซมจากสถานการณ์จริง 150 งาน และกลุ่มงานควบคุมสภาพแวดล้อมเพื่อทดสอบการรักษาพฤติกรรมเดิม 200 งาน
งานวิจัยนี้ถูกเผยแพร่ผ่านระบบอาร์ไคฟ์ (arXiv:2610.04008) เมื่อวันที่ 2 ตุลาคม 2026 เพื่อเป็นเครื่องมือมาตรฐานให้ให้นักพัฒนาสามารถใช้วัดประสิทธิภาพและความน่าเชื่อถือของโมเดลปัญญาประดิษฐ์ในการดูแลรักษาชุดคำสั่งและโค้ดโปรแกรมได้ดียิ่งขึ้น
ช่วยให้วงการพัฒนาเอเจนต์ปัญญาประดิษฐ์มีมาตรฐานกลางในการวัดความสามารถของ AI ในการอัปเดตและดูแลรักษาโค้ดหรือชุดคำสั่งด้วยตนเองอย่างปลอดภัย ซึ่งมีความสำคัญอย่างมากต่อการสร้างระบบอัตโนมัติที่มีเสถียรภาพสูงในอนาคต