เผยงานวิจัยประเมินโมเดลภาษาและมัลติโมดัลด้านชีววิศวกรรม
นักวิจัยทั่วโลกตื่นตัวพัฒนาเกณฑ์มาตรฐานประเมินความสามารถโมเดลปัญญาประดิษฐ์ในงานด้านชีววิศวกรรมและชีวการแพทย์
ในวงการปัญญาประดิษฐ์ (AI) ปัจจุบัน โมเดลภาษาขนาดใหญ่ (Large Language Models หรือ LLM) และโมเดลแบบมัลติโมดัล (Multimodal Models) ได้พัฒนาขีดความสามารถด้านการให้เหตุผลทั่วไปอย่างก้าวกระโดด รวมถึงเริ่มมีความสำเร็จในวิทยาศาสตร์ชีวการแพทย์
อย่างไรก็ตาม เกณฑ์มาตรฐาน (Benchmark) ที่มีอยู่เดิมส่วนใหญ่ยังคงเน้นไปที่การเรียกคืนข้อเท็จจริง (Factual Recall) ซึ่งให้ข้อมูลเชิงลึกที่จำกัดเกี่ยวกับประสิทธิภาพของโมเดลในงานระดับแนวหน้าและงานมัลติโมดัล ส่งผลให้มีความพยายามจากกลุ่มนักวิจัยทั่วโลกในการพัฒนาชุดทดสอบเฉพาะทาง
ในช่วงปี 2025 ถึง 2026 มีความพยายามสร้างเกณฑ์มาตรฐานในกลุ่มชีววิทยาและชีววิศวกรรม เช่น งานวิจัยทดสอบเอเจนต์ AI ด้านชีวการแพทย์ และเกณฑ์มาตรฐานสำหรับโปรโตคอลทางชีวภาพ เพื่อประเมินความสามารถในการให้เหตุผลเชิงทดลองและการทำงานจริงให้แม่นยำยิ่งขึ้น
แม้จะมีรายงานความเคลื่อนไหวเกี่ยวกับโครงการประเมินในชื่อ BioEVAL แต่ในฐานข้อมูลวิชาการ arXiv ยังคงต้องรอการยืนยันและตรวจสอบเอกสารอย่างเป็นทางการ โดยมีงานวิจัยใกล้เคียงที่ตีพิมพ์ออกมาในช่วงต้นปี 2026 เป็นบรรทัดฐานในการศึกษา
การพัฒนาเกณฑ์มาตรฐานเฉพาะทางช่วยให้วงการวิจัยและอุตสาหกรรมสามารถคัดเลือกและใช้งานโมเดล AI ที่มีความเข้าใจเชิงลึกด้านชีววิศวกรรมได้อย่างปลอดภัยและแม่นยำยิ่งขึ้น