SciLitBench ทดสอบ LLM ทำงานทบทวนวรรณกรรมหลายขั้นตอน
ชุดทดสอบใหม่พบว่าเกณฑ์คัดเลือกและเหตุผลประกอบจากนักวิจัยช่วยให้ LLM คัดกรองงานวิชาการได้ดีขึ้น แต่การสกัดข้อมูลยังมีความน่าเชื่อถือไม่เท่ากัน
Miguel Zabaleta และ Baihan Lin เปิดตัว SciLitBench ชุดข้อมูลมาตรฐานสำหรับประเมิน Large Language Model หรือ LLM (โมเดลภาษาขนาดใหญ่) ในงานทบทวนวรรณกรรมอย่างเป็นระบบ โดยครอบคลุมกระบวนการต่อเนื่องหลายขั้น แทนการทดสอบแต่ละขั้นแยกจากกันเหมือนงานประเมินจำนวนมากที่ผ่านมา
ชุดทดสอบประกอบด้วยบันทึกที่ค้นคืนมา 42,981 รายการ เอกสารฉบับเต็ม 1,012 ฉบับ และคำกำกับข้อมูลสำหรับงานวิจัยที่ผ่านการคัดเลือก 888 ฉบับ งานที่นำมาทดสอบมีตั้งแต่การคัดกรองชื่อเรื่องและบทคัดย่อ การอ่านเอกสารฉบับเต็มเพื่อตัดสินว่าจะรวมไว้ในการทบทวนหรือไม่ ไปจนถึงการสกัดข้อมูลตามโครงสร้างที่กำหนด
นักวิจัยทดลองกับโมเดลแบบ Open-weight (เปิดให้นำค่าน้ำหนักโมเดลไปใช้งานได้) 22 รุ่น จากหกตระกูล ผลพบว่า การระบุ Inclusion และ Exclusion criteria (เกณฑ์รับเข้าและคัดออก) อย่างชัดเจนช่วยเพิ่มคะแนน F2 ของการคัดกรองชื่อเรื่องและบทคัดย่อ 28.8% โดย F2 เป็นตัวชี้วัดที่ให้น้ำหนักกับการค้นหาเอกสารที่เกี่ยวข้องให้ครบมากกว่าความแม่นตรงเพียงอย่างเดียว
สำหรับการคัดกรองเอกสารฉบับเต็ม การเพิ่มเหตุผลประกอบที่นักวิจัยเขียนไว้ช่วยยกระดับประสิทธิภาพ 15% สะท้อนว่า LLM ทำงานได้ดีขึ้นเมื่อได้รับบริบทเกี่ยวกับหลักคิดในการตัดสินใจ ไม่ใช่เพียงเอกสารกับคำสั่งทั่วไป
อย่างไรก็ตาม ขั้นสกัดข้อมูลมีรูปแบบความน่าเชื่อถือต่างออกไป งานรายงานความแม่นยำ 0.97 สำหรับข้อมูลการตีพิมพ์ แต่ผลที่เปิดเผยชี้ว่าประสิทธิภาพไม่ได้สม่ำเสมอในข้อมูลทุกประเภท จึงยังไม่ควรมองว่าโมเดลสามารถแทนนักวิจัยได้ตลอดกระบวนการ
SciLitBench เผยแพร่เป็นงานวิจัยฉบับก่อนการประเมินโดยผู้ทรงคุณวุฒิบน arXiv หมวดปัญญาประดิษฐ์ เมื่อวันที่ 29 สิงหาคม 2026 ผลลัพธ์จึงควรได้รับการตรวจสอบซ้ำและพิจารณาร่วมกับรายละเอียดการทดลองก่อนนำไปใช้จริง
ชุดทดสอบนี้ช่วยให้มหาวิทยาลัยและนักวิจัยไทยประเมินได้ชัดขึ้นว่า LLM เหมาะกับขั้นตอนไหนของการสำรวจงานวิชาการ และจุดใดยังต้องมีมนุษย์ตรวจสอบ โดยเฉพาะงานที่อาจส่งผลต่อข้อสรุปเชิงนโยบายหรือการแพทย์