ทันเอไอ

ข่าว AI & ไอที ระดับโลก แปลเป็นไทย อ่านสบายตา · ตรวจสอบแหล่งทุกข่าว

← กลับหน้าข่าว
LINE Facebook X
โมเดล & วิจัย AIยืนยันแล้ว

SciLitBench ทดสอบ LLM ทำงานทบทวนวรรณกรรมหลายขั้นตอน

ชุดทดสอบใหม่พบว่าเกณฑ์คัดเลือกและเหตุผลประกอบจากนักวิจัยช่วยให้ LLM คัดกรองงานวิชาการได้ดีขึ้น แต่การสกัดข้อมูลยังมีความน่าเชื่อถือไม่เท่ากัน

📅 10 ก.ย. 2569 04:10 น.
SciLitBench ทดสอบ LLM ทำงานทบทวนวรรณกรรมหลายขั้นตอน

Miguel Zabaleta และ Baihan Lin เปิดตัว SciLitBench ชุดข้อมูลมาตรฐานสำหรับประเมิน Large Language Model หรือ LLM (โมเดลภาษาขนาดใหญ่) ในงานทบทวนวรรณกรรมอย่างเป็นระบบ โดยครอบคลุมกระบวนการต่อเนื่องหลายขั้น แทนการทดสอบแต่ละขั้นแยกจากกันเหมือนงานประเมินจำนวนมากที่ผ่านมา

ชุดทดสอบประกอบด้วยบันทึกที่ค้นคืนมา 42,981 รายการ เอกสารฉบับเต็ม 1,012 ฉบับ และคำกำกับข้อมูลสำหรับงานวิจัยที่ผ่านการคัดเลือก 888 ฉบับ งานที่นำมาทดสอบมีตั้งแต่การคัดกรองชื่อเรื่องและบทคัดย่อ การอ่านเอกสารฉบับเต็มเพื่อตัดสินว่าจะรวมไว้ในการทบทวนหรือไม่ ไปจนถึงการสกัดข้อมูลตามโครงสร้างที่กำหนด

นักวิจัยทดลองกับโมเดลแบบ Open-weight (เปิดให้นำค่าน้ำหนักโมเดลไปใช้งานได้) 22 รุ่น จากหกตระกูล ผลพบว่า การระบุ Inclusion และ Exclusion criteria (เกณฑ์รับเข้าและคัดออก) อย่างชัดเจนช่วยเพิ่มคะแนน F2 ของการคัดกรองชื่อเรื่องและบทคัดย่อ 28.8% โดย F2 เป็นตัวชี้วัดที่ให้น้ำหนักกับการค้นหาเอกสารที่เกี่ยวข้องให้ครบมากกว่าความแม่นตรงเพียงอย่างเดียว

สำหรับการคัดกรองเอกสารฉบับเต็ม การเพิ่มเหตุผลประกอบที่นักวิจัยเขียนไว้ช่วยยกระดับประสิทธิภาพ 15% สะท้อนว่า LLM ทำงานได้ดีขึ้นเมื่อได้รับบริบทเกี่ยวกับหลักคิดในการตัดสินใจ ไม่ใช่เพียงเอกสารกับคำสั่งทั่วไป

อย่างไรก็ตาม ขั้นสกัดข้อมูลมีรูปแบบความน่าเชื่อถือต่างออกไป งานรายงานความแม่นยำ 0.97 สำหรับข้อมูลการตีพิมพ์ แต่ผลที่เปิดเผยชี้ว่าประสิทธิภาพไม่ได้สม่ำเสมอในข้อมูลทุกประเภท จึงยังไม่ควรมองว่าโมเดลสามารถแทนนักวิจัยได้ตลอดกระบวนการ

SciLitBench เผยแพร่เป็นงานวิจัยฉบับก่อนการประเมินโดยผู้ทรงคุณวุฒิบน arXiv หมวดปัญญาประดิษฐ์ เมื่อวันที่ 29 สิงหาคม 2026 ผลลัพธ์จึงควรได้รับการตรวจสอบซ้ำและพิจารณาร่วมกับรายละเอียดการทดลองก่อนนำไปใช้จริง

ทำไมถึงสำคัญ
ชุดทดสอบนี้ช่วยให้มหาวิทยาลัยและนักวิจัยไทยประเมินได้ชัดขึ้นว่า LLM เหมาะกับขั้นตอนไหนของการสำรวจงานวิชาการ และจุดใดยังต้องมีมนุษย์ตรวจสอบ โดยเฉพาะงานที่อาจส่งผลต่อข้อสรุปเชิงนโยบายหรือการแพทย์
#SciLitBench#โมเดลภาษาขนาดใหญ่#งานวิจัย#การทบทวนวรรณกรรม
ที่มา (เรียบเรียง+สรุปจาก): arXiv cs.AI · arxiv.org · arxiv.org · arxiv.org · openreview.net

ความคิดเห็น

กำลังโหลดความคิดเห็น…

ไม่ต้องสมัครสมาชิก · ระบบกรองคำหยาบอัตโนมัติ และผู้ดูแลลบความคิดเห็นได้