ทีมนักวิจัยเสนอวิธี RBS-Attention เร่งประมวลผลพรอมป์ต์ยาวของโมเดลภาษาขนาดใหญ่ขึ้นสูงสุด 20.65 เท่าโดยไม่ต้องฝึกโมเดลใหม่
งานวิจัยใหม่นำเสนอเทคนิค RBS-Attention ช่วยแก้ปัญหาคอขวดช่วง prefill ของโมเดลภาษาขนาดใหญ่ในบริบทความยาวสูง พร้อมรักษาความแม่นยำไว้ใกล้เคียงเดิม
ในยุคที่โมเดลภาษาขนาดใหญ่ (Large Language Models) รองรับบริบทความยาวมากขึ้น ปัญหาคอขวดสำคัญมักเกิดขึ้นในช่วงการประมวลผลพรอมป์ต์ก่อนเริ่มสร้างคำตอบ หรือที่เรียกว่า prefill ซึ่งกระบวนการ self-attention (การใส่ใจตนเอง) แบบดั้งเดิมต้องประมวลผลข้อมูลทั้งหมดอย่างหนาแน่น ส่งผลให้ใช้เวลาและทรัพยากรสูง
เมื่อวันที่ 17 กันยายน 2026 ทีมนักวิจัยประกอบด้วย Chuxu Song, Jiuqi Wei และ Zhencan Peng ได้เผยแพร่งานวิจัยบน arXiv ในหมวด cs.AI นำเสนอวิธีใหม่ชื่อว่า RBS-Attention (Radius-Bounded Sparse Prefill) ซึ่งเป็นเทคนิคการเลือกบล็อกแบบเบาบาง (sparse prefill) ที่ไม่ต้องฝึกโมเดลใหม่ (training-free) เพื่อลดต้นทุนการคำนวณในช่วง prefill นี้
ปัญหาหลักที่วิธีนี้พยายามแก้ไขคือสิ่งที่เรียกว่า mean dilution ซึ่งเกิดขึ้นเมื่อการใช้จุดศูนย์กลางของบล็อก (centroid) คำนวณความเกี่ยวข้อง อาจทำให้โทเคนสำคัญที่ซ่อนอยู่ถูกบดบังด้วยโทเคนจำนวนมากที่ไม่เกี่ยวข้อง RBS-Attention จึงแก้ไขด้วยการแบ่งการทำงานเป็นสองส่วนเสริมกัน ได้แก่ centroid base branch สำหรับจับความเกี่ยวข้องเฉลี่ย และ rescue branch ที่ใช้รัศมีสูงสุดของบล็อกคีย์ พร้อมกระจายตามพรอมป์ต์ เลเยอร์ และหัว เพื่อดึงบล็อกเสี่ยงที่อาจถูกประเมินค่าต่ำเกินไปกลับมา ก่อนจะนำมาประมวลผลร่วมกัน
ด้านผลลัพธ์การทดลอง ผู้วิจัยรายงานว่าบนฮาร์ดแวร์ H100 เมื่อทดสอบกับโมเดล Qwen3-30B-A3B-Instruct-2507-FP8 ที่ความยาวบริบท 128K เทคนิคนี้ช่วยเร่งความเร็วเฉพาะส่วน prefill-attention ได้ถึง 20.65 เท่า, ทำความเร็วบน vLLM ได้ 11.92 เท่า และลดเวลาจนได้โทเคนแรก (Time-to-First-Token) ลงเหลือ 5.97 เท่า ส่วนด้านคุณภาพความแม่นยำ เมื่อทดสอบบนเกณฑ์มาตรฐาน Qwen3-32B ด้วยชุดทดสอบ RULER ได้คะแนน 88.65 เทียบกับ 89.52 ของ dense attention แบบเดิม ซึ่งลดลงไปเพียง 0.87 จุดคะแนน
อย่างไรก็ตาม ข้อมูลเหล่านี้มาจากรายงานในงานวิจัยและบทความสรุปจากแหล่งข่าวอย่าง AiFeed เท่านั้น ยังไม่มีการทดสอบซ้ำหรือยืนยันผลลัพธ์ที่เป็นอิสระจากสำนักข่าวหรือสถาบันอื่น จึงเป็นข้อมูลที่ต้องติดตามการตรวจสอบในวงกว้างต่อไป
เท่นิคนี้อาจช่วยลดต้นทุนและเวลาในการประมวลผลข้อมูลยาวๆ ของโมเดลภาษาขนาดใหญ่ ซึ่งมีความสำคัญต่อการพัฒนาแอปพลิเคชัน AI ที่ต้องรองรับเอกสารหรือข้อมูลป้อนเข้าจำนวนมากในอนาคต