นักวิจัยเผยแพร่ระเบียบวิธี GAP-DPO ยกระดับการปรับแต่งปัญญาประดิษฐ์เฉพาะบุคคล
งานวิจัยใหม่บน arXiv เสนอแนวทาง GAP-DPO ช่วยแก้ปัญหาการเลือกคู่ข้อมูล เพื่อปรับแต่งภาษาโมเดลให้ตรงใจผู้ใช้แต่ละคนยิ่งขึ้น
คณะนักวิจัยจาก Kent State University และสถาบันอื่นๆ ได้เผยแพร่บทความวิจัยชื่อ Gradient-Aligned Pair Selection for Personalized Preference Optimization บนแพลตฟอร์ม arXiv เมื่อวันที่ 4 กันยายน 2026 โดยมุ่งเน้นไปที่การพัฒนาการปรับแต่งโมเดลภาษาขนาดใหญ่ (LLM) ให้เข้ากับความชอบเฉพาะของผู้ใช้แต่ละราย
ในปัจจุบัน การปรับแต่งความพึงพอใจโดยตรงหรือ Direct Preference Optimization (DPO) มักประสบปัญหาที่เรียกว่า Personalization Divergence เนื่องจากการเลือกคู่ข้อมูลสำหรับการฝึกมักใช้เกณฑ์ฮิวริสติก (Heuristics) หรือเกณฑ์ความน่าจะเป็นแบบดั้งเดิม ซึ่งอาจไม่สอดคล้องกับประโยชน์ที่ผู้ใช้ต้องการจริงๆ ส่งผลให้ประสิทธิภาพการปรับแต่งเฉพาะบุคคลลดลง
เพื่อแก้ปัญหานี้ งานวิจัยดังกล่าวจึงได้เสนอวิธี GAP-DPO (Gradient-Aligned Pair Selection) ซึ่งเป็นการแปลงกระบวนการเลือกคู่ข้อมูลให้เป็นการแก้ปัญหาเชิงเรขาคณิต โดยวิเคราะห์ปฏิสัมพันธ์อันดับแรกระหว่างเกรเดียนต์ (Gradient) ของประโยชน์ที่คาดหวังของผู้ใช้กับทิศทางการอัปเดตของ DPO ผลการทดสอบระบุว่าวิธีนี้ช่วยปรับปรุงทั้งคุณภาพการสร้างข้อความส่วนบุคคล ความแม่นยำด้านสไตล์ และความสอดคล้องกับความต้องการของผู้ใช้ได้ดีกว่าการใช้ DPO มาตรฐาน
งานวิจัยนี้เป็นประโยชน์ต่อผู้พัฒนาปัญญาประดิษฐ์ในไทยที่ต้องการสร้างแชทบอตหรือผู้ช่วยอัจฉริยะที่เข้าใจและปรับตัวเข้ากับความต้องการเฉพาะตัวของผู้ใช้แต่ละคนได้แม่นยำยิ่งขึ้น