ทีมนักวิจัยเสนอวิธีตรวจจับความปลอดภัย AI จากสถานะแฝงภายในโมเดล ลดภาระประมวลผล
งานวิจัยใหม่เผยวิธีตรวจสอบเนื้อหาอันตรายใน Large Language Models จากสถานะแฝงภายในโดยตรง ช่วยลดการใช้ทรัพยากรและเพิ่มความเร็ว
ในยุคที่ระบบอัตโนมัติหันมาพึ่งพา Large Language Models (LLMs) มากขึ้น ระบบรักษาความปลอดภัยภายนอกแบบเดิมมักสร้างภาระด้านเวลาหน่วง (Latency) และทรัพยากรการคำนวณที่สูงเกินไป อีกทั้งยังมองไม่เห็นการทำงานภายในของตัวแบบ เกิดเป็นช่องว่างด้านความปลอดภัย ล่าสุด ทีมวิจัยซึ่งประกอบด้วย Alizishaan Khatri, Chiquita Prabhu และ Omkar Neogi ได้นำเสนองานวิจัยในหัวข้อ "Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models" ซึ่งได้รับการเผยแพร่ในการประชุมวิชาการ 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W) ประจำปี 2026
แนวทางใหม่นี้ตั้งคำถามว่าตัวโมเดลเองรู้อยู่แล้วหรือไม่ว่าเนื้อหาใดเป็นอันตราย นักวิจัยจึงได้ทำการสกัดค่า Activation จากสถานะแฝง (Latent states) ภายในตัวแบบ LLaMA-3.1-8B แล้วนำมาฝึกสอนตัวจำแนกประเภทขนาดเล็ก (MLP classifier probes) ที่มีพารามิเตอร์เพียง 12.6 ล้านพารามิเตอร์ เพื่อใช้ตรวจจับชุดคำสั่งหรือข้อความที่เป็นอันตราย (Harmful prompts)
จากการประเมินผลบนชุดข้อมูลทดสอบ WildJailbreak, Beavertails และ AEGIS 2.0 พบว่าตัวจำแนกประเภทขนาดเล็กนี้ทำคะแนน F1 score ได้สูงถึง 99%, 83% และ 84% ตามลำดับ ซึ่งถือว่ามีประสิทธิภาพแข่งขันได้กับระบบ Guardrail ภายนอกที่มีขนาดใหญ่กว่าถึง 1,000 เท่า แต่สามารถตัดลดปัญหาเรื่องความหน่วงและต้นทุนการคำนวณลงได้อย่างมาก งานวิจัยนี้ยังถูกนำไปต่อยอดและอ้างอิงในงานศึกษาด้านความปลอดภัยของ AI อื่นๆ เช่น การตรวจจับช่องโหว่ของโค้ดผ่านสถานะแฝงภายในด้วย
งานวิจัยนี้เป็นก้าวสำคัญในการพัฒนาความปลอดภัยของ AI ให้มีประสิทธิภาพสูงขึ้นโดยใช้ทรัพยากรน้อยลง ซึ่งอาจช่วยให้องค์กรต่างๆ สามารถนำโมเดลภาษาขนาดใหญ่ไปใช้งานจริงในสถานการณ์ที่จำกัดด้านเวลาและทรัพยากรได้สะดวกยิ่งขึ้น