เตือนสังคมคาดหวังกับระบบปฏิเสธคำสั่งของ AI มากเกินไป ชี้ระบบป้องกันยังเปราะบางและถูกเจาะได้ง่าย
บทวิเคราะห์จาก MIT Technology Review ชี้การหวังพึ่งระบบป้องกันของ AI ให้ปฏิเสธคำสั่งอันตรายมีความเสี่ยงสูงและไม่แน่นอน
ในยุคที่ปัญญาประดิษฐ์หรือ AI เข้ามามีบทบาทสำคัญ สังคมมักมีความคาดหวังว่า AI จะมีความสามารถในการปฏิเสธคำสั่งที่เป็นอันตรายได้เหมือนเช่นมนุษย์ ทว่าบทความวิเคราะห์จากสำนักข่าว MIT Technology Review เมื่อวันที่ 9 ตุลาคม 2026 กลับสะท้อนมุมมองที่ต่างออกไป โดยระบุว่าเรากำลังวางใจระบบปฏิเสธ (Model refusal) ของ AI มากจนเกินไป
เบื้องหลังความเปราะบางนี้มาจากธรรมชาติของกลไกป้องกันหรือการตั้งกฎ (Guardrails) ในตัวแบบ AI ซึ่งทำงานบนพื้นฐานของความน่าจะเป็น (Probabilistic) ทำให้ระบบเหล่านี้สามารถถูกโจมตีเพื่อหลบเลี่ยงการตรวจสอบ หรือที่เรียกรวมๆ ว่าการทำเจลเบรก (Jailbreak) ได้ง่าย และไม่ถือเป็นเครื่องมือด้านความปลอดภัยที่รับประกันผลได้ 100 เปอร์เซ็นต์ นอกจากนี้ งานวิจัยเชิงประจักษ์จากเอกสารวิชาการบน arXiv ยังตอกย้ำว่า เมื่อ AI ถูกพัฒนาให้มีการใช้งานเครื่องมือต่างๆ หรือทำงานในลักษณะแบบเอเจนต์ (Agentic) ความสามารถในการปฏิเสธคำสั่งอันตรายจะลดลงอย่างมีนัยสำคัญ โดยการทดสอบบางกรณีพบอัตราความล้มเหลวในการปฏิเสธพุ่งสูงถึง 68.7 เปอร์เซ็นต์
สอดคล้องกับบทวิเคราะห์อิสระจาก Hejes.my ที่ยืนยันตรงกันว่า การฝากความหวังไว้ที่ระบบปฏิเสธของ AI เป็นเรื่องที่มีความเสี่ยงสูง เนื่องจากคาดเดาได้ยากและถูกดัดแปลงแก้ไขได้ง่าย บทความจึงเสนอแนวทางแก้ไขว่า ควรเปลี่ยนผ่านจากการคาดหวังให้ AI ปฏิเสธด้วยตัวเอง ไปเป็นการควบคุมการกระทำ (Constrain actions) ผ่านระบบอื่นๆ แทน เช่น การจำกัดสิทธิ์การเข้าถึงด้วยรายการอนุญาต (Allowlist) การกำหนดให้มนุษย์ต้องเป็นผู้อนุมัติในคำสั่งที่ไม่สามารถย้อนกลับได้ หรือการใช้งานระบบแซนด์บ็อกซ์ (Sandbox) เพื่อจำกัดความเสียหายที่อาจเกิดขึ้น
เมื่อองค์กรและผู้ใช้งานทั่วไปเริ่มนำ AI มาใช้ทำงานจริง การเข้าใจข้อจำกัดว่าระบบป้องกันของ AI อาจไม่สามารถปฏิเสธคำสั่งอันตรายได้เสมอไป จะช่วยให้ผู้ใช้งานไม่ประมาท และต้องมีมาตรการความปลอดภัยชั้นอื่นรองรับเพื่อป้องกันความเสียหายร้ายแรง