นักวิจัยเสนอ Praxa ระบบควบคุมเอเจนต์ AI เน้นความโปร่งใสและตรวจสอบได้
วงการวิจัย AI เสนอฮาร์เนสควบคุมเอเจนต์ Praxa แยกขั้นตอนการวางแผน สิทธิ์ และตรวจสอบผลลัพธ์ออกจากกันอย่างชัดเจน
ในแวดวงปัญญาประดิษฐ์ มีการเผยแพร่บทความวิจัยบน arXiv หมายเลข 2610.00015 โดย Stefan G. Creadore นำเสนอ Praxa ซึ่งเป็นเครื่องมือควบคุมหรือเอเจนต์ฮาร์เนส (Agent Harness) สำหรับจัดการการทำงานของโมเดลภาษาขนาดใหญ่ (LLM) โดยระบุสถานะต่างๆ อย่างชัดเจนผ่านกระบวนการรับเข้า การดำเนินการผ่านตัวกลาง การอ่านค่าผลลัพธ์จากภายนอก การตรวจสอบความสอดคล้อง และการเลื่อนขั้นการใช้งานที่ผ่านการทบทวนแล้ว
จากการรายงานในเอกสารวิจัยและข้อมูลจาก Praxa Labs มีการทดสอบในหลายด้าน โดยชุดแรกเป็นการตรวจสอบภายในระบบทดลองเฉพาะที่ผ่านการทดสอบหน่วย (Unit Tests) 1,027 ชุด และ Workerd 89 ชุด ครอบคลุมไฟล์ซอร์สโค้ดตามที่คาดหวัง แต่ยังไม่มีบันทึกข้อมูลดิบและการทำซ้ำผลการทดลองจากภายนอกอย่างอิสระ
ส่วนผลการทดลองประสิทธิภาพใน Terminal-Bench Core 0.1.1 จำนวน 12 งาน พบว่าทั้งระบบพื้นฐานและระบบใหม่ผ่านเท่ากันที่ 17 จาก 36 ครั้ง แต่ระบบใหม่ใช้โทเค็นขาเข้าเพิ่มขึ้น 37.49% และขาออกเพิ่มขึ้น 50.73% ขณะที่การทดสอบอีกชุดระบุว่าผ่าน 180 จาก 180 ครั้งเหมือนกัน โดยตัวเลือกใหม่ช่วยลดการใช้โทเค็นลง 37.11% และลดต้นทุนประมาณการลง 33.84% อย่างไรก็ตาม ผู้เขียนระบุชัดเจนว่ายังไม่สามารถพิสูจน์ได้ว่าคุณภาพ ความเร็ว หรือผลลัพธ์ในการใช้งานจริงดีขึ้นกว่าเดิม
ทางกองบรรณาธิการพบว่า ข้อมูลดังกล่าวยังเป็นงานวิจัยในขั้นต้น และแหล่งข่าวอื่นๆ เช่น AI First Hub เป็นเพียงการนำบทคัดย่อมาเผยแพร่ซ้ำโดยไม่มีการตรวจสอบอิสระ ผู้ใช้งานทั่วไปจึงควรพิจารณาบริบทด้านต้นทุนการใช้โทเค็นและข้อจำกัดในการทดสอบก่อนนำไปประยุกต์ใช้จริง
ช่วยให้ผู้พัฒนาซอฟต์แวร์เห็นแนวทางใหม่ในการควบคุมและตรวจสอบการทำงานของเอเจนต์ AI แต่ต้องระวังเรื่องต้นทุนโทเค็นที่อาจเพิ่มขึ้นในบางกรณี