เปิดตัว StoreBench สภาพแวดล้อมจำลอง AI ทดสอบการบริหารร้านค้าออนไลน์แบบเรียลไทม์
ทีมนักวิจัยเผยแพร่บทความแนะนำ StoreBench สภาพแวดล้อมจำลองสำหรับการฝึกฝนและประเมินเอเจนต์ AI ให้ทำหน้าที่บริหารจัดการร้านค้าออนไลน์เสมือนจริง
วงการปัญญาประดิษฐ์หรือ AI กำลังก้าวไปอีกขั้นกับการทดสอบความสามารถที่ซับซ้อนขึ้น โดยล่าสุดมีการเผยแพร่งานวิจัยบนระบบ arXiv (หมวด cs.AI) เกี่ยวกับ StoreBench ซึ่งเป็นสภาพแวดล้อมจำลอง (Environment) สำหรับการประเมินและฝึกฝนเอเจนต์ AI แบบอัตโนมัติ (Autonomous Operator Agents) ในบริบทของการทำธุรกิจอีคอมเมิร์ซที่มีความเคลื่อนไหวตลอดเวลา
จุดเด่นของ StoreBench คือการจำลองร้านขายเสื้อผ้าขนาดกลางบนระบบหลังบ้านที่เทียบเท่ากับการใช้งานจริง โดยออกแบบมาเพื่อทดสอบทักษะการวางแผนระยะยาวและการตัดสินใจทางเศรษฐกิจภายใต้ความไม่แน่นอน เอเจนต์ AI จะต้องรับมือกับสถานการณ์ต่างๆ เช่น คำสั่งซื้อจากลูกค้าที่เข้ามาตลอด 24 ชั่วโมง พฤติกรรมของซัพพลายเออร์ที่คาดเดาไม่ได้ รวมถึงการปรับราคาและการมาถึงของเหตุการณ์ตลาดที่เปลี่ยนแปลงอย่างกะทันหันโดยไม่มีสัญญาณเตือนล่วงหน้า
ในด้านการทำงาน เอเจนต์จะใช้เครื่องมือสำหรับผู้ขาย (Merchant tools) จำนวน 29 รายการ ซึ่งเป็นเครื่องมือเดียวกับที่มนุษย์ผู้ดำเนินการร้านค้าใช้งานจริง นอกจากนี้ ระบบยังมีกลไกการกำหนดงบประมาณเวลาดำเนินการ เพื่อป้องกันไม่ให้ความหน่วงของโมเดลภาษาขนาดใหญ่ (Large Language Model หรือ LLM) ส่งผลกระทบต่อเวลาในสถานการณ์จำลอง และทุกเหตุการณ์ยังสามารถเล่นซ้ำ (Replay) ได้อย่างแม่นยำตามลำดับการกระทำ
อย่างไรก็ตาม เพื่อป้องกันปัญหาการปนเปื้อนของข้อมูลในเบนช์มาร์ก (Benchmark contamination) ทางผู้พัฒนาจึงจำกัดการเข้าถึงสภาพแวดล้อมเต็มรูปแบบ โดยมีการเปิดเผยข้อมูลบางส่วนเพื่อใช้ในการทดสอบเท่านั้น
เครื่องมืออย่าง StoreBench สะท้อนให้เห็นทิศทางของการพัฒนา AI ที่ก้าวข้ามจากการตอบคำถามทั่วไป ไปสู่การทำงานที่มีความซับซ้อนและต้องบริหารจัดการระบบธุรกิจจริง ซึ่งอาจนำไปสู่การประยุกต์ใช้ระบบอัตโนมัติในภาคธุรกิจอีคอมเมิร์ซของไทยในอนาคต