เปิดตัว ZGCM-1 โมเดลภาษาเปิดกว้าง 7 พันล้านพารามิเตอร์ เน้นเลขและค้นหาข้อมูลขั้นสูง
ทีมวิจัยเผยโฉม ZGCM-1 โมเดลปัญญาประดิษฐ์ขนาด 7.39 พันล้านพารามิเตอร์ที่เปิดกว้างทุกส่วน ทั้งชุดข้อมูล โค้ด และบันทึกการฝึก เพื่อยกระดับงานคำนวณและค้นหาข้อมูล
วงการปัญญาประดิษฐ์สากลมีความเคลื่อนไหวครั้งสำคัญ หลังมีการเผยแพร่เอกสารงานวิจัยบนระบบ arXiv (เลขที่ 2609.13356) แนะนำโมเดลภาษาขนาดใหญ่ (Foundation Model) รุ่นใหม่ในชื่อ ZGCM-1 ซึ่งพัฒนาโดยทีมงานจากสถาบันวิจัย Zhongguancun Academy และพันธมิตร
ZGCM-1 เป็นโมเดลแบบหนาแน่น (Dense) ขนาด 7.39 พันล้านพารามิเตอร์ (7B) ที่ผ่านการฝึกฝนตั้งแต่เริ่มต้น (From scratch) จุดเด่นสำคัญคือการออกแบบมาเพื่อแก้ปัญหาข้อจำกัดของโมเดลขนาดกะทัดรัด ที่มักไม่สามารถจดจำข้อมูลบนเว็บทั้งหมดได้ โดยเน้นผสานความสามารถในการคิดวิเคราะห์ภายในเข้ากับการใช้เครื่องมือภายนอกสำหรับการค้นหาข้อมูลแบบ Agentic Search และการใช้เหตุผลทางคณิตศาสตร์
ด้านประสิทธิภาพการฝึกฝนและสถาปัตยกรรม ทีมผู้พัฒนาได้เลือกใช้ระบบ Hybrid Attention ซึ่งเป็นการผสมผสานระหว่างสถาปัตยกรรม Gated Sliding-window และ Full Attention รวมถึงการใช้ตัวปรับค่า (Optimizer) แบบ FP8 Muon เพื่อเร่งความเร็วและเสถียรภาพในการฝึก พร้อมทั้งรองรับ Context Window หรือพื้นที่ความจำบริบทสูงสุดถึง 256K tokens ผ่านกระบวนการฝึกแบบก้าวหน้า (Progressive Curriculum)
นอกจากด้านประสิทธิภาพแล้ว จุดที่ได้รับความสนใจจากชุมชนนักพัฒนาอย่างมากตามรายงานจากเว็บไซต์ AI Weekly คือสถานะความเป็น Fully Open หรือการเปิดกว้างอย่างแท้จริง โดยผู้พัฒนาได้เปิดเผยทั้งน้ำหนักโมเดล (Weights) ชุดข้อมูลที่ใช้ฝึก รหัสต้นฉบับ (Training Code) และบันทึกการฝึกฝนผ่านแพลตฟอร์ม Hugging Face เพื่อเปิดโอกาสให้นักวิจัยทั่วโลกสามารถตรวจสอบและทำซ้ำผลการทดลองได้
การที่โมเดลระดับ 7B เปิดเผยข้อมูลเชิงลึกทั้งชุดข้อมูลและโค้ดฝึกครบถ้วน ช่วยให้ประชาคมนักวิจัยไทยและทั่วโลกสามารถศึกษา ต่อยอด และนำไปปรับใช้กับงานภาษาไทยหรือบริบทเฉพาะทางได้อย่างโปร่งใส โดยไม่ต้องเริ่มลงทุนสร้างโมเดลจากศูนย์