Z.ai เปิดตัว GLM-5.3-Flash อ่านภาพได้ ราคาถูกกว่า GLM-5.2 ราว 10 เท่า
โมเดลเปิดรุ่นใหม่ใช้สถาปัตยกรรม MoE รองรับภาพและวิดีโอ พร้อมหน้าต่างบริบทขนาด 1 ล้านโทเค็น
Z.ai แบรนด์สากลของ Zhipu AI เปิดตัว GLM-5.3-Flash อย่างเป็นทางการเมื่อวันที่ 26 สิงหาคม 2026 โดยวางตำแหน่งเป็นโมเดลขนาดกลางที่ให้ประสิทธิภาพสูงขึ้น แต่ลดค่าใช้งานลงจาก GLM-5.2 ประมาณ 10 เท่า
โมเดลนี้ใช้สถาปัตยกรรม Mixture-of-Experts หรือ MoE (ระบบที่เลือกใช้เฉพาะส่วนของโมเดลตามงาน) มีพารามิเตอร์รวม 320B แต่เรียกใช้งานจริง 18B ต่อโทเค็น วิธีนี้ช่วยลดทรัพยากรประมวลผล โดยผลทดสอบมาตรฐานที่เผยแพร่ระบุว่า GLM-5.3-Flash ทำผลงานโดยรวมดีกว่า GLM-5.2 ในหลายรายการ
จุดเปลี่ยนสำคัญคือความสามารถแบบ Multimodal (ประมวลผลข้อมูลหลายรูปแบบ) ซึ่งทำให้โมเดลอ่านได้ทั้งภาพและวิดีโอโดยไม่ต้องพึ่งโมเดลแยก ความสามารถดังกล่าวเหมาะกับงานที่ต้องวิเคราะห์หน้าจอ เอกสารภาพ หรือองค์ประกอบด้านภาพของเว็บไซต์ นอกเหนือจากงานสนทนาและเขียนโค้ดทั่วไป
GLM-5.3-Flash ยังมี Context Window (ปริมาณข้อมูลที่โมเดลพิจารณาได้ในการทำงานหนึ่งครั้ง) ขนาด 1 ล้านโทเค็น จึงรองรับเอกสารหรือโค้ดจำนวนมากได้ในคราวเดียว อย่างไรก็ตาม ขนาดบริบทที่รองรับไม่ได้หมายความว่าโมเดลจะจดจำและใช้รายละเอียดทุกส่วนได้แม่นยำเท่ากันทั้งหมด
ก่อนเปิดตัว โมเดลนี้เคยเปิดให้ทดลองโดยไม่ระบุผู้พัฒนาในชื่อ Ox Alpha ผ่าน OpenRouter และ OpenCode นอกจากนี้ยังออกแบบให้รองรับชิป AI ที่ผลิตภายในประเทศจีนตั้งแต่ต้น สะท้อนความพยายามลดการพึ่งพาฮาร์ดแวร์จากต่างประเทศ
Z.ai เผยแพร่น้ำหนักโมเดลแบบ Open Weights (เปิดให้นำค่าน้ำหนักไปใช้งาน) ภายใต้สัญญาอนุญาต MIT ทำให้นักพัฒนาและองค์กรสามารถนำไปศึกษา ปรับแต่ง หรือวางระบบของตนเองได้ตามเงื่อนไขของสัญญาอนุญาต
โมเดลที่ราคาลดลงราว 10 เท่าและเปิดน้ำหนักอาจเพิ่มทางเลือกให้นักพัฒนาไทยที่ต้องการระบบอ่านภาพหรือรองรับข้อมูลยาว โดยไม่จำเป็นต้องพึ่งบริการโมเดลปิดเพียงอย่างเดียว แต่ควรทดสอบความแม่นยำกับภาษาไทยและงานจริงก่อนใช้งาน