Z.ai lança GLM-5.3-Flash com suporte a visão e custo cerca de 10 vezes menor que o GLM-5.2
Novo modelo aberto utiliza arquitetura MoE, suporta imagens e vídeos e oferece janela de contexto de 1 milhão de tokens
A Z.ai, marca internacional da Zhipu AI, lançou oficialmente o GLM-5.3-Flash em 26 de agosto de 2026. O modelo é posicionado como uma opção de porte intermediário com maior desempenho e custo de operação cerca de 10 vezes menor em comparação ao GLM-5.2.
O modelo utiliza a arquitetura Mixture-of-Experts (MoE) — sistema que ativa apenas partes específicas da rede conforme a tarefa —, somando 320B de parâmetros totais, mas utilizando apenas 18B por token. Essa abordagem reduz a exigência de recursos computacionais. Segundo benchmarks divulgados, o GLM-5.3-Flash supera o GLM-5.2 em diversos testes de desempenho geral.
Um dos principais diferenciais é a capacidade multimodal nativa, permitindo processar imagens e vídeos sem a necessidade de modelos auxiliares. O recurso é indicado para tarefas como análise de telas, leitura de documentos visuais e interfaces de sites, além de conversação e geração de código.
O GLM-5.3-Flash também traz uma janela de contexto de 1 milhão de tokens, viabilizando o processamento de grandes volumes de documentos ou bases de código de uma só vez. Vale notar, contudo, que uma janela ampla não garante que o modelo recupere todos os detalhes com a mesma precisão em qualquer ponto do texto.
Antes do lançamento oficial, o modelo foi testado de forma anônima sob o codinome Ox Alpha no OpenRouter e no OpenCode. Ele também foi projetado desde o início para operar em chips de IA fabricados na China, refletindo a estratégia de reduzir a dependência de hardware estrangeiro.
A Z.ai disponibilizou os pesos do modelo (open weights) sob a licença MIT, permitindo que desenvolvedores e empresas analisem, ajustem ou façam o deploy da tecnologia em infraestrutura própria, respeitando os termos da licença.
Um modelo com pesos abertos e custo até 10 vezes menor amplia as alternativas para desenvolvedores que necessitam de recursos visuais ou janelas longas de contexto sem depender exclusivamente de modelos proprietários fechados. Ainda assim, recomenda-se validar a precisão no idioma local e em cenários reais antes da adoção em produção.