GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/Pesquisa CometAPI

O que é o GLM-5.3-FlashX? Especificações, Velocidade, Preços, Benchmarks e Recursos

O que é o GLM-5.3-FlashX, incluindo velocidade de 200 tokens, base de capacidades do GLM-5.3-Flash, contexto de 1M, benchmarks, preços, limitações e acesso ao CometAPI.

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 20, 2026 14 min de leitura
O que é o GLM-5.3-FlashX? Especificações, Velocidade, Preços, Benchmarks e Recursos
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

GLM-5.3-FlashX é a variante de serving de alta velocidade do GLM-5.3-Flash da Z.ai. Lançado em 18 de setembro de 2026, mira velocidades de geração de pico de até 200 tokens por segundo — um pico relatado pelo provedor, não um multiplicador garantido ou verificado de forma independente — enquanto mantém a base de capacidades do GLM-5.3-Flash. GLM-5.3-FlashX agora está disponível na CometAPI por meio de um endpoint de chat-completions compatível com OpenAI.

A distinção importante é que FlashX é principalmente um upgrade de serving e inferência, não um checkpoint de inteligência documentado separadamente. Sua base de capacidades é o modelo GLM-5.3-Flash de 320B total / 18B ativo, com entrada multimodal nativa, janela de contexto de 1M tokens, atenção híbrida esparsa + linear, uso de ferramentas e fluxos de trabalho agentivos de longo horizonte.

Os multiplicadores de velocidade e preço relatados são reivindicações de lançamento, não garantias para todo provedor ou requisição. A avaliação em produção deve comparar tempo até o primeiro token, throughput sustentado, latência p95, tempo de conclusão da tarefa e preços atuais do provedor.

Última verificação: 20 de setembro de 2026

Principais pontos

  • Velocidade: A Z.ai reporta geração de pico de até 200 tokens/s; não há medição de baseline oficial ou multiplicador universal declarado, portanto as equipes devem fazer benchmark de sua própria rota e carga de trabalho.
  • Base de capacidades: FlashX herda o design MoE de 320B total / 18B ativo, multimodalidade nativa, atenção híbrida esparsa + linear e contexto de 1M do GLM-5.3-Flash.
  • Benchmarks: As pontuações de inteligência publicadas pertencem ao GLM-5.3-Flash; não são execuções de benchmark separadas do FlashX.
  • Melhor encaixe: Agentes de codificação interativos, loops de uso de navegador/computador, codificação visual, assistentes corporativos e outros fluxos de trabalho multi-etapas onde a latência se acumula.
  • Disponibilidade na CometAPI: GLM-5.3-FlashX está ativo na CometAPI com o ID de modelo glm-5.3-flashx e o endpoint /v1/chat/completions.

O que é GLM-5.3-FlashX?

GLM-5.3-FlashX deve ser entendido como um nível de entrega otimizado para latência do GLM-5.3-Flash. As mensagens de lançamento da Z.ai focam em inferência mais rápida e suave, enquanto o modelo Flash subjacente permanece a base de capacidades. FlashX, portanto, difere de uma nova geração de modelo, um checkpoint destilado ou um conjunto de pesos lançado separadamente.

O modelo base GLM-5.3-Flash foi projetado em torno de inferência eficiente. A Z.ai diz que foi treinado a partir de uma nova base multimodal, usa um corpus multimodal de 30 trilhões de tokens e combina roteamento Mixture-of-Experts com atenção híbrida. FlashX aprofunda o lado de serving, consolidando a infraestrutura de inferência desenvolvida para o GLM-5.3-Flash.

Para desenvolvedores, “O que é GLM-5.3-FlashX?” tem uma resposta prática: é a opção de serving de alta vazão do GLM-5.3-Flash disponível pela Z.ai e agora também por meio da API unificada da CometAPI. A proposta de valor é a menor latência de interação, não um salto recém-anunciado na inteligência do modelo.

Segundo declarações de lançamento da Zhipu reportadas pela IT Home, GLM-5.3-Flash apareceu primeiro para desenvolvedores no exterior sob o nome anônimo “Ox Alpha” e viu crescimento contínuo de uso. Para atender a essa demanda, a Zhipu aumentou o investimento em infraestrutura e otimização de inferência sobre uma base de produção de aproximadamente 100.000 chips aceleradores domésticos e, então, introduziu o FlashX. O serviço mantém a base de capacidades do GLM-5.3-Flash enquanto eleva o pico de saída relatado pelo provedor para 200 tokens/s. A Zhipu posiciona o lançamento em torno de inteligência, preço e velocidade; para workloads de empresas e desenvolvedores, isso se traduz em uma opção de alta vazão e baixa latência cujo valor comercial deve ser validado com throughput sustentado, latência p95, qualidade de tarefa e custo sob concorrência realista.

Especificações do GLM-5.3-FlashX

Como o FlashX é uma variante de serving de alta velocidade, sua ficha técnica deve separar características herdadas do modelo de características de serving específicas do FlashX.

EspecificaçãoGLM-5.3-FlashX
ProvedorZ.ai / Zhipu AI
Posicionamento do produtoOpção de serving de alta velocidade para GLM-5.3-Flash
Parâmetros totais/ativosAproximadamente 320B / 18B por token, herdado do modelo base
ArquiteturaMixture-of-Experts; atenção híbrida esparsa + linear; mHC
Janela de contextoAté 1,048,576 tokens
Entradas/saídaSuporte exato de modalidade, limites de arquivo, restrições de vídeo e parâmetros específicos de rota devem ser verificados no endpoint do provedor antes da produção.
RaciocínioSuportado pelo modelo GLM-5.3-Flash subjacente
Esforço de raciocíniobaixo / alto / máximo nas rotas suportadas
PensamentoDependente da rota/API
Chamada de ferramentas/funçõesSuportado
Pesos abertosGLM-5.3-Flash subjacente: licenciado sob MIT; FlashX é apresentado como uma opção de serving hospedada
Velocidade máxima relatadaAté 200 tokens/s
Velocidade relativa relatadaSem baseline oficial ou multiplicador garantido; faça benchmark da rota do provedor selecionado
Preço na CometAPI$60 / 1M tokens de entrada e $60 / 1M tokens de saída, verificado em 20 de setembro de 2026; revalide o preço ao vivo
Data de lançamento18 de setembro de 2026
Chave do modelo Z.aiGLM-5.3-FlashX / glm-5.3-flashx
ID do modelo na CometAPIglm-5.3-flashx
Endpoint da CometAPIPOST /v1/chat/completions

Por que o GLM-5.3-FlashX é mais rápido que o GLM-5.3-Flash?

Dois níveis de otimização sustentam a história de velocidade: a arquitetura eficiente herdada do GLM-5.3-Flash e a infraestrutura de serving otimizada ao seu redor.

Atenção híbrida esparsa + linear

GLM-5.3-Flash combina atenção linear para dependências locais com atenção esparsa para recuperar informações relevantes do contexto mais amplo. A Z.ai também descreve IndexPool, que comprime quatro vetores de chave do indexador em um por meio de pooling ponderado. Na comparação publicada pela Z.ai, essas mudanças reduzem o compute de atenção em cerca de 3,0× e o tamanho do KV-cache em cerca de 4,4× em relação ao GLM-5.3 em contexto longo.

O que é o GLM-5.3-FlashX? Especificações, Velocidade, Preços, Benchmarks e Recursos

Seção oficial de arquitetura do GLM-5.3-Flash da Z.ai.

Infraestrutura de inferência

A Z.ai afirma que o tráfego de produção do GLM-5.3-Flash roda em um cluster de mais de 100.000 aceleradores de IA fabricados na China. Seu stack de serving inclui paralelismo de tensores, ReplaySSM, quantização W8A8, quantização de cache mista INT8/FP8/BF16, Layer Split e uma arquitetura desagregada Encode–Prefill–Decode. A empresa reporta aproximadamente 3× de melhoria de serving ponta a ponta em relação ao seu baseline inicial no mesmo hardware.

FlashX deve, portanto, ser entendido como a produtização de otimização contínua de inferência: o modelo reduz custos de compute e cache, enquanto o FlashX adiciona uma camada de serving de baixa latência mais agressiva.

Quão rápido é o GLM-5.3-FlashX?

A Z.ai reporta velocidade de geração de pico de até 200 tokens/s. Trate isso como uma reivindicação máxima de serviço, não uma taxa sustentada garantida: valide tempo até o primeiro token, velocidade de saída sustentada, latência p95, conclusão de tarefa e taxa de erro na rota de produção.

“Até 200 tokens/s” é uma figura de pico de serving, não uma garantia para toda requisição. O throughput real depende do tamanho do prompt, esforço de raciocínio, comprimento da saída, pré-processamento multimodal, concorrência, chamadas de ferramentas, região e carga do provedor.

Métricas úteis de produção incluem tempo até o primeiro token, tokens por segundo sustentados na saída, latência p95 e tempo de conclusão da tarefa de ponta a ponta. O tempo de conclusão de tarefa importa especialmente para agentes, porque um fluxo de trabalho de 20 etapas pode pagar o atraso de geração 20 vezes.

Como o GLM-5.3-FlashX performa em benchmarks?

Nenhuma suíte oficial de benchmarks de inteligência específica do FlashX foi publicada no lançamento. FlashX é documentado como uma otimização de inferência e serving, logo seu diferenciador validado é throughput — não uma nova pontuação de qualidade de tarefa.

Esses resultados pertencem ao modelo GLM-5.3-Flash subjacente e podem ser consultados apenas como contexto de capacidades; não são medições do FlashX porque o checkpoint, o mecanismo de avaliação e a execução de qualidade de tarefa não foram reportados separadamente para o FlashX.

Para decisões de implantação, teste FlashX e Flash nos mesmos prompts, esforço de raciocínio e configuração de ferramentas, então compare sucesso de tarefa, tempo até o primeiro token, throughput sustentado, latência p95 e custo total por fluxo de trabalho concluído.

GLM-5.3-FlashX vs GLM-5.3-Flash vs GLM-5.3

DimensãoGLM-5.3-FlashXGLM-5.3-FlashGLM-5.3
PosicionamentoCamada de serving de alta velocidadeModelo multimodal com foco em eficiênciaCamada de capacidades principal
ContextoAté 1M1MClasse 1M nas rotas suportadas
Parâmetros totais/ativosBase herdada de 320B / 18B320B / 18BConfiguração flagship maior
Velocidade de saída de picoAté 200 tokens/s, reportadoBaseline dependente do provedorDependente do provedor
Preço relativo vs FlashCerca de 2.5×, relatadoMaior que Flash
Pesos abertosCamada de serviço; pesos base são abertosSim, MITDependente da versão
Raciocínio e ferramentasHerdado do Flash; verifique controles de rotaSuportadoCamada de raciocínio principal
Disponibilidade na CometAPIDisponívelDisponívelDisponível
Melhor adequaçãoAgentes interativos de baixa latênciaTrabalho multimodal de alto volume e sensível a custoWorkloads GLM de capacidade máxima

A CometAPI agora fornece a API GLM-5.3-FlashX, ao lado da API GLM-5.3-Flash e da API GLM-5.3. Isso viabiliza comparar latência, custo e qualidade de tarefa por meio de uma única integração.

Comparação baseada em workload

CenárioFlashFlashX
Processamento em lote
Workloads sensíveis a custo
Chat interativo
Agentes de codificação
Agentes de navegador
Humano-no-loop
Jobs automatizados de longa duraçãoDepende
API sensível à latência
Alto volume de saída
Responsividade máxima

Quanto custa o GLM-5.3-FlashX?

A CometAPI lista o GLM-5.3-FlashX a $60 por 1M tokens de entrada e $60 por 1M tokens de saída. Sua tabela de comparação mostra um preço de referência oficial de $75 por 1M tokens de entrada e $75 por 1M tokens de saída. Os preços podem mudar, então confirme a página do modelo ao vivo antes de orçar.

UsoPreço na CometAPIPreço de referência oficial
Entrada$60 / 1M tokens$75 / 1M tokens
Saída$60 / 1M tokens$75 / 1M tokens

Exemplo de custo calculado

Para um workload usando 100M tokens de entrada e 20M tokens de saída, a estimativa atual da CometAPI é: 100 × $60 + 20 × $60 = $7,200. Na taxa de referência oficial, o mesmo workload é 100 × $75 + 20 × $75 = $9,000.

Nessas taxas exibidas, FlashX deve ser reservado para fluxos de trabalho onde a latência afeta materialmente a receita, a experiência do usuário ou o tempo de conclusão de agentes sequenciais. Processamento em lote e jobs de alto volume sensíveis a custo devem ser comparados à rota Flash menos cara.

Tokens de raciocínio também podem contribuir para o uso de saída faturado, dependendo da política do provedor; estime o custo a partir dos logs de uso reais, não apenas do comprimento visível da resposta.

Quais são os melhores casos de uso para o GLM-5.3-FlashX?

Agentes de codificação em tempo real

Agentes de codificação geram texto repetidamente, chamam ferramentas, inspecionam resultados, modificam arquivos, executam testes e fazem loops. Geração mais rápida reduz o tempo ocioso entre ações.

Agentes de navegador e uso de computador

Entrada multimodal permite que o modelo use capturas de tela e estado da interface no loop de raciocínio. Baixa latência importa porque a automação de navegador alterna rapidamente entre observar, decidir, agir e observar novamente.

Codificação visual e iteração de UI

Um modelo pode inspecionar interfaces renderizadas, compará-las com requisitos, editar código e inspecionar o resultado novamente. Inferência mais rápida encurta o loop de feedback visual.

Assistentes empresariais interativos

Assistentes voltados ao cliente, copilotos internos, agentes de pesquisa e agentes de documentos frequentemente têm um humano esperando a cada turno. Um prêmio de latência é mais fácil de justificar aqui do que no processamento em lote noturno.

Trabalho interativo de longo contexto

A janela de contexto de 1M tokens é útil para grandes repositórios, relatórios longos e históricos estendidos de agentes quando esses contextos ainda requerem interação responsiva.

GLM-5.3-FlashX está disponível na CometAPI?

Sim. GLM-5.3-FlashX está ativo na CometAPI. A página do modelo o lista como disponível por meio do endpoint de produção /v1/chat/completions, e o ID de modelo documentado é glm-5.3-flashx. Desenvolvedores podem usar o mesmo padrão de integração compatível com OpenAI de outros modelos de texto da CometAPI.

Detalhes de acesso, preços, limites e modalidades suportadas podem mudar. A página de modelo ao vivo da CometAPI é a fonte autorizada para a rota atual.

Quando o FlashX pode não valer a pena

  • Workloads offline ou em lote: quando ninguém está aguardando a resposta, o serving Flash de menor custo pode entregar melhor economia.
  • Geração de alto volume sensível a custo: o preço por token do FlashX exibido pode dominar o custo total do fluxo de trabalho mesmo quando os jobs terminam mais cedo.
  • Tarefas limitadas pela qualidade do modelo e não pela latência: FlashX não tem suíte de benchmarks de inteligência separada, portanto não deve ser adquirido como um upgrade de capacidades comprovado.
  • Workflows com gargalos em outros lugares: recuperação, ferramentas, navegadores, bancos de dados e aprovação humana podem dominar a latência de ponta a ponta, reduzindo o valor de geração de tokens mais rápida.
  • Requisitos de self-hosting ou pesos abertos: FlashX é apresentado como um nível de serving hospedado; use os pesos subjacentes do GLM-5.3-Flash quando o controle de implantação importar.
  • Garantias estritas de throughput:

Quais são as limitações do GLM-5.3-FlashX?

  • A cifra de 200 tokens/s é uma velocidade máxima anunciada, não uma taxa sustentada garantida.
  • O preço reportado é mais alto que o do Flash e varia entre provedores.
  • Ainda não há suíte de benchmarks de inteligência separada para o FlashX.
  • A saída padrão é texto, não geração nativa de imagem ou vídeo.
  • Um limite de 1M tokens não elimina a necessidade de recuperação, seleção de contexto e gestão de latência.
  • Limites de taxa, limites de saída, modalidades e throughput real específicos de cada provedor podem diferir do serviço da Z.ai.

Você deve usar o GLM-5.3-FlashX?

GLM-5.3-FlashX é mais atraente quando o GLM-5.3-Flash é capaz o suficiente, mas muito lento para um fluxo de trabalho interativo. O lançamento altera mais a economia de latência do que a história de capacidades centrais.

Escolha GLM-5.3-Flash quando o custo por token domina e uma geração mais lenta é aceitável. Escolha FlashX quando o tempo de espera humano ou a latência do loop de agentes é mais caro que o prêmio de serving. Considere GLM-5.3 quando a camada flagship de capacidades importa mais que custo ou latência.

Para equipes que já usam um gateway unificado, o próximo passo prático é executar o mesmo workload representativo por meio do GLM-5.3-FlashX e do GLM-5.3-Flash na CometAPI, então comparar latência p95, sucesso de tarefa e custo total por fluxo de trabalho concluído.

FAQ do GLM-5.3-FlashX

O que é GLM-5.3-FlashX?

GLM-5.3-FlashX é a opção de serving de alta velocidade da Z.ai para a base de capacidades do GLM-5.3-Flash. Ela mira menor latência e maior throughput de saída, em vez de um salto separado e anunciado na inteligência do modelo.

GLM-5.3-FlashX é um novo checkpoint?

Os materiais públicos de lançamento da Z.ai enfatizam otimização de inferência e infraestrutura. Nenhuma contagem de parâmetros separada, lançamento de pesos ou suíte de benchmarks de inteligência foi publicada para o FlashX.

GLM-5.3-FlashX suporta entrada multimodal?

A base de capacidades do GLM-5.3-Flash é multimodal. Modalidades específicas do provedor e da rota devem ser confirmadas antes da implantação.

Os pesos do GLM-5.3-FlashX são de código aberto?

Os pesos subjacentes do GLM-5.3-Flash estão disponíveis sob a licença MIT. FlashX é apresentado como uma opção de serving hospedada de alta velocidade, em vez de um checkpoint de pesos lançado separadamente.

Há pontuações de benchmark separadas para o GLM-5.3-FlashX?

Nenhuma suíte de benchmarks de inteligência separada foi publicada no lançamento. As pontuações atuais de qualidade de tarefa pertencem ao GLM-5.3-Flash.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Sep 20, 2026
Última atualização Sep 20, 2026
19 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais