Especificações técnicas do Qwen3.7-Plus
| Item | Especificação |
|---|---|
| Nome do modelo | Qwen3.7-Plus |
| Fornecedor | Alibaba Cloud (Qwen Team) |
| ID do modelo de API | qwen3.7-plus |
| Tipo de modelo | Modelo de agente multimodal |
| Tipos de entrada | Texto, Imagens, Vídeo |
| Tipos de saída | Texto |
| Janela de contexto | Até 1,000,000 tokens |
| Máximo de tokens de entrada | ~991.8K |
| Máximo de tokens de saída | ~65.5K |
| Pontos fortes principais | Raciocínio visão-linguagem, programação, interação com GUI, fluxos de trabalho de agente |
| Recursos integrados | Chamada de função, Saídas estruturadas, Cache, Pesquisa na Web, API em lote |
| Compatibilidade da API | Compatível com a OpenAI via DashScope / Model Studio |
O que é o Qwen3.7-Plus?
O Qwen3.7-Plus é o carro-chefe multimodal equilibrado da geração Qwen 3.7 da Alibaba. Enquanto o Qwen3.7-Max se concentra no raciocínio puramente textual e em codificação de longo horizonte, o Qwen3.7-Plus amplia essas capacidades com compreensão nativa de imagens e vídeo, permitindo raciocinar sobre informações visuais e textuais em um único modelo.
O modelo é concebido em torno da ideia de um agente híbrido interativo multimodal: ele pode interpretar capturas de tela, analisar gráficos, compreender interfaces, gerar código a partir de referências visuais e usar ferramentas para concluir tarefas em múltiplas etapas. Isso o torna particularmente atrativo para agentes de IA, automação de GUI e fluxos de produtividade em que o contexto visual é importante.
Principais recursos do Qwen3.7-Plus
- Entrada multimodal nativa, com suporte a texto, imagens e vídeo em um pipeline de raciocínio unificado.
- Janela de contexto de até 1M tokens, viabilizando análise de grandes bases de código e fluxos com documentos longos.
- Recursos de agente híbrido GUI + CLI, permitindo que o modelo compreenda telas e interaja com ambientes de software.
- Programação avançada e uso de ferramentas, incluindo chamada de função, saídas estruturadas e integração com ferramentas externas.
- Compreensão visual para gráficos, documentos e capturas de tela, sendo útil para tarefas de negócios, engenharia e UI.
- Endpoint de API compatível com a OpenAI, possibilitando migração relativamente fácil a partir da infraestrutura de LLM existente.
Desempenho em benchmarks do Qwen3.7-Plus
De acordo com relatórios públicos de benchmarks e plataformas de avaliação de terceiros, o Qwen3.7-Plus oferece desempenho multimodal e agentic de ponta:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: aproximadamente 90.0%.
- IFBench: aproximadamente 78.0%.
- AA Long Context Reasoning (AA-LCR): aproximadamente 65.0%.
- Terminal-Bench Hard: aproximadamente 47.0%, refletindo fortes capacidades de codificação agentic.
A Alibaba também relata que o Qwen3.7-Plus apresenta desempenho competitivo em relação aos principais modelos proprietários em benchmarks de agente e codificação, com força particular em tarefas multimodais e interação de UI.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Recurso | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Modalidades de entrada | Texto, imagem, vídeo | Apenas texto | Texto, imagem |
| Janela de contexto | Até 1M tokens | 1M tokens | Contexto amplo |
| Compreensão visual | Excelente | Não suportado | Forte |
| Interação de agente/GUI | Foco nativo | Limitado | Bom |
| Raciocínio textual de longo horizonte | Muito forte | O melhor da família Qwen | Excelente |
| Melhor caso de uso | Agentes multimodais e produtividade | Programação, matemática, raciocínio profundo | Raciocínio e programação para empresas |
Para projetos que envolvem capturas de tela, automação de UI, depuração visual ou fluxos multimodais, o Qwen3.7-Plus é geralmente a melhor escolha. Para raciocínio puramente baseado em texto ou codificação em escala de repositório, o Qwen3.7-Max continua sendo a opção mais forte.
Limitações
- O Qwen3.7-Plus é atualmente lançado como um modelo proprietário em estágio de prévia, e algumas capacidades podem evoluir antes do lançamento estável.
- Recursos de chamada de função e certas ferramentas de agente ainda estão sendo lançados.
- Para cargas de trabalho puramente textuais e intensivas em raciocínio, o Qwen3.7-Max pode entregar desempenho ligeiramente melhor.
- Como na maioria dos grandes modelos multimodais, os desenvolvedores devem validar o desempenho em seus próprios conjuntos de dados de imagem e UI antes da implantação em produção.
Casos de uso representativos
- Agentes de IA que combinam interações com navegador, GUI e terminal.
- Depuração de software a partir de capturas de tela e registros de UI.
- Análise de documentos, gráficos e painéis.
- Assistentes de codificação visual que geram código a partir de mockups ou diagramas.
- Fluxos de produtividade corporativa envolvendo entradas mistas de texto e imagem.
- Assistentes de pesquisa multimodal que combinam busca na web com compreensão visual.