Spécifications techniques de Qwen3.7-Plus
| Élément | Spécification |
|---|---|
| Nom du modèle | Qwen3.7-Plus |
| Fournisseur | Alibaba Cloud (Qwen Team) |
| ID de modèle API | qwen3.7-plus |
| Type de modèle | Modèle d'agent multimodal |
| Types d'entrée | Texte, Images, Vidéo |
| Types de sortie | Texte |
| Fenêtre de contexte | Jusqu'à 1,000,000 jetons |
| Jetons max en entrée | ~991.8K |
| Jetons max en sortie | ~65.5K |
| Forces clés | Raisonnement vision-langage, programmation, interaction GUI, workflows d'agent |
| Fonctionnalités intégrées | Appel de fonctions, sorties structurées, cache, recherche Web, API batch |
| Compatibilité API | Compatible avec OpenAI via DashScope / Model Studio |
Qu'est-ce que Qwen3.7-Plus ?
Qwen3.7-Plus est le produit phare multimodal équilibré de la génération Qwen 3.7 d'Alibaba. Tandis que Qwen3.7-Max se concentre sur le raisonnement textuel pur et la programmation de longue portée, Qwen3.7-Plus étend ces capacités avec une compréhension native des images et des vidéos, lui permettant de raisonner à la fois sur l'information visuelle et textuelle au sein d'un même modèle.
Le modèle est conçu autour de l'idée d'un agent hybride interactif multimodal : il peut interpréter des captures d'écran, analyser des graphiques, comprendre des interfaces, générer du code à partir de références visuelles et utiliser des outils pour accomplir des tâches en plusieurs étapes. Cela le rend particulièrement attractif pour les agents IA, l'automatisation GUI et les workflows de productivité où le contexte visuel est essentiel.
Principales fonctionnalités de Qwen3.7-Plus
- Entrée multimodale native prenant en charge le texte, les images et la vidéo dans un pipeline de raisonnement unifié.
- Fenêtre de contexte jusqu'à 1M de jetons, permettant l'analyse de grands dépôts de code et des workflows de documents longs.
- Capacités hybrides agent GUI + CLI, permettant au modèle de comprendre les écrans et d'interagir avec des environnements logiciels.
- Programmation avancée et utilisation d'outils, incluant l'appel de fonctions, des sorties structurées et l'intégration d'outils externes.
- Compréhension visuelle pour les graphiques, documents et captures d'écran, utile pour les tâches business, d'ingénierie et d'UI.
- Point de terminaison API compatible avec OpenAI, facilitant une migration relativement aisée depuis une infrastructure LLM existante.
Performances de référence de Qwen3.7-Plus
Selon les rapports publics de benchmarks et des plateformes d'évaluation tierces, Qwen3.7-Plus offre des performances de pointe en multimodal et en capacités agentiques :
- Artificial Analysis Intelligence Index : 53.3.
- GPQA Diamond : environ 90.0%.
- IFBench : environ 78.0%.
- AA Long Context Reasoning (AA-LCR) : environ 65.0%.
- Terminal-Bench Hard : environ 47.0%, reflétant de solides capacités de codage agentique.
Alibaba indique également que Qwen3.7-Plus est compétitif face aux modèles propriétaires leaders sur les benchmarks d'agent et de programmation, avec une force particulière sur les tâches multimodales et l'interaction UI.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Fonctionnalité | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Modalités d'entrée | Texte, Image, Vidéo | Texte uniquement | Texte, Image |
| Fenêtre de contexte | Jusqu'à 1M jetons | 1M jetons | Contexte large |
| Compréhension visuelle | Excellente | Non pris en charge | Solide |
| Interaction agent / GUI | Focalisation native | Limitée | Bonne |
| Raisonnement textuel à long terme | Très solide | Meilleur dans la famille Qwen | Excellent |
| Meilleur cas d'utilisation | Agents multimodaux et productivité | Programmation, mathématiques, raisonnement profond | Raisonnement et programmation pour l'entreprise |
Pour les projets qui impliquent des captures d'écran, l'automatisation UI, le débogage visuel ou des workflows multimodaux, Qwen3.7-Plus est généralement le meilleur choix. Pour un raisonnement purement textuel ou une programmation à l'échelle d'un dépôt, Qwen3.7-Max demeure l'option la plus performante.
Limitations
- Qwen3.7-Plus est actuellement publié comme un modèle propriétaire en phase de préversion, et certaines capacités peuvent évoluer avant la version stable.
- L'appel de fonctions et certaines fonctionnalités d'outillage d'agent sont encore en cours de déploiement.
- Pour des charges de travail purement textuelles et très axées sur le raisonnement, Qwen3.7-Max peut offrir des performances légèrement meilleures.
- Comme pour la plupart des grands modèles multimodaux, les développeurs doivent valider les performances sur leurs propres jeux de données d'images et d'interface utilisateur avant un déploiement en production.
Cas d'utilisation représentatifs
- Agents IA combinant des interactions navigateur, GUI et terminal.
- Débogage logiciel à partir de captures d'écran et d'interface utilisateur.
- Analyse de documents, graphiques et tableaux de bord.
- Assistants de codage visuel générant du code à partir de maquettes ou de diagrammes.
- Flux de productivité en entreprise impliquant des entrées mixtes texte et image.
- Assistants de recherche multimodaux combinant la recherche Web à la compréhension visuelle