Caractéristiques techniques de Qwen3.7-Plus
| Élément | Spécification |
|---|---|
| Nom du modèle | Qwen3.7-Plus |
| Fournisseur | Alibaba Cloud (Qwen Team) |
| ID du modèle API | qwen3.7-plus |
| Type de modèle | Modèle d’agent multimodal |
| Types d’entrée | Texte, images, vidéo |
| Types de sortie | Texte |
| Fenêtre de contexte | Jusqu’à 1,000,000 tokens |
| Jetons d’entrée max. | ~991.8K |
| Jetons de sortie max. | ~65.5K |
| Points forts | Raisonnement vision-langage, programmation, interaction GUI, flux de travail d’agent |
| Fonctionnalités intégrées | Appels de fonctions, sorties structurées, cache, recherche Web, API par lots |
| Compatibilité API | Compatible OpenAI via DashScope / Model Studio |
Qu’est-ce que Qwen3.7-Plus ?
Qwen3.7-Plus est le modèle phare multimodal équilibré de la génération Qwen 3.7 d’Alibaba. Tandis que Qwen3.7-Max se concentre sur le raisonnement textuel pur et le codage à long terme, Qwen3.7-Plus étend ces capacités grâce à une compréhension native des images et des vidéos, lui permettant de raisonner à la fois sur des informations visuelles et textuelles au sein d’un seul modèle.
Le modèle est conçu autour de l’idée d’un agent hybride interactif multimodal : il peut interpréter des captures d’écran, analyser des graphiques, comprendre des interfaces, générer du code à partir de références visuelles et utiliser des outils pour accomplir des tâches en plusieurs étapes. Cela le rend particulièrement attractif pour les agents d’IA, l’automatisation GUI et les flux de productivité où le contexte visuel est important.
Principales fonctionnalités de Qwen3.7-Plus
- Entrée multimodale native prenant en charge le texte, les images et la vidéo dans une chaîne de raisonnement unifiée.
- Fenêtre de contexte jusqu’à 1M-token, permettant l’analyse de vastes bases de code et des workflows sur de longs documents.
- Capacités d’agent hybrides GUI + CLI, permettant au modèle de comprendre les écrans et d’interagir avec des environnements logiciels.
- Programmation avancée et utilisation d’outils, y compris les appels de fonctions, les sorties structurées et l’intégration d’outils externes.
- Compréhension visuelle des graphiques, documents et captures d’écran, utile pour des tâches métier, d’ingénierie et d’interface utilisateur.
- Point de terminaison API compatible OpenAI, facilitant la migration depuis une infrastructure LLM existante.
Performances de référence de Qwen3.7-Plus
Selon les rapports de benchmarks publics et les plateformes d’évaluation tierces, Qwen3.7-Plus offre des performances de pointe en multimodalité et sur les capacités agentiques :
- Artificial Analysis Intelligence Index : 53.3.
- GPQA Diamond : environ 90.0%.
- IFBench : environ 78.0%.
- AA Long Context Reasoning (AA-LCR) : environ 65.0%.
- Terminal-Bench Hard : environ 47.0%, reflétant de solides capacités de codage agentiques.
Alibaba indique également que Qwen3.7-Plus est compétitif face aux principaux modèles propriétaires sur les benchmarks d’agent et de codage, avec une force particulière sur les tâches multimodales et l’interaction avec l’interface utilisateur.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Caractéristique | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Modalités d’entrée | Texte, image, vidéo | Texte uniquement | Texte, image |
| Fenêtre de contexte | Jusqu’à 1M tokens | 1M tokens | Contexte large |
| Compréhension visuelle | Excellente | Non pris en charge | Solide |
| Interaction agent / GUI | Focalisation native | Limitée | Bonne |
| Raisonnement textuel à long terme | Très solide | Meilleur de la famille Qwen | Excellent |
| Meilleur cas d’usage | Agents multimodaux et productivité | Programmation, maths, raisonnement profond | Raisonnement et programmation d’entreprise |
Pour les projets impliquant des captures d’écran, l’automatisation d’interface, le débogage visuel ou des workflows multimodaux, Qwen3.7-Plus est généralement le meilleur choix. Pour le raisonnement purement textuel ou le codage à l’échelle d’un dépôt, Qwen3.7-Max reste l’option la plus performante.
Limitations
- Qwen3.7-Plus est actuellement publié en tant que modèle propriétaire en phase d’aperçu, et certaines capacités peuvent évoluer avant la version stable.
- Les appels de fonctions et certains outils d’agent sont encore en cours de déploiement.
- Pour des charges de travail purement textuelles et intensives en raisonnement, Qwen3.7-Max peut offrir des performances légèrement supérieures.
- Comme pour la plupart des grands modèles multimodaux, les développeurs devraient valider les performances sur leurs propres jeux de données d’images et d’interface avant la mise en production.
Cas d’utilisation représentatifs
- Agents IA combinant des interactions navigateur, GUI et terminal.
- Débogage logiciel à partir de captures d’écran et d’interfaces.
- Analyse de documents, de graphiques et de tableaux de bord.
- Assistants de programmation visuelle générant du code à partir de maquettes ou de diagrammes.
- Flux de productivité en entreprise impliquant des entrées mixtes texte et image.
- Assistants de recherche multimodaux combinant recherche Web et compréhension visuelle.