Promptfoo est un outil CLI open source pour tester, évaluer et mener des exercices de red teaming sur des prompts, modèles et applications LLM. Associé à CometAPI — une API unifiée compatible OpenAI pour 500+ modèles — il permet aux développeurs de tester GPT, Claude, Gemini, Grok, DeepSeek, et plus encore avec une clé unique, souvent à un coût inférieur de 20 à 40 % par rapport aux fournisseurs directs. Ce guide couvre l’installation, les configurations, l’usage avancé et des bénéfices étayés par des données réelles.
Résumé optimisé pour extrait en vedette
Promptfoo est un outil CLI open source pour tester, évaluer et mener des exercices de red teaming sur des prompts, modèles et applications LLM. Associé à CometAPI — une API unifiée compatible OpenAI pour 500+ modèles — il permet aux développeurs de tester GPT, Claude, Gemini, Grok, DeepSeek, et plus encore avec une clé unique, souvent à un coût inférieur de 20 à 40 % par rapport aux fournisseurs directs. Ce guide couvre l’installation, les configurations, l’usage avancé et des bénéfices étayés par des données réelles.
Qu'est-ce que Promptfoo ?
Promptfoo est un CLI et une bibliothèque open source éprouvés pour le développement LLM piloté par les tests. Au lieu d’essais et erreurs manuels, il automatise les évaluations à travers prompts, modèles, systèmes RAG et agents. Capacités clés :
- Comparaisons de modèles côte à côte avec vues matricielles.
- Assertions automatisées (correspondance exacte, regex, LLM-as-judge, similarité sémantique, etc.).
- Red teaming pour des vulnérabilités comme l’injection de prompts, les jailbreaks et les risques de marque (50+ types de plugins).
- Intégration CI/CD, cache, concurrence et rechargement à chaud.
- Prise en charge de 60+ fournisseurs, scripts personnalisés et endpoints HTTP.
Statistiques d’adoption (2026) : Utilisé par 156 entreprises du Fortune 500, alimente des applications servant des millions d’utilisateurs, et est approuvé par des équipes chez Shopify et plus. Sous licence MIT avec une forte dynamique communautaire.
Promptfoo remplace le « it works on my machine » par des benchmarks reproductibles et quantifiables — essentiels à mesure que les applications LLM passent en production.
Pourquoi utiliser CometAPI avec Promptfoo ?
CometAPI est une API unifiée pensée pour les développeurs, agrégeant 500+ modèles de pointe (LLMs, image, vidéo, embeddings) d’OpenAI, Anthropic, Google, xAI, DeepSeek et d’autres. Elle est entièrement compatible OpenAI, donc le code existant fonctionne avec un simple changement de base_url.
Avantages clés de la combinaison :
- Énorme variété de modèles sans gestion de clés : Testez des variantes GPT-5, Claude Opus 4.x, Gemini 3.x, Grok 4, DeepSeek V4, Flux, DALL-E, des modèles de type Sora, etc., avec une seule clé. Plus de jonglage de comptes.
- Économies significatives : CometAPI prix les modèles au moins 20-40 % sous les tarifs officiels avec paiement à l’usage (sans abonnement). Des retours d’utilisateurs et benchmarks réels montrent des économies constantes par rapport au direct ou à des concurrents comme OpenRouter.
- Prise en charge native par Promptfoo : Provider dédié
cometapi:avec types chat, completion, embedding et image. Intégration fluide pour les évaluations et le red teaming. - Fiabilité et rapidité : 99.9% d’uptime, <400ms de latence moyenne, confidentialité entreprise (pas d’entraînement sur vos prompts), tableaux de bord d’usage et routage de bascule.
- Flexibilité pour les workflows d’évaluation : Faites des tests A/B de modèles de pointe à moindre coût, mesurez la précision RAG ou red-team des agents à travers fournisseurs sans exploser le budget.
En test à fort volume, passer à CometAPI via Promptfoo peut réduire drastiquement les coûts d’évaluation tout en élargissant la couverture. Par exemple, tester côte à côte plusieurs équivalents Claude/GPT devient trivial et abordable. Des équipes rapportent 20 %+ d’économies dès le premier jour, avec une portabilité totale (zéro verrouillage).
Contexte récent (2026) : Avec les sorties rapides de modèles (p. ex., Claude Opus 4-8, série GPT-5, avancées Gemini), des plateformes unifiées comme CometAPI + des outils d’évaluation comme Promptfoo sont essentiels pour rester agiles sans faire exploser les budgets. L’écosystème Promptfoo continue d’étendre le support des fournisseurs, y compris une intégration plus poussée de CometAPI.
Prérequis
- Node.js (v18+ recommandé) : Promptfoo est principalement basé sur Node.
- Compte & clé CometAPI : Inscrivez-vous gratuitement sur CometAPI pour des crédits de test. Récupérez la clé depuis console/token.
- Promptfoo installé :
npm install -g promptfoo
# Or npx promptfoo@latest for one-off use
- Familiarité de base avec YAML et le terminal.
- (Optionnel) Python pour des providers personnalisés, ou Docker pour l’isolation.
Vérifiez l’installation : promptfoo --version.
Comment configurer l’intégration Promptfoo avec CometAPI
1. Définir votre clé API CometAPI
export COMETAPI_KEY=your_actual_key_here
# Persist with .env or shell profile
Promptfoo la lit automatiquement pour le provider cometapi.
Définissez COMETAPI_KEY avant d’exécuter les évaluations :
read -rsp "CometAPI API key: " COMETAPI_KEY
printf '\n'
export COMETAPI_KEY
2. Choisir le format de provider CometAPI
Dans promptfooconfig.yaml :
providers:
- cometapi:chat:gpt-5-mini # Defaults to chat
- cometapi:chat:claude-3-5-sonnet-20241022
- cometapi:image:flux-schnell # Image gen
- cometapi:embedding:text-embedding-3-small
# Or shorthand
- cometapi:gpt-5.4-pro
Syntaxe complète : cometapi:<type>:<model>. Le type par défaut est chat. Prend en charge tous les paramètres OpenAI via config.
Utilisez ces types de provider :
| Type | Cas d'utilisation |
|---|---|
| chat | Complétions de chat, vision et invites multimodales |
| completion | Modèles de complétion de texte |
| embedding | Évaluations d’embeddings de texte |
| image | Évaluations de génération d’images |
Vous pouvez également utiliser cometapi:your-model-id pour le mode chat par défaut.
3. Exécuter une évaluation CLI rapide
# Simple one-off
npx promptfoo@latest eval --prompts "Write a haiku about AI" -r cometapi:chat:your-model-id
# With full config
promptfoo eval
Cela génère une visionneuse web avec scores, sorties et diffs.
4. Créer un fichier de configuration Promptfoo complet
Le promptfooconfig.yaml suivant évalue la même invite sur un modèle CometAPI :
prompts:
- "Classify this support request: {{message}}"
providers:
- id: cometapi:chat:your-model-id
config:
temperature: 0.2
max_tokens: 256
tests:
- vars:
message: "The API key works locally but fails in production."
assert:
- type: contains-any
value:
- authentication
- configuration
Exécutez le fichier de configuration avec Promptfoo :
npx promptfoo@latest eval -c promptfooconfig.yaml
Exécutez promptfoo redteam setup pour un scan automatisé des vulnérabilités.
Flux de travail détaillé pas à pas pour des évaluations robustes
- Définir les scénarios critiques métier : Créez des suites de tests reflétant l’usage réel (p. ex., support client, génération de code, tâches créatives).
- Itération de prompt engineering : Utilisez des variables (
{{var}}) et des invites basées fichiers. Suivez les versions. - Matrice de comparaison des modèles : Lancez des évaluations sur 5 à 10 modèles. Analysez coût, latence, scores qualité.
- Scoring et assertions : Combinez règles, juges LLM et évaluateurs JS/Python personnalisés.
- Intégration CI/CD : Ajoutez à GitHub Actions :
- name: Promptfoo Eval
run: promptfoo eval --ci
- Surveiller & itérer : Utilisez la visionneuse de Promptfoo + le tableau de bord CometAPI pour des insights de dépenses/latence.
Analyse d’exemple de sortie : Attendez-vous à des tableaux montrant des taux de victoire, p. ex., Claude meilleur en raisonnement, GPT en vitesse, DeepSeek en coût selon certaines tâches.
CometAPI vs. fournisseurs directs vs. alternatives dans Promptfoo
| Aspect | CometAPI + Promptfoo | Direct (OpenAI/Anthropic) | Autres agrégateurs (p. ex., OpenRouter) |
|---|---|---|---|
| Modèles disponibles | 500+ unifiés | Limité par fournisseur | Nombreux, mais variables |
| Tarification | 20-40% en dessous des tarifs officiels | Tarif plein | Officiels + frais |
| Gestion des clés | Clé unique | Multiples | Multiples |
| Latence/Disponibilité | <400ms, 99.9% | Variable | Variable |
| Prise en charge native Promptfoo | Oui, prise en charge complète | Oui | Partielle |
| Confidentialité | Pas d’entraînement sur les prompts | Selon le fournisseur | Variable |
| Idéal pour | Tests à large échelle et production | Verrouillage mono-fournisseur | Routage simple |
Insight de données : Pour 1M de tokens sur un modèle de milieu de gamme, CometAPI économise souvent $5-20+ par million par rapport au direct, ce qui s’accumule en boucles d’évaluation (centaines/milliers d’appels).
Dépannage des problèmes courants
- Erreurs de clé API : Vérifiez la variable d’environnement
COMETAPI_KEY(echo $COMETAPI_KEY). Contrôlez les crédits dans la console. - Modèle introuvable : Listez les modèles via
curl -H "Authorization: Bearer $COMETAPI_KEY"https://api.cometapi.com/v1/models. Utilisez les noms exacts. - Limites de débit : CometAPI gère intelligemment l’amont ; définissez
delaydans la config ou réduisez la concurrence. - Latence élevée en évaluations : Activez le cache (
cache: true). Utilisez des modèles plus petits pour les tests initiaux. - Échecs d’assertions : Ajustez les rubriques ou utilisez plus d’exemples. Les juges LLM peuvent être incohérents — moyennez plusieurs runs (
repeat: 3). - Problèmes image/vision : Assurez-vous que le modèle supporte la modalité ; fournissez des URLs valides.
- Parsing YAML : Validez avec le schéma Promptfoo ou des outils en ligne.
- Permissions/CORS : Pour HTTP personnalisé, vérifiez les headers.
Astuce : Exécutez promptfoo eval --verbose pour des logs détaillés. Consultez le statut/tableau de bord CometAPI pour les pannes.
Dépannage
Promptfoo ne trouve pas la clé API
Confirmez que COMETAPI_KEY est exportée dans la même session shell qui exécute promptfoo eval.
Le type de provider ne correspond pas au modèle
Utilisez chat pour les modèles conversationnels et multimodaux, embedding pour les modèles d’embedding, et image pour les modèles de génération d’images.
L’ID du modèle ne fonctionne pas
Remplacez your-model-id par un ID de modèle exact depuis la page des modèles CometAPI.
Conseils avancés et meilleures pratiques
- Optimisation des coûts : Commencez avec des modèles économiques (p. ex., GPT-5-mini ou DeepSeek via CometAPI) pour l’itération de prompts, puis validez avec des modèles premium.
- Providers personnalisés : Étendez avec JS/Python si besoin au-delà de CometAPI.
- Tests RAG & agents : Intégrez des variables de récupération et des appels d’outils.
- Sécurité : Red team en profondeur avant la production. Promptfoo + l’accent mis par CometAPI sur la confidentialité aident.
- Mise à l’échelle : Utilisez des runners cloud ou auto-hébergez Promptfoo pour de larges suites.
- Monitoring : Combinez avec les analyses CometAPI pour la dépense en tokens par modèle.
Recommandations CometAPI pour votre stack (depuis Cometapi.com) :
- Utiliser pour toutes les charges d’évaluation afin de minimiser les coûts.
- Exploiter le playground pour des tests rapides.
- Surveiller les alertes d’usage pour rester dans le budget.
- Explorer les modèles image/vidéo pour des évaluations multimodales dans Promptfoo.
Conclusion : améliorez dès aujourd’hui votre développement LLM
Intégrer CometAPI avec Promptfoo offre une solution puissante, économique et évolutive pour le développement IA moderne. Vous gagnez une flexibilité inégalée sur les modèles, des tests rigoureux, des économies de coûts et la tranquillité d’esprit via le red teaming automatisé — tout en gardant un contrôle total.
Commencez petit : configurez la clé, exécutez la configuration d’exemple, puis étendez votre suite de tests. Le temps et l’argent économisés se cumuleront à mesure que vos applications IA grandissent.
Prêt à implémenter ? Rendez-vous sur CometAPI pour votre clé gratuite et plongez dans la documentation Promptfoo. Pour du consulting personnalisé ou des configurations avancées sur Cometapi.com, explorez nos ressources.
