Optimiser vos coûts
Les dix réflexes qui font baisser la facture d’une application d’IA sans dégrader le résultat, classés du plus rentable au plus fin.
1. Choisir la bonne gamme de modèle
L’écart de prix entre deux gammes peut dépasser un facteur 10. Pour une même session de code, voici l’ordre de grandeur (voir Choisir un modèle pour la méthode) :
| Modèle | Gamme | Coût (200K tokens en entrée, 30K en sortie) |
|---|---|---|
Claude Opus 5.5claude-opus-5-5 | Phare | 1,40 $ |
GPT-6 Solgpt-6-sol | Frontière | 0,70 $ |
Claude Sonnet 5.5claude-sonnet-5-5 | Équilibrée | 0,35 $ |
DeepSeek V4 Prodeepseek-v4-pro | Frontière | 0,19 $ |
Gemini 3 Flashgemini-3-flash | Rapide | 0,19 $ |
DeepSeek V4 Flashdeepseek-v4-flash | Rapide | 0,06 $ |
GPT-6 Lunagpt-6-luna | Économique | 0,04 $ |
2. Activer le cache de prompts
Un préfixe répété coûte environ 8 fois moins cher à partir de quelques requêtes. Voir Cache de prompts.
3. Réduire ce que vous envoyez
- Retirez de l’historique les messages anciens ou inutiles, ou résumez-les.
- N’envoyez que les extraits de documents pertinents plutôt que le document entier.
- Raccourcissez les consignes système : elles sont renvoyées à chaque requête.
4. Plafonner la sortie
Fixez max_tokens à une valeur adaptée à la tâche. Le tarif de sortie est en général 5 fois supérieur à celui d’entrée : une réponse trop bavarde coûte cher.
5. Demander des réponses courtes et structurées
« Réponds par un JSON de trois champs » ou « Réponds en une phrase » coûte moins qu’un texte libre, et se traite plus facilement.
6. Router par difficulté
Envoyez les cas simples (classification, extraction) à un modèle de gamme rapide et réservez le modèle haut de gamme aux cas difficiles. Un premier appel peu cher peut aussi décider si un second appel plus coûteux est nécessaire.
7. Découper les tâches longues
Plusieurs requêtes ciblées, chacune avec le bon modèle, coûtent souvent moins qu’une seule requête géante sur le plus gros modèle.
8. Éviter les rejeux inutiles
Mettez en cache côté application les réponses à des questions identiques, et ne relancez pas une requête qui a échoué sans comprendre pourquoi (voir Codes d’erreur).
9. Utiliser le streaming pour les longues réponses
Le streaming permet d’interrompre une génération qui part dans la mauvaise direction : vous ne payez que les tokens réellement produits.
10. Mesurer
- Chaque réponse contient le champ
usage: enregistrez-le dans vos logs. - Le tableau de bord affiche le coût et les tokens par modèle et par jour.
- Comparez la consommation de deux modèles sur les mêmes cas avant de généraliser un choix.