OUTIL GRATUIT · CALCUL QUADRATIQUE
Combien coûte votre agent IA en production
Le prix par appel est la partie visible et la moins importante. Ce qui fait la facture, c'est le nombre d'appels par tâche, le contexte réinjecté à chaque tour, et les reprises silencieuses.
Combien coûte votre agent IA en production
Coût estimé
- Coût par tâche
- —
- Tokens par tâche
- —
- Par jour
- —
- Par mois
- —
- Par année
- —
Estimation hors infrastructure, stockage vectoriel et supervision humaine. Les prix par million de tokens sont à saisir vous-même : ils changent trop souvent pour être figés dans un outil.
Le coût d'entrée croît de façon quadratique, pas linéaire
C'est l'erreur qui fait exploser les budgets. À chaque tour, un agent conversationnel renvoie tout l'historique de la conversation. Au sixième appel, il ne paie pas six fois le contexte initial : il paie la somme des six contextes cumulés, soit vingt et une fois le contexte d'un tour.
La formule est n(n+1)/2. Passer de trois à six appels par tâche ne double pas la facture d'entrée, il la triple et demie. C'est pourquoi une estimation faite en multipliant simplement le prix par appel se révèle systématiquement optimiste d'un facteur trois à cinq.
Les reprises que personne ne compte
Un agent en production relance des appels : format de sortie invalide, outil qui échoue, réponse rejetée par une validation. Ces reprises n'apparaissent nulle part dans une estimation faite au tableur, et représentent couramment quinze à trente pour cent de la facture.
Elles sont aussi le poste le plus facile à réduire. Contraindre le format de sortie par un schéma strict coûte quelques tokens de plus par appel et supprime une bonne partie des relances. C'est un arbitrage presque toujours gagnant.
Ce que ce calculateur ne couvre pas
L'infrastructure, le stockage vectoriel, la supervision humaine et le temps d'ingénierie ne sont pas comptés. Sur beaucoup de projets, ils dépassent le coût des modèles — surtout la supervision humaine, qui reste nécessaire tant que le taux d'erreur n'est pas descendu assez bas.
Les prix par million de tokens sont à saisir vous-même plutôt que codés en dur : ils changent trop souvent pour qu'un outil figé reste juste. Vérifiez-les chez votre fournisseur avant de bâtir un budget dessus.
Questions courantes
Pourquoi ne pas simplement multiplier le prix par appel ?
Parce que le contexte est réinjecté. Le coût d'entrée total d'une tâche à n appels vaut n(n+1)/2 fois le contexte d'un tour, pas n fois. C'est précisément l'écart entre une estimation naïve et la facture réelle.
Les prix par défaut correspondent-ils à un modèle précis ?
Non, volontairement. Trois et quinze dollars par million de tokens sont un ordre de grandeur courant pour un modèle de milieu de gamme. Remplacez-les par les tarifs réels de votre fournisseur : ils évoluent trop vite pour être figés.
Comment estimer mon taux de reprise ?
Si l'agent n'est pas encore en production, vingt pour cent est une hypothèse raisonnable pour un format de sortie non contraint, cinq à dix pour cent avec une validation stricte. Une fois en production, mesurez-le : c'est souvent la surprise du premier mois.
Mes chiffres sont-ils envoyés quelque part ?
Non. Tout le calcul se fait dans votre navigateur, sans requête réseau.
Un projet d'IA meurt rarement d'un mauvais modèle.
Il meurt d'un périmètre sans propriétaire, sans mesure et sans seuil d'échec acceptable. Le chiffrage est la partie facile — le cadrage décide du reste.