Coût d’inférence : exemple détaillé (ordre de grandeur)
Imaginez un agent de support pour un SaaS B2B : quatre cents conversations par jour, huit tours en moyenne, ~750 tokens en entrée et ~450 tokens en sortie par tour (approximatif — vos prompts varient). Cela représente environ 3 200 tours/jour × 1 200 tokens ≈ 3,8 M de tokens/jour → ~115 M de tokens/mois.
Les tarifs évoluent à chaque sortie de nouveaux modèles par les fournisseurs — considérez les chiffres ci-dessous comme des ordres de grandeur, et non comme une vérité comptable. Avec des tarifs mixtes illustratifs d'environ 4 $ par million de tokens pour un modèle de classe frontière (mélange entrée/sortie), les dépenses d'API brutes s'élèvent à quelques centaines de dollars par mois à cette échelle — avant la récupération, avant la redondance, avant la revue humaine des cas limites.
Doublez maintenant votre estimation pour les relances, les exécutions d'évaluation et les environnements de staging. Ajoutez ensuite 30 % de marge d'ego, car le marketing demandera des « réponses plus intelligentes » (des sorties plus longues) après le lancement.