① Le mauvais parcours : on tâtonne
Un prompt sans cadrage ne donne pas ce qu'on veut → on relance, on précise. Et comme l'API est sans mémoire, chaque relance renvoie tout l'historique : les tokens d'entrée — donc le coût et l'empreinte — gonflent à chaque tour.
② Le bon parcours : on cadre
Un seul prompt, conçu pour livrer directement le résultat visé.
③ Le verdict
Le coût est exact (vrais tokens × tarifs). L'empreinte est une estimation, ordre de grandeur (EcoLogits, taille de modèle supposée).
③ bis — Comparateur multi-modèles
Même prompt, plusieurs modèles côte à côte : Claude, d'autres
fournisseurs cloud (OpenAI, Gemini, Mistral — si tu as saisi leur clé)
et des modèles locaux via Ollama. On compare coût, empreinte, perf et
qualité. Le local ne facture rien par appel et garde les données chez toi,
mais consomme l'élec de ta machine et répond souvent moins bien.
⚠️ Empreintes = estimations (méthodes différentes selon cloud / local), à lire
comme des ordres de grandeur ; pour les modèles très récents l'empreinte passe par un
modèle proche (« approchée »). Le mix électrique choisi s'applique partout.
③ ter — Quel modèle choisir ? (optimisation RO)
La Recherche Opérationnelle transforme « quel modèle ? » en problème d'optimisation multi-critères : minimiser le coût et l'empreinte, maximiser la qualité. Règle les priorités, fixe une qualité minimale, et l'outil recommande le meilleur compromis + indique le front de Pareto (les modèles « non dominés »).
Le « score » est une utilité pondérée (0-100) selon tes priorités. « Pareto ★ optimal » = aucun autre modèle n'est meilleur à la fois en coût, empreinte et qualité.
④ Et à l'échelle d'une organisation ?
Lance d'abord un parcours : la projection utilisera son coût et son empreinte.