Modèles et fournisseurs
Comment fonctionne la tarification des modèles d'IA ?
L'unité de base : qu'est-ce qu'un token ?
Les modèles de langage ne lisent ni n'écrivent en mots, mais en tokens - de petits fragments de texte. En moyenne, un token vaut environ quatre caractères, soit environ trois quarts d'un mot anglais ; les langues à mots longs génèrent plus de tokens par mot. Chaque requête et chaque réponse est découpée en tokens et comptée.
- Token = plus petite unité de facturation dans la tarification IA à l'usage.
- Règle empirique : ~1 000 tokens valent environ 750 mots anglais ; un peu moins en français.
- Pas seulement du texte : images, audio et pièces jointes sont aussi convertis en équivalents tokens.
Abonnement application ou API : deux mondes de facturation
Pour les utilisateurs finaux, il existe généralement une application de chat (comme ChatGPT, Claude ou Gemini) avec un abonnement mensuel fixe. Vous payez un forfait et utilisez le modèle dans des limites d'usage raisonnable, quel que soit le nombre de tokens consommés en interne. Pour les développeurs et produits, il y a l'API : vous payez les tokens réellement utilisés, mais pouvez intégrer le modèle dans votre logiciel.
- Abonnement (app) : prix fixe prévisible, sans configuration, idéal pour un usage personnel et occasionnel.
- API : coût variable selon l'usage, automatisation complète, idéale pour les produits et gros volumes.
- Les offres business et entreprise combinent les deux et ajoutent administration, gestion des accès et engagements de protection des données.
- Certains fournisseurs proposent une facturation au message ou des modèles de crédit prépayé en solution intermédiaire.
Pourquoi les tokens d'entrée et de sortie coûtent différemment
Dans l'API, les tokens d'entrée (votre prompt plus le contexte fourni) et les tokens de sortie (la réponse générée) sont tarifés séparément. Les tokens de sortie sont presque toujours plus chers, car générer du texte demande plus de calcul que le lire. Essentiel pour le contrôle des coûts : tout le contexte envoyé - instruction système, historique, documents téléversés - est recompté comme entrée à chaque requête.
- Fenêtre de contexte = nombre maximal de tokens traités par requête ; de plus grandes fenêtres permettent plus de contexte, mais chaque token envoyé coûte.
- Les longues conversations deviennent coûteuses, car l'historique est renvoyé en entrée à chaque nouveau message.
- Des prompts plus courts et ciblés et une sélection du contexte réduisent directement les coûts.
Remises, mise en cache et coûts cachés
Les fournisseurs offrent des mécanismes pour réduire les coûts - et des facteurs qui les augmentent discrètement. La mise en cache des prompts facture le contexte récurrent à tarif réduit, et le traitement par lots remise les requêtes massives non urgentes. À l'inverse, les modèles de raisonnement récents peuvent générer des tokens de réflexion supplémentaires, souvent invisibles, également facturés comme sortie.
- Mise en cache des prompts : le contexte réutilisé (ex. une longue consigne) est facturé à tarif réduit.
- Mode batch/asynchrone : remise pour les tâches sans exigence de temps réel.
- Tokens de raisonnement : les étapes internes des modèles avancés augmentent discrètement les tokens de sortie.
- Le choix du modèle est le plus grand levier : les petits modèles coûtent souvent bien moins par token que les modèles phares.
Estimer les coûts de l'IA : un modèle mental simple
Pour une estimation API approximative, une chaîne suffit : tokens d'entrée estimés plus tokens de sortie estimés par requête, multipliés par le nombre de requêtes par mois, multipliés par les prix des tokens publiés par le fournisseur. Calculez entrée et sortie séparément, car les tarifs diffèrent. Pour les applications, comparez plutôt le prix de l'abonnement à la valeur attendue par utilisateur actif.
- Formule API : (tokens entrée + tokens sortie) x requêtes x prix du token = coût mensuel approximatif.
- Commencez par un modèle plus petit et ne passez au plus grand qu'en cas de besoin avéré.
- Fixez des limites de sortie, des quotas d'usage et des alertes de coût avant la mise en production.
- Ne citez jamais les tarifs actuels de mémoire - vérifiez toujours la page de tarifs du fournisseur.
Perspective suisse : monnaie, protection des données et gouvernance
La plupart des grands fournisseurs d'IA facturent en dollars américains ; les budgets suisses doivent ajouter le taux de change et, selon les cas, la TVA, si bien que les coûts finaux en CHF peuvent varier. Au-delà du prix, le traitement compte : introduire des données personnelles dans les prompts relève de la nouvelle loi sur la protection des données (revDSG/nLPD) et de la surveillance du PFPDT (EDOEB). L'EU AI Act s'applique de façon extraterritoriale et peut concerner des fournisseurs suisses actifs sur le marché de l'UE.
- Budgétisez en CHF avec une marge pour les fluctuations de change et d'éventuelles taxes.
- Clarifiez la localisation des données, les conditions de traitement et si vos entrées servent à l'entraînement.
- Des options souveraines comme le modèle suisse ouvert Apertus (ETH/EPFL) peuvent renforcer protection des données et maîtrise des coûts.
Questions fréquentes
Combien coûte un token ?
Aucun chiffre unique n'est fiable, car les prix varient fortement selon le modèle, le fournisseur et entre entrée et sortie, et changent souvent. Les prix sont généralement indiqués par million de tokens. Pour les tarifs actuels, consultez toujours la page de tarifs officielle du fournisseur.
L'abonnement ou l'API, lequel est moins cher ?
Cela dépend des usages. Pour un usage personnel régulier via une interface de chat, l'abonnement forfaitaire est généralement plus prévisible et économique. Pour un usage automatisé, intégré au logiciel ou très variable, l'API à l'usage est souvent plus rentable : vous ne payez que ce que vous consommez.
Pourquoi les tokens de sortie coûtent-ils plus que ceux d'entrée ?
Parce que générer du texte demande plus de calcul que le lire. Le modèle calcule chaque token de sortie l'un après l'autre, alors que le contexte d'entrée est traité en une seule passe. C'est pourquoi les fournisseurs affichent généralement un prix par token plus élevé pour la sortie.
Qu'est-ce que la fenêtre de contexte et influe-t-elle sur le prix ?
La fenêtre de contexte est le nombre maximal de tokens qu'un modèle considère à la fois par requête. Une fenêtre plus grande permet des documents et historiques plus longs, mais ne coûte que si vous la remplissez : vous payez les tokens utilisés, pas la taille de la fenêtre.
Que sont les tokens de raisonnement ?
Les modèles récents à fort raisonnement produisent des étapes de réflexion internes avant la réponse. Ces tokens de raisonnement sont souvent invisibles mais facturés comme des tokens de sortie. Sur des tâches complexes, cela peut augmenter nettement les coûts - une raison d'accorder soigneusement le modèle à la tâche.
Comment budgétiser les coûts d'IA pour une entreprise ?
Estimez les tokens d'entrée et de sortie par opération type, multipliez par le volume attendu et par les prix actuels du fournisseur. Commencez par un modèle plus petit, fixez des limites de coût et des alertes, et budgétisez en CHF avec une marge de change. Vérifiez aussi les exigences de protection des données selon la revDSG avant de traiter des données personnelles.
Termes du glossaire
L’IA pratique pour votre entreprise
De l’idée à la mise en œuvre – nous vous montrons ce qui est concrètement possible dans votre cas.
Demander une démo