Louer la machine ou acheter les tokens ? Nous avons dépensé 18 $ pour le savoir.

Chaque entreprise qui construit avec l’IA finit par affronter la même bifurcation d’achat : payer un fournisseur pour chaque unité de travail d’IA (tarification au token, comme un compteur de taxi), ou louer du matériel informatique dédié à l’heure et faire tourner un modèle ouvert soi-même (comme la location d’une voiture). Le débat se règle d’habitude à l’opinion. Nous l’avons réglé avec des factures.

Ce que nous avons fait

Nous avons pris deux modèles d’IA librement disponibles — un petit, un 50 fois plus grand — et déployé chacun sur du matériel GPU loué en un seul après-midi, sur une plateforme qui facture à la seconde et ne fait rien payer à l’inactivité. Nous avons ensuite fait passer environ 345 000 requêtes réelles à travers eux, dans un test contrôlé et reproductible, et comparé les coûts et vitesses obtenus à ceux des principaux fournisseurs au token servant les mêmes modèles. Budget de recherche total : environ 18 $.

Les trois constats qui comptent

1. C’est votre schéma de trafic — pas le modèle, pas le fournisseur — qui décide quelle option est la moins chère. La même heure de matériel loué a traité 122 000 requêtes un jour et 57 000 le lendemain. La seule différence : les requêtes du premier jour étaient répétitives, et l’infrastructure d’IA moderne reconnaît et réutilise le travail répété. Voici le piège commercial : les fournisseurs au token vous facturent plein tarif pour du travail réutilisé. Quand vous louez la machine, cette efficacité est votre économie ; quand vous payez au token, c’est la marge de votre fournisseur. Les entreprises dont les charges de travail d’IA sont répétitives — traitement de documents sur modèle fixe, extraction standardisée, assistants aux instructions fixes — paient systématiquement trop cher avec la tarification au token, et la plupart n’ont jamais mesuré de combien. Dans notre test, la différence était de 2,2x.

2. Les gros modèles ne sont plus proportionnellement plus coûteux à faire tourner. Notre modèle 50 fois plus grand, sur du matériel plus récent, coûtait le même prix par unité de travail que le petit — et trois fois moins par requête. L’intuition selon laquelle « les modèles sérieux exigent des budgets sérieux » est de plus en plus dépassée. Concrètement, cela signifie que des montées en capacité qui semblaient prohibitives sous les hypothèses de l’an dernier sont peut-être déjà abordables. Les hypothèses méritent une mise à jour, pas un renouvellement.

3. Aucune des deux options ne gagne absolument — et le chiffre décisif tient sur un post-it. Les plus gros fournisseurs au token mutualisent la demande de milliers de clients, atteignant une efficacité qu’aucune entreprise seule ne peut égaler. Face à leurs paliers les moins chers, louer du matériel n’atteint jamais le seuil de rentabilité. Mais face aux paliers premium — ceux vendus pour la vitesse et la fiabilité, jusqu’à 8 fois le prix — notre machine louée atteignait le seuil de rentabilité à 45 % d’utilisation et offrait des temps de réponse plus constants, avec zéro interruption pour limite de débit et zéro réponse corrompue (la route API standard a échoué 7 fois sur 300 dans notre test comparatif). Le chiffre décisif est simple : ce que votre volume mensuel d’IA coûterait au token, divisé par le prix de location du matériel. Votre équipe peut le calculer en une heure. Nous avons publié la méthode complète, gratuitement, pour qu’elle puisse le faire.

Ce que cela signifie pour votre organisation

Trois questions pour votre prochaine revue de budget IA :

  1. Quelqu’un a-t-il mesuré à quel point notre trafic IA est réellement répétitif ? (Si la réponse est non, vous ne savez pas encore ce que vous devriez payer.)
  2. Achetons-nous des paliers API premium pour la vitesse ou la fiabilité, que du matériel dédié livrerait moins cher à nos volumes ?
  3. Que nous achèterait notre dépense mensuelle actuelle en IA, en heures de matériel loué — et de quel côté du seuil de rentabilité sommes-nous ?

Il existe aussi une dimension stratégique que l’argent ne capture pas : faire tourner ses propres modèles signifie que vos données restent dans une infrastructure que vous contrôlez, que votre capacité ne peut pas être limitée pendant votre heure la plus chargée, et que votre fournisseur ne peut pas changer discrètement le modèle derrière votre produit. Ces risques apparaissent rarement dans les comparaisons de coûts. Ils sont apparus dans la nôtre.

L’époque où l’auto-hébergement de l’IA exigeait une équipe d’infrastructure est révolue — toute notre évaluation tenait en une commande à déployer et 18 $ à dépenser. La question n’est plus de savoir si votre organisation peut comparer les deux options. C’est de savoir si elle l’a fait.


D’après le benchmark de terrain de CognitX, juillet 2026 : deux modèles ouverts, trois heures de GPU, ~345 000 requêtes, méthodologie complète et données publiées dans l’article référencé.