Arrêtez de comparer les fournisseurs de GPU. Comptez vos tokens.

Le tableur comparatif qui donne une impression de rigueur
Les équipes évaluent fréquemment les fournisseurs de cloud GPU en construisant des tableurs comparant les tarifs horaires entre plateformes comme Modal, RunPod et Hugging Face Endpoints. Si cette approche paraît rigoureuse, elle passe souvent à côté de la question fondamentale : cette charge de travail devrait-elle seulement tourner sur une infrastructure GPU dédiée ?
L’article soutient que « classer les prix des GPU répond à une question que la plupart des équipes ne se posent jamais à voix haute : cette charge de travail devrait-elle être sur un GPU dédié, pour commencer ? » La réalité est que le volume et le calendrier — pas la tarification du fournisseur — devraient piloter la décision d’infrastructure.
Pourquoi le tableur gagne quand même
Les coûts matériels sont visibles et faciles à comparer dans des tableurs, tandis que les schémas d’usage réels restent cachés. Ce biais de visibilité pousse les équipes à optimiser pour des métriques mesurables, aboutissant parfois à une infrastructure coûteuse qui sert un travail qui pourrait tourner à moindre coût sur des alternatives moins chères.
Les trois échelons
En dessous de 50 millions de tokens par mois : les API de modèles ouverts proposées par des fournisseurs comme DeepInfra, Together et Fireworks offrent une tarification au token d’environ « 0,03 à 0,04 $ par million » pour les grands modèles. Même la location de GPU grand public dépasse ces coûts, ce qui fait des API le choix rationnel pour les applications à faible volume.
Charges de travail en batch : les tâches de pipeline quotidiennes bénéficient de locations de GPU spot (environ 1 $ de l’heure) qui s’arrêtent une fois la tâche terminée, coûtant 30 à 90 $ par mois — moins cher à la fois que l’équivalent au token et qu’une infrastructure permanente.
Trafic soutenu à haut volume : quand l’utilisation dépasse 40 à 50 %, les GPU réservés deviennent économiques. Un H100 à « 2 $ de l’heure » faisant tourner des moteurs optimisés comme vLLM peut servir des milliards de tokens par mois pour environ 1 500 $ — battant la tarification au token à grande échelle.
Quatre situations qui priment sur tout le reste :
- Les modèles finement ajustés (fine-tunés) sur mesure exigent l’auto-hébergement
- Les restrictions de résidence des données nécessitent un déploiement sur site
- Les exigences contractuelles de latence de queue ou de fiabilité de sortie favorisent l’infrastructure dédiée
- Une expertise interne insuffisante justifie des services premium managés
Quatre questions avant de louer quoi que ce soit
- Quel était le volume de tokens réel du mois dernier (mesuré, pas projeté) ?
- Les tokens arrivent-ils en continu ou par rafales planifiables ?
- Les fournisseurs au token peuvent-ils servir votre modèle spécifique, légalement et techniquement ?
- Qui gère les incidents d’infrastructure ? Si personne, quel service premium justifie cet écart de coût ?
La conclusion est directe : « Comptez vos tokens avant de compter vos GPU. »