Il y a deux jours, 1,6 milliard de tokens ont été consommés, et tout était du GPT-5.6 Sol.
En se basant sur les prix d’Input de l’API (5 $ / million de tokens) = 8 000 $
Tout a également été mis en cache, pour 800 $
En une journée : un développeur.
En même temps, quelqu’un soupire : à chaque fois qu’il a envie de monter un environnement d’inférence local et de regarder la taille des paramètres des modèles open source ne cesse d’augmenter, il renonce. Dépenser quelques dizaines de milliers de dollars pour un effet plus que mitigé, c’est moins bien qu’être simplement honnête et payer un abonnement mensuel.
Ces deux choses parlent du même fait : l’économie de l’inférence de l’IA se segmente.
Soit vous payez un abonnement mensuel pour utiliser le modèle frontier le plus cher, et profiter du meilleur rendu
Soit vous dépensez quelques dizaines de milliers pour faire de l’inférence locale : le rendu est moins bon, et vous devez aussi tout maintenir
La zone intermédiaire est en train de disparaître
Pour les investisseurs : le plancher du coût de l’inférence est fixé par le modèle le plus cher, et le plafond par la propension des utilisateurs à payer. Tant que la proportion d’appels au modèle frontier diminue, la pression sur les coûts d’inférence se relâche — mais attention à ne pas mal interpréter : la consommation totale augmente de façon exponentielle.
#AI #GPT #Coût de l’inférence