Anteayer se consumieron 1.6 mil millones de tokens, todo era GPT-5.6 Sol.
Calculado por el precio del Input de la API ($5 por millón de tokens) = $8,000
Aunque todo haya sido atendido por caché, también $800
Un día, un desarrollador.
Al mismo tiempo, alguien se lamentaba: cada vez que quiere montar un entorno de inferencia local y ver que los modelos open source tienen cada vez más parámetros, se le quitan las ganas. Gastar unos cuantos miles de dólares para obtener un efecto mediocre no compensa; mejor pagar el alquiler mensual con disciplina.
Estas dos cosas hablan del mismo hecho: la economía de la inferencia de la IA se está polarizando.
O pagas una renta mensual para usar el modelo frontier más caro y disfrutas del mejor rendimiento
O gastas unos cuantos miles para hacer inferencia local, con el rendimiento recortado y además encargándote de mantenerlo
El espacio intermedio se está desvaneciendo
Para los inversores: el límite inferior del costo de inferencia queda anclado por el modelo más caro; el límite superior, por la disposición de los usuarios a pagar. Mientras la proporción de llamadas al frontier model siga bajando, la presión sobre los costos de inferencia se aliviará—pero no lo malinterpretes: el consumo total sigue creciendo de forma exponencial.
#AI #GPT #Costos de inferencia