Anteontem foram consumidos 1,6 bilhão de tokens, tudo em GPT-5.6 Sol.
Calculando pelo preço de Input de API ($5 por milhão de tokens) = $8.000
Mesmo se tudo for cacheado, ainda assim $800
Em um dia: um desenvolvedor.
Enquanto isso, alguém comentou: toda vez que a pessoa tenta montar um ambiente de inferência local, ver o tamanho dos modelos de código aberto só aumenta os parâmetros e já dá vontade de desistir. Gastar alguns milhares de dólares para ter um resultado mais fraco, cheio de limitações, não compensa — melhor pagar aluguel mensal.
Essas duas coisas falam do mesmo fato: a economia da inferência de IA está se dividindo.
Ou você paga aluguel mensal e usa o modelo frontier mais caro, com os melhores resultados
ou você gasta dezenas de milhares para fazer inferência local, com efeito reduzido e ainda precisa manter tudo
a faixa do meio está desaparecendo
Para investidores: o piso do custo de inferência é ancorado no modelo mais caro; o teto é ancorado na disposição do usuário em pagar. Desde que a proporção de chamadas do frontier model esteja diminuindo, a pressão sobre os custos de inferência vai aliviar — mas não interprete errado: o consumo total ainda cresce em escala exponencial.
#AI #GPT #推理成本