Mais de 6,0 bilhões de solicitações de inteligência artificial foram organizadas em um conjunto de dados público.

A plataforma de inferência descentralizada Chutes, em colaboração com pesquisadores da Universidade Harvard, publicou um conjunto de dados de metadados de serviços de modelos — possivelmente o maior em escala entre seus pares. Os dados abrangem um ano, de 11 de abril de 2025 a 12 de abril de 2026, incluindo 6.122.241.376 solicitações, 9.174 modelos, e 310.490 usuários anônimos. Os arquivos podem ser baixados via plataformas de hospedagem de código e pelos repositórios da instituição.

O que foi divulgado são metadados, não o conteúdo das conversas. Há informações de horário, quantidade de tokens, latência e tempo até a primeira resposta. Não há prompts e nem respostas. Essa prática de publicar apenas metadados é, por si só, uma escolha entre privacidade e possibilidade de pesquisa.

No tráfego desse ano, os tokens de entrada somam cerca de 35,8 trilhões e os de saída cerca de 2,52 trilhões. Um dos resultados apresentados pelos pesquisadores é que aproximadamente 99% das solicitações são repetições dentro de quinze minutos. Esses números permitem, pela primeira vez, que o público estime a estrutura de custos de um serviço de inferência a partir do tráfego real.

Esse percentual tem um impacto bem direto para a infraestrutura. Já que muitas solicitações se repetem em curtos períodos, há grande espaço para otimizar cache e escalonamento, em vez de apenas empilhar capacidade de computação. O valor trazido pela taxa de repetição pode ser maior do que o ganho por escala de parâmetros.

A questão mais cara costuma ser aquela que é feita muitas vezes.

#人工智能 #dados