Plus de 6,8 milliards de requêtes d’intelligence artificielle ont été organisées en un jeu de données public.
La plateforme d’inférence décentralisée Chutes s’est associée à des chercheurs de l’université Harvard pour publier un ensemble de données de métadonnées de services de grands modèles, qui serait l’un des plus importants de sa catégorie. Les données couvrent un an, du 11 avril 2025 au 12 avril 2026, et comprennent 6 102 241 356 requêtes, 9 174 modèles et 310 497 utilisateurs anonymes. Elles peuvent être téléchargées via une plateforme d’hébergement de code et via le stockage de l’établissement.
Ce qui est rendu public, ce sont des métadonnées, pas le contenu des conversations. On y trouve l’heure, le nombre de tokens, la latence et le temps de première réponse, mais il n’y a ni invite (prompt) ni réponse. Cette approche qui ne publie que les métadonnées constitue, en soi, un compromis entre la confidentialité et la possibilité de faire de la recherche.
Sur une année de trafic, les tokens en entrée représentent environ 35,8 billions, et ceux en sortie environ 2,52 billions. Une conclusion proposée par les chercheurs est qu’environ 99 % des requêtes sont des doublons dans un intervalle de quinze minutes. Ces chiffres permettent pour la première fois au public d’estimer, à partir du trafic réel, la structure des coûts des services d’inférence.
Ce ratio a un impact très direct sur les infrastructures. Puisque de nombreuses requêtes sont répétées sur de courtes périodes, il existe de grandes possibilités d’optimisation via le cache et l’ordonnancement, plutôt que d’accumuler toujours plus de puissance de calcul. La valeur issue du taux de répétition pourrait être supérieure à celle liée à la taille des paramètres.
Le problème le plus coûteux est souvent celui qu’on pose de nombreuses fois.
#人工智能 #données
La plateforme d’inférence décentralisée Chutes s’est associée à des chercheurs de l’université Harvard pour publier un ensemble de données de métadonnées de services de grands modèles, qui serait l’un des plus importants de sa catégorie. Les données couvrent un an, du 11 avril 2025 au 12 avril 2026, et comprennent 6 102 241 356 requêtes, 9 174 modèles et 310 497 utilisateurs anonymes. Elles peuvent être téléchargées via une plateforme d’hébergement de code et via le stockage de l’établissement.
Ce qui est rendu public, ce sont des métadonnées, pas le contenu des conversations. On y trouve l’heure, le nombre de tokens, la latence et le temps de première réponse, mais il n’y a ni invite (prompt) ni réponse. Cette approche qui ne publie que les métadonnées constitue, en soi, un compromis entre la confidentialité et la possibilité de faire de la recherche.
Sur une année de trafic, les tokens en entrée représentent environ 35,8 billions, et ceux en sortie environ 2,52 billions. Une conclusion proposée par les chercheurs est qu’environ 99 % des requêtes sont des doublons dans un intervalle de quinze minutes. Ces chiffres permettent pour la première fois au public d’estimer, à partir du trafic réel, la structure des coûts des services d’inférence.
Ce ratio a un impact très direct sur les infrastructures. Puisque de nombreuses requêtes sont répétées sur de courtes périodes, il existe de grandes possibilités d’optimisation via le cache et l’ordonnancement, plutôt que d’accumuler toujours plus de puissance de calcul. La valeur issue du taux de répétition pourrait être supérieure à celle liée à la taille des paramètres.
Le problème le plus coûteux est souvent celui qu’on pose de nombreuses fois.
#人工智能 #données
