Más de seis mil millones de solicitudes de IA se han reunido en un conjunto de datos público.
La plataforma de inferencia descentralizada Chutes, en colaboración con investigadores de la Universidad de Harvard, ha publicado un conjunto de datos de metadatos de servicios de modelos de lenguaje que podría ser, de entre los de su clase, uno de los de mayor escala. Los datos abarcan un año, del 11 de abril de 2025 al 12 de abril de 2026, e incluyen 6.122.413.756 solicitudes, 9.174 modelos y 310.497 usuarios anónimos; pueden descargarse a través de plataformas de alojamiento de código y del almacenamiento de la institución.
Lo publicado son metadatos, no contenido de los diálogos. Incluye tiempo, cantidad de tokens, latencia y el tiempo hasta la primera respuesta, pero no hay indicaciones ni respuestas. Este enfoque que solo recopila metadatos es, en sí mismo, un compromiso entre privacidad y capacidad de investigación.
En la carga de un año, los tokens de entrada suman aproximadamente 35,8 billones, y los de salida alrededor de 2,52 billones. Una de las conclusiones que aportan los investigadores es que cerca del 99% de las solicitudes se repiten dentro de los quince minutos. Estas cifras permiten al mundo estimar por primera vez la estructura de costes de un servicio de inferencia a partir del tráfico real.
Ese nivel de repetición tiene una importancia muy directa para la infraestructura. Si una gran cantidad de solicitudes se repite en poco tiempo, hay un amplio margen de optimización en el almacenamiento en caché y la planificación, en lugar de limitarse a acumular capacidad de cómputo. El valor que aporta la tasa de repetición podría ser mayor que el tamaño del modelo.
El problema más caro suele ser el que se repite muchas veces.
#人工智能 #datos
La plataforma de inferencia descentralizada Chutes, en colaboración con investigadores de la Universidad de Harvard, ha publicado un conjunto de datos de metadatos de servicios de modelos de lenguaje que podría ser, de entre los de su clase, uno de los de mayor escala. Los datos abarcan un año, del 11 de abril de 2025 al 12 de abril de 2026, e incluyen 6.122.413.756 solicitudes, 9.174 modelos y 310.497 usuarios anónimos; pueden descargarse a través de plataformas de alojamiento de código y del almacenamiento de la institución.
Lo publicado son metadatos, no contenido de los diálogos. Incluye tiempo, cantidad de tokens, latencia y el tiempo hasta la primera respuesta, pero no hay indicaciones ni respuestas. Este enfoque que solo recopila metadatos es, en sí mismo, un compromiso entre privacidad y capacidad de investigación.
En la carga de un año, los tokens de entrada suman aproximadamente 35,8 billones, y los de salida alrededor de 2,52 billones. Una de las conclusiones que aportan los investigadores es que cerca del 99% de las solicitudes se repiten dentro de los quince minutos. Estas cifras permiten al mundo estimar por primera vez la estructura de costes de un servicio de inferencia a partir del tráfico real.
Ese nivel de repetición tiene una importancia muy directa para la infraestructura. Si una gran cantidad de solicitudes se repite en poco tiempo, hay un amplio margen de optimización en el almacenamiento en caché y la planificación, en lugar de limitarse a acumular capacidad de cómputo. El valor que aporta la tasa de repetición podría ser mayor que el tamaño del modelo.
El problema más caro suele ser el que se repite muchas veces.
#人工智能 #datos
