Problemas nuevos llevaron las puntuaciones de la IA a 7,5% 🧪

Cuando miro los fundamentos quiero números que no se puedan manipular, y la IA ha pasado dos años informando números que sí.

En un benchmark de codificación muy usado, los modelos de vanguardia puntuaron en los 70 y 80, y cuando el K Prize evaluó modelos solo en problemas publicados después de su fecha límite, la puntuación ganadora fue 7,5%.

Cada proyecto de IA que se apoya en un ranking hereda esa brecha, incluyendo los tokens de IA que se negocian en $SOL, donde la puntuación es lo más fácil de citar y lo más difícil de comprobar.

OpenAI dejó de informar ese benchmark en febrero, alegando contaminación, que es la palabra cortés para decir que la prueba acabó en los datos de entrenamiento.

Sucede porque un benchmark tiene que publicarse para poder usarse, así que las respuestas se rastrean junto con todo lo demás, y un modelo que ya vio la prueba la está calificando desde su memoria.

Arcium saca la clave de respuestas de la circulación, dividiendo las respuestas de referencia en fragmentos a través de un clúster de nodos donde ningún nodo guarda una copia legible, mientras la calificación sigue devolviendo la puntuación correcta.

Esa puntuación se asienta en Solana como una transacción pública ordinaria, así que cada resultado queda con sello de tiempo y es comprobable, aunque la clave que lo respalda nunca se haya publicado.

El lado de la calificación puede ejecutarse hoy en Mainnet Alpha, activo desde el 2 de febrero con más de 2,5 millones de cómputos, mientras mantiene las preguntas selladas del modelo que se está evaluando es trabajo de Blackthorn, y Blackthorn aún no ha sido lanzado.

Un benchmark que se filtra deja de medir cualquier cosa en el momento en que se pone de moda, y mi lectura es que la evaluación sellada termina siendo una de las cosas más valiosas que el cómputo confidencial aporta a la IA.

#IA #Solana