Problemas Novos Levaram as Pontuações da IA a 7,5% 🧪

Quando olho para os fundamentos, quero números que não possam ser manipulados, e a IA passou dois anos divulgando números que podem ser.

Em um benchmark de codificação muito usado, modelos de ponta pontuaram na casa das dezenas de 70 e 80; e, quando o K Prize testou os modelos apenas em problemas enviados após seu prazo, a pontuação vencedora foi de 7,5%.

Todo projeto de IA que se apoia em um ranking herda essa lacuna, incluindo os tokens de IA negociados em $SOL, onde uma pontuação é o fundamento mais fácil de citar e o mais difícil de verificar.

A OpenAI parou de reportar esse benchmark em fevereiro, citando contaminação — uma forma educada de dizer que o teste acabou chegando ao conjunto de dados de treinamento.

Isso acontece porque um benchmark precisa ser publicado para ser usado, então as respostas são rastreadas junto com tudo o resto, e um modelo que já viu o teste está avaliando a própria memória.

A Arcium remove a chave de respostas de circulação, dividindo as respostas de referência em fragmentos em um cluster de nós em que nenhum nó único mantém uma cópia legível, enquanto a avaliação ainda retorna a pontuação correta.

Essa pontuação se assenta na Solana como uma transação pública ordinária, então cada resultado fica com carimbo de data e hora e pode ser verificado, mesmo que a chave por trás dele nunca tenha sido publicada.

O lado da correção pode rodar hoje na Mainnet Alpha, em funcionamento desde 2 de fevereiro, com mais de 2,5 milhões de computações, enquanto manter as perguntas lacradas do modelo que está sendo testado é o trabalho da Blackthorn — e a Blackthorn ainda não foi lançada.

Um benchmark que vaza deixa de medir qualquer coisa no momento em que fica popular, e minha leitura é que avaliação lacrada acaba sendo uma das coisas mais valiosas que a computação confidencial faz pela IA.

#AI #Solana