Problemas Novos Levaram as Pontuações da IA a 7,5% 🧪
Quando olho para os fundamentos, quero números que não possam ser manipulados, e a IA passou dois anos divulgando números que podem ser.
Em um benchmark de codificação muito usado, modelos de ponta pontuaram na casa das dezenas de 70 e 80; e, quando o K Prize testou os modelos apenas em problemas enviados após seu prazo, a pontuação vencedora foi de 7,5%.
Todo projeto de IA que se apoia em um ranking herda essa lacuna, incluindo os tokens de IA negociados em $SOL, onde uma pontuação é o fundamento mais fácil de citar e o mais difícil de verificar.
A OpenAI parou de reportar esse benchmark em fevereiro, citando contaminação — uma forma educada de dizer que o teste acabou chegando ao conjunto de dados de treinamento.
Isso acontece porque um benchmark precisa ser publicado para ser usado, então as respostas são rastreadas junto com tudo o resto, e um modelo que já viu o teste está avaliando a própria memória.
A Arcium remove a chave de respostas de circulação, dividindo as respostas de referência em fragmentos em um cluster de nós em que nenhum nó único mantém uma cópia legível, enquanto a avaliação ainda retorna a pontuação correta.
Essa pontuação se assenta na Solana como uma transação pública ordinária, então cada resultado fica com carimbo de data e hora e pode ser verificado, mesmo que a chave por trás dele nunca tenha sido publicada.
O lado da correção pode rodar hoje na Mainnet Alpha, em funcionamento desde 2 de fevereiro, com mais de 2,5 milhões de computações, enquanto manter as perguntas lacradas do modelo que está sendo testado é o trabalho da Blackthorn — e a Blackthorn ainda não foi lançada.
Um benchmark que vaza deixa de medir qualquer coisa no momento em que fica popular, e minha leitura é que avaliação lacrada acaba sendo uma das coisas mais valiosas que a computação confidencial faz pela IA.
#AI #Solana
Quando olho para os fundamentos, quero números que não possam ser manipulados, e a IA passou dois anos divulgando números que podem ser.
Em um benchmark de codificação muito usado, modelos de ponta pontuaram na casa das dezenas de 70 e 80; e, quando o K Prize testou os modelos apenas em problemas enviados após seu prazo, a pontuação vencedora foi de 7,5%.
Todo projeto de IA que se apoia em um ranking herda essa lacuna, incluindo os tokens de IA negociados em $SOL, onde uma pontuação é o fundamento mais fácil de citar e o mais difícil de verificar.
A OpenAI parou de reportar esse benchmark em fevereiro, citando contaminação — uma forma educada de dizer que o teste acabou chegando ao conjunto de dados de treinamento.
Isso acontece porque um benchmark precisa ser publicado para ser usado, então as respostas são rastreadas junto com tudo o resto, e um modelo que já viu o teste está avaliando a própria memória.
A Arcium remove a chave de respostas de circulação, dividindo as respostas de referência em fragmentos em um cluster de nós em que nenhum nó único mantém uma cópia legível, enquanto a avaliação ainda retorna a pontuação correta.
Essa pontuação se assenta na Solana como uma transação pública ordinária, então cada resultado fica com carimbo de data e hora e pode ser verificado, mesmo que a chave por trás dele nunca tenha sido publicada.
O lado da correção pode rodar hoje na Mainnet Alpha, em funcionamento desde 2 de fevereiro, com mais de 2,5 milhões de computações, enquanto manter as perguntas lacradas do modelo que está sendo testado é o trabalho da Blackthorn — e a Blackthorn ainda não foi lançada.
Um benchmark que vaza deixa de medir qualquer coisa no momento em que fica popular, e minha leitura é que avaliação lacrada acaba sendo uma das coisas mais valiosas que a computação confidencial faz pela IA.
#AI #Solana
