Matemáticos questionam a fiabilidade dos 719 manuscritos matemáticos gerados pela IA da OpenAI, após a publicação de um artigo que afirma que a prova de Navier-Stokes publicada pela empresa não corresponde à versão verificada por computador.

Pontos-chave:

  • O catálogo da OpenAI passou de 722 para 719 manuscritos, após a retirada de três artigos devido a um erro de sinal.

  • Três matemáticos radicados no Reino Unido identificaram duas divergências entre a prova escrita de Navier-Stokes e o respetivo código Lean.

  • Os autores não consideram que a prova esteja errada, mas salientam que a verificação automática não substitui a revisão por pares.

Publicação dos resultados matemáticos da OpenAI

A 6 de outubro, a empresa publicou uma coleção de manuscritos, e um relatório divulgado na quinta-feira revelou que se desviara das diretrizes elaboradas por um painel independente de matemáticos para laboratórios de IA. O catálogo continha inicialmente 722 manuscritos. A OpenAI retirou três no dia seguinte, após a descoberta de um erro de sinal que invalidava um argumento, bem como de dois artigos que dependiam dele.

Estas recomendações, publicadas a 29 de setembro pelo Grupo Consultivo sobre Matemática e Inteligência Artificial, composto por nove membros, começam por pedir aos laboratórios que deixem de testar problemas de matemática avançada em modelos proprietários. Segundo o repositório da OpenAI, os artigos resultam da avaliação de um modelo interno não publicado, feita com problemas de investigação em aberto.

Os resumos do raciocínio do modelo acompanham apenas 10 resultados, e cerca de 42% dos enunciados principais foram formalizados em Lean, uma linguagem de programação que permite a um computador verificar uma prova.

Leia também: Quanto ganha o CEO da Anthropic? O pedido de abertura de capital dá a resposta

As falhas na prova de Navier–Stokes

Alexander Bastounis, do King’s College London, e Fabian Circelli e Anders Hansen, da Universidade de Cambridge, analisaram a prova de Navier–Stokes que a OpenAI anunciou em setembro. Identificaram duas divergências entre o argumento escrito e o código Lean, incluindo um caso em que o código demonstra apenas uma estimativa mais fraca do que a reivindicada no artigo.

Os autores esclarecem que não se pronunciam sobre a validade da prova escrita em si. A crítica é mais específica: o Lean confirma que o teorema final foi efetivamente demonstrado, escrevem, mas não garante a solidez dos passos intermédios lidos por um ser humano. Por isso, estas provas continuam a depender da revisão por pares.

O medalhado Fields Terence Tao escreveu a 6 de outubro que alguns problemas estão agora a ser «resolvidos» por «utilizadores de IA que escrevem prompts» e que compreendem demasiado pouco os resultados do modelo para responder a perguntas ou apresentar os resultados. A professora de Harvard Melanie Matchett Wood, membro do grupo consultivo, salienta que ninguém domina plenamente estes resultados no momento da sua publicação, «e é aí que o verdadeiro trabalho começa».

Controvérsia em torno das provas da OpenAI

O grupo consultivo insiste que só a comunidade matemática em sentido lato pode avaliar até que ponto a OpenAI cumpre as suas recomendações. Esta análise surge no fim de um mês tenso. A OpenAI anunciou o seu resultado sobre Navier–Stokes a 8 de setembro, desencadeando uma disputa de autoria com o matemático da Universidade de Nova Iorque Tristan Buckmaster. Três dias depois, 25 medalhados Fields publicaram uma declaração alertando para o risco de resultados produzidos em massa pela IA prejudicarem a disciplina.

A seguir: Os 722 artigos de matemática produzidos por IA da OpenAI são públicos; cabe à comunidade avaliá-los