Um grupo internacional que inclui os Institutos Nacionais de Saúde, a Google, a Meta e o Chan Zuckerberg Biohub comprometeu-se na quarta-feira a investir quase 1,8 mil milhões de dólares em dados biológicos para IA.

Principais conclusões

  • Um grupo internacional comprometeu-se a investir quase 1,8 mil milhões de dólares na recolha e normalização de conjuntos de dados biológicos para modelos de IA

  • Os Institutos Nacionais de Saúde vão trabalhar com o Biohub para normalizar conjuntos de dados entre instituições

  • A Google DeepMind e a Isomorphic Labs são indicadas como parceiros de investigação colaboradores

  • Os conjuntos de dados biológicos demoram anos a recolher, limpar e validar, atrasando a aplicação prática em novos tratamentos

O financiamento apoiará a coleta e a padronização de conjuntos de dados biológicos estruturados especificamente para treinar modelos de IA capazes de prever e tratar doenças. O Google DeepMind e a Isomorphic Labs, empresa derivada do Google focada na descoberta de medicamentos, são citados como parceiros de pesquisa na colaboração.

De acordo com o comunicado, os Institutos Nacionais de Saúde, principal agência de pesquisa biomédica do governo dos EUA, trabalharão com a Biohub para padronizar esses conjuntos de dados, permitindo que modelos de IA sejam treinados com eles de maneira consistente entre instituições.

A Biohub, organização sem fins lucrativos fundada pelo cofundador do Facebook, Mark Zuckerberg, e pela pediatra Priscilla Chan, já se concentrou no mapeamento de atlas celulares e na pesquisa de doenças infecciosas.

O compromisso, de quase US$ 2 bilhões, está entre as maiores iniciativas individuais para enfrentar um problema apontado há anos por pesquisadores de IA: os dados biológicos estão fragmentados entre milhares de laboratórios e hospitais e armazenados em formatos inconsistentes, o que dificulta o treinamento de modelos com eles, em comparação com textos ou imagens extraídos da web aberta.

Leia também: O lançamento mais recente do Haiku, da Anthropic, reduz em 75% o custo de inferência

Por que os dados de biologia para IA são limitados por dados desorganizados

A questão central é se padrões compartilhados podem tornar os dados de biologia para IA coletados por diferentes laboratórios e hospitais suficientemente comparáveis para que os modelos aprendam padrões confiáveis sobre a biologia das doenças.

A dimensão do compromisso não responde a essa pergunta. A concordância sobre formatos, metadados e validação determinará se os conjuntos de dados poderão ser usados entre instituições.

Do AlphaFold a uma estrutura compartilhada para a biologia

O projeto AlphaFold, do Google DeepMind, mostrou que a IA podia prever estruturas de proteínas quando recebia dados de treinamento organizados, transformando a pesquisa em biologia estrutural após seus lançamentos anteriores.

Esta iniciativa amplia essa lógica para a previsão de doenças em geral, apostando que a infraestrutura de dados de biologia para IA, e não apenas modelos melhores, é o gargalo que ainda resta. A Isomorphic Labs usou a arquitetura do AlphaFold para buscar diretamente candidatos a medicamentos.

A longa espera pelos resultados

Os conjuntos de dados biológicos levam anos para serem coletados, organizados e validados, por isso é improvável que os benefícios práticos da iniciativa, na forma de novos tratamentos, cheguem rapidamente.

Observe quais áreas de doenças — câncer, neurodegeneração ou doenças infecciosas — receberão a primeira alocação e se os laboratórios participantes concordarão com padrões de dados compartilhados ou se fragmentarão ainda mais.

Leia a seguir: Lançamento do SynthID Detector abre a todos a verificação de conteúdo gerado por IA