Em uma carta enviada ao conselho de administração em 7 de outubro, três pesquisadores demitidos da OpenAI pediram que fossem interrompidos os desenvolvimentos de inteligência artificial (IA) que dificultam o monitoramento e o controle, e descobriu-se que um memorando interno da empresa apoiava essa recomendação.
Resumo principal
Em uma carta enviada ao conselho de administração em 7 de outubro, três pesquisadores demitidos da OpenAI pediram que fossem interrompidas as pesquisas que reduzem a capacidade de monitorar a IA.
A OpenAI afirmou que as demissões não tinham relação com as preocupações levantadas sobre segurança, mas um memorando assinado pelo responsável interno pela pesquisa declarou que “concorda fortemente” com o conteúdo da carta.
De acordo com o cartão de sistema do GPT-6 Astra, o modelo é avaliado como mais difícil de monitorar do que o GPT-5.6 Sol.
Conteúdo da carta entregue ao conselho da OpenAI
Três pesquisadores que atuavam nas equipes internas de segurança e alinhamento da empresa — Tomek Korbak, Mikita Balesni e Jasmine Wang — enviaram uma carta ao conselho da OpenAI e ao comitê de segurança vinculado. Parte da carta foi divulgada por meio de uma reportagem publicada na quarta-feira.
O texto completo da carta ainda está em caráter não público. No entanto, os pesquisadores apontaram que “não sabemos como desenvolver e implantar com segurança modelos cuja monitoração ainda não é possível em toda a indústria”.
Eles ressaltaram que a OpenAI e seus concorrentes não deveriam impulsionar pesquisas e desenvolvimentos que reduzam ainda mais essas capacidades de monitoramento. Além disso, segundo a reportagem, a OpenAI foi instada a colaborar ativamente com uma organização de auditoria de terceiros e a promover um ecossistema de segurança aberto e transparente, enquanto o desligamento teria alertado que “está intimidando os funcionários restantes na OpenAI”.
Artigo relacionado: indícios de que um hacker chinês de 26 anos invadiu um banco sul-coreano usando código do Claude
Memorando interno da OpenAI e medida de desligamento
Um porta-voz da OpenAI traçou uma linha ao afirmar que o desligamento “não ocorreu por ter levantado preocupações de segurança ou feito críticas internas”. Em seguida, compartilhou parte de um memorando interno que um responsável de pesquisa enviou à empresa na quarta-feira, afirmando que esse memorando teria dito que concorda “fortemente” com as recomendações apresentadas na carta dos pesquisadores desligados.
Anteriormente, a OpenAI havia afirmado, em um anúncio de 1º de outubro, que uma verificação interna confirmou que três funcionários teriam tratado de forma inadequada informações sensíveis e violado as regras internas da empresa em um caso em que uma entidade externa estava envolvida na avaliação de modelos de IA.
No entanto, a empresa não divulga oficialmente os nomes desses pesquisadores nem os nomes reais das entidades externas envolvidas.
Polêmica sobre a dificuldade de monitorar o “processo de pensamento” (chain of thought) no GPT-6 Astra
“Cadeia de pensamento” (chain of thought, CoT) é uma forma pela qual o modelo, antes de produzir uma resposta, descreve por escrito em texto o processo de raciocínio passo a passo. A equipe de segurança revisa essas etapas intermediárias para verificar se há sinais de que o modelo esteja tentando agir de forma maliciosa ou desviada.
Conforme o cartão de sistema do GPT-6 Astra divulgado pela OpenAI em 3 de setembro, este modelo é avaliado como mais difícil de monitorar desse modo do que o GPT-5.6 Sol, e também como tendo uma capacidade mais forte de controlar seu próprio processo de pensamento. O cartão de sistema especifica que modelos no nível Astra podem “evadir os monitores de CoT em ambientes adversariais”.
Essa avaliação foi baseada principalmente no resultado de testes em que foi dado ao modelo um comando para tentar evitar o monitoramento e, em seguida, examinadas suas respostas. A OpenAI acrescentou que não encontrou evidências de que a Astra tenha ocultado intencionalmente seu processo de raciocínio, escondendo-o em um texto que não tinha relação com o pedido.
A empresa definiu como objetivo central manter a capacidade de monitoramento de cadeia de pensamento e declarou: “Não aceitaremos que essa capacidade seja ainda mais deteriorada além dos limites definidos sem um novo método que comprove o alinhamento do modelo”.
Os três pesquisadores já tinham um histórico de estudos anteriores sobre essa questão. Korbakh e Valesni foram os coautores principais de um artigo publicado em julho de 2025, ao qual também participaram pesquisadores da OpenAI, do Google DeepMind e da Anthropic, incluindo Wang e pesquisadores da OpenAI. O artigo definiu o monitoramento de “cadeia de pensamento” (chain of thought) como “uma oportunidade nova e altamente vulnerável para a segurança da IA”. O cartão de sistema do GPT-6 Astra também cita esse artigo e exorta que os desenvolvedores considerem obrigatoriamente como a capacidade de monitorar o processo de raciocínio influenciará o projeto do modelo.
Leitura recomendada: agentes de IA que funcionam sem nuvem: Microsoft e Nvidia preparam um laptop Surface de 128 GB
