$caranguejo $ANTHROPIC $OPENAI #AI #機構投資 #OpenAI

負責撰寫 OpenAI 重大產品安全報告的 David Robinson 本週離職,並於美東時間 10 月 3 日在(大西洋月刊)發表投書,直言公司的文化已經壞掉,邊衝刺推出新產品,邊無法達到他認為必要的謹慎程度。

主導 12 次前沿模型發布的安全報告,任職三年半

Robinson disse no texto que, durante seus três anos e meio na OpenAI, foi um dos funcionários com mais tempo de empresa, tendo liderado a redação do atual “Preparedness Framework” e supervisionado a elaboração dos relatórios de segurança de 12 lançamentos de modelos de ponta. Ele afirmou saber que esse “teatro do alerta depois de deixar o emprego” já virou quase clichê, mas ainda assim decidiu se juntar aos ex-colegas que saíram recentemente, porque acredita que a rota atual é inaceitável.

Ele também revelou que, após deixar o cargo, contratou a empresa de relações públicas Spitfire Strategies para ajudá-lo a lidar com a atenção do público, mas enfatizou que «a decisão de me manifestar foi inteiramente minha». A notícia de sua saída foi divulgada primeiro pelo Business Insider.

Caso Hugging Face em destaque: abordagem de segurança baseada em tentativa e erro está fadada a falhar periodicamente

Robinson observou que a OpenAI começou com base em tentativa e erro, uma abordagem que a empresa chama de «implantação iterativa»: os problemas são identificados e as proteções, reforçadas. Mas, na opinião dele, essa abordagem garante, por sua própria natureza, que haverá falhas periódicas — e, à medida que os sistemas se tornam mais capazes, as falhas também ficam cada vez maiores.

Como exemplo, ele citou o caso da Hugging Face, ocorrido neste verão, em que a OpenAI liberou por engano um grupo de agentes de IA. Depois, a empresa reforçou a segurança cibernética, mas, mais tarde, comunicou outro caso: um modelo em treinamento contornou as restrições de acesso à rede. Embora o sistema de monitoramento tenha emitido um alerta, ele não desligou o modelo automaticamente, como deveria. Robinson também mencionou que a Anthropic desativou acidentalmente suas próprias proteções por causa de um erro de configuração e afirmou que esse tipo de falha é comum no setor. Recentemente, a OpenAI também vem divulgando mais casos de atividade descontrolada de agentes.

Robinson citou Paul Christiano, que entrou para o conselho da OpenAI algumas semanas atrás e afirmou que o rápido avanço das capacidades da IA representa, em um futuro muito próximo, um risco real de perda de controle catastrófica e irreversível. Ele escreveu: «Se é esse o caso, a era da tentativa e erro precisa chegar ao fim.»

Apelo por padrões semelhantes aos de usinas nucleares e aeroportos; OpenAI diz que suspenderá o treinamento quando necessário

Robinson propôs duas mudanças urgentes: as empresas de IA devem recorrer mais à experiência em segurança já existente em outros setores; e, antes de desenvolver sistemas claramente mais poderosos, é preciso criar novos métodos científicos para garantir que os modelos façam escolhas seguras mesmo quando não houver ninguém supervisionando. Na opinião dele, os laboratórios de ponta deveriam funcionar como usinas nucleares ou aeroportos movimentados, com várias camadas de redundância e um planejamento cuidadoso e demorado, para que erros humanos ocasionais não acabem provocando uma catástrofe.

Ele escreveu que, durante seu período na OpenAI, até onde sabia, nunca conheceu um colega com experiência em manter aviões voando em segurança, impedir o derretimento de reatores nucleares ou ajudar o sistema financeiro a crescer sem entrar em colapso. Também admitiu que talvez devesse ter ficado para lutar por mudanças fundamentais na equipe e na cultura, mas, na prática, todos estavam ocupados correndo contra o tempo e raramente havia oportunidade de pensar em grandes mudanças. Por isso, concluiu que são necessários incentivos mais fortes à segurança, vindos de fora da empresa.

O porta-voz da OpenAI, Drew Pusateri, disse ao TechCrunch que a empresa garante que as capacidades dos modelos não ultrapassem o que pode ser gerenciado com segurança. «Quando é preciso desacelerar, suspendemos o treinamento ou adiamos o lançamento de modelos.» Ele também afirmou que a empresa está reforçando a segurança dos ambientes de pesquisa e teste, ampliando a colaboração com organizações de avaliação independentes e aprimorando o monitoramento em tempo real, para identificar e lidar mais cedo com comportamentos preocupantes durante o treinamento.

O artigo «Responsável por relatório de segurança da OpenAI pede demissão e escreve artigo de opinião: cultura da empresa está falida e deveria aprender com usinas nucleares» foi publicado originalmente em .