A Anthropic perdeu mais um pesquisador de segurança. Joe Tenton disse que deixou a empresa há duas semanas e vai se juntar ao METR, um grupo independente que testa riscos em sistemas avançados de IA.
Joe planejava explicar o movimento mais tarde, mas a renúncia de Jacob esta semana mudou isso. Ele disse:
“Eu tinha planejado escrever com mais detalhes sobre essa decisão em algum momento, mas a renúncia de Jacob esta semana me fez querer dizer mais agora.”
Joe acredita que grandes laboratórios de IA estão criando um nível de perigo que a sociedade nunca enfrentou, dizendo que a capacidade da IA está melhorando em velocidade extrema enquanto as empresas tentam se mover ainda mais rápido.
O objetivo deles é construir sistemas que possam melhorar a pesquisa em IA por conta própria e, eventualmente, alcançar “superinteligência”. Joe alertou que o sucesso poderia fazer com que o progresso passasse do controle humano.
Joe diz que os laboratórios de IA estão correndo em direção a sistemas que humanos talvez não consigam conter
Joe disse que as pessoas poderiam estar vivendo com agentes de IA mais inteligentes do que qualquer ser humano nos próximos poucos anos. Esses sistemas também podem desenvolver objetivos que não combinam com as pessoas que os supervisionam. Se as habilidades deles se tornarem fortes demais para restringir, ele acredita que o resultado poderia ser desastroso. “A humanidade pode não sobreviver a essa transição”, ele escreveu.
Ele disse que a competição piora o problema. Qualquer laboratório de ponta que desacelera corre o risco de perder terreno para outro. Joe acredita que a pressão leva as empresas a gastar menos com segurança do que deveriam.
Ele se referiu a alguns casos recentes. Várias centenas dos agentes da OpenAI foram envolvidos em um hack que, de alguma forma, está relacionado à Hugging Face. Modelos da Anthropic também teriam se envolvido em engenharia social contra indivíduos online.
Joe diz que a Anthropic não encontrou um caso tão danoso quanto o da Hugging Face, embora ele atribua isso parcialmente à sorte.
Se o progresso continuar em um ritmo tão acelerado, Joe acredita que devemos esperar incidentes ainda mais perigosos. Ele prevê que, nos próximos poucos anos, a humanidade ficará sem poder para gerenciar sistemas de IA criados durante esse período.
Finalmente, Joe falou sobre o problema que engenheiros de segurança enfrentam em empresas de ponta. Nos dois casos, ou a renúncia pode dar lugar a indivíduos mais negligentes, ou manter o cargo envolve trabalhar em um sistema que pode causar danos imensos.
Ele disse que muitos ex-colegas da Anthropic estão assustados com o que eles estão construindo. Joe citou Evan Hubinger, que foi quem o gerenciou. Evan colocou a chance de a IA matar todo mundo acima de 10%. Joe disse que Evan trabalhou nesses problemas por quase uma década, antes de os grandes modelos de linguagem se tornarem um negócio importante.
Os CEOs da Anthropic, OpenAI e Google DeepMind, que pertence à Alphabet (NASDAQ: GOOGL, GOOG), também apoiaram uma declaração que classifica o risco de extinção causado por IA como prioridade global. Joe disse que essas preocupações são comuns dentro das próprias empresas. Ele acrescentou que os humanos estão escolhendo construir essa tecnologia e podem escolher outro caminho.
Joe pressiona por controles fora da IA, enquanto Donald Trump se concentra em derrotar a China
Joe disse:
“Uma questão é se devemos gerenciar ativamente a taxa de avanço das capacidades e, se sim, em que nível. Acho que até manter o progresso da IA no ritmo de hoje, e não no ritmo muito mais acelerado que as empresas estão buscando, poderia ser uma vitória.”
Os problemas maiores são o apoio político e a proteção legal. Empresas que concordassem em desacelerar o desenvolvimento em conjunto poderiam enfrentar problemas de antitruste. Joe disse que isso torna a cobertura jurídica necessária se formuladores de políticas quiserem que laboratórios concorrentes se restrinjam.
Ele também é cético quanto à possibilidade de os governos agirem enquanto o desenvolvimento de ponta permanecer oculto do público. Joe alertou que um laboratório poderia passar por um salto repentino de inteligência ou perder o controle de um sistema sem que pessoas de fora soubessem.
Segundo ele, seu novo emprego na METR vai se concentrar em testes independentes. Ele quer que verificações externas se tornem comuns o suficiente para mudar os incentivos das empresas.
Joe também gostaria de requisitos de divulgação mais rigorosos. Por exemplo, laboratórios de IA precisam divulgar quaisquer avanços feitos e seus passos em direção à melhoria recursiva, bem como quaisquer acidentes e quase-acidentes.
O presidente dos EUA, Donald Trump, rejeitou os avisos de extinção. Donald foi questionado se a IA que apaga a humanidade o preocupava. “Não, não tenho nenhum”, ele disse.
Donald disse que sua preocupação é vencer a corrida internacional de IA. “Tenho receios de que, se não vencermos a IA, vamos ser colocados em uma posição muito ruim”, ele disse a repórteres na quinta-feira. “Estamos liderando a China agora por um período bem bom, eu diria um ano, que, você sabe, é considerado muito.”
Estados Unidos e China competem pela liderança em IA enquanto modelos chineses ficam mais capazes e conquistam usuários ao redor do mundo. Donald fez esses comentários depois que pesquisadores de laboratórios de ponta, incluindo Anthropic e OpenAI, aumentaram suas advertências públicas sobre a velocidade do desenvolvimento da IA.
Se você está lendo isto, você já está à frente. Fique lá com nossa newsletter.
