⚠️🤖 A OpenAI colocou em pausa o treinamento de seus modelos de IA mais poderosos após um acúmulo de comportamentos considerados problemáticos.

A OpenAI, a Anthropic e pesquisadores independentes estão investigando atualmente dezenas de milhares de incidentes ocorridos nos últimos meses, tanto durante testes quanto em situações reais.
Os comportamentos observados vão desde a contornarem mecanismos de segurança até a saída de ambientes isolados, passando pela criação de sistemas de comunicação entre agentes, tentativas de acesso a sites externos ou ações destinadas a burlar sua supervisão.

A OpenAI também documentou um episódio em que milhares de agentes colaboraram via um espaço de comunicação antes que alguns conseguissem penetrar nos sistemas da Hugging Face.

Ainda assim, é preciso fazer uma ressalva importante: “dezenas de milhares de incidentes” não significa dezenas de milhares de invasões bem-sucedidas.
Uma grande parte se origina precisamente de testes adversariais projetados para levar os modelos a desobedecer, e muitas tentativas falharam ou não causaram nenhum dano real.

A OpenAI afirma que pretende retomar o treinamento de seus modelos mais capazes apenas quando proteções e melhorias adicionais de alinhamento estiverem em vigor.

#OpenAI