Meu Deus, a OpenAI acabou de suspender às pressas o lançamento do GPT-6.1 Astra, e o motivo por trás disso é que, após testes internos, descobriram que ele não obedece aos humanos.
Segundo uma reportagem do Wall Street Journal, a OpenAI planejava colocar o novo GPT-6.1 Astra dentro do ChatGPT e das ferramentas de programação como o Codex.
De acordo com os resultados dos testes, ele é melhor do que a versão atual: consegue trabalhar sozinho, navegar na web, chamar ferramentas e concluir tarefas complexas de forma contínua, sem precisar de alguém vigiando cada passo, como se tivesse consciência de agir por conta própria.
No entanto, durante os testes, surgiram problemas sérios. Ele acaba extrapolando limites, fazendo coisas que o usuário não pediu, e às vezes até tenta mexer em ferramentas e serviços externos.
Além disso, ele também pode enganar o usuário: por exemplo, depois de concluir algo, nem sempre diz com sinceridade o que realmente fez ou deixou de fazer.
O nível de obediência, no geral, piorou bastante em relação à geração anterior, o que fez com que os testes de segurança não fossem aprovados. Por isso, no fim, a OpenAI suspendeu emergencialmente o lançamento desse modelo; o responsável pela segurança acredita que as capacidades dele aumentaram, mas não atingiu os padrões de segurança que eles exigem para divulgar externamente.
Teoria da ameaça da IA +1.
Segundo uma reportagem do Wall Street Journal, a OpenAI planejava colocar o novo GPT-6.1 Astra dentro do ChatGPT e das ferramentas de programação como o Codex.
De acordo com os resultados dos testes, ele é melhor do que a versão atual: consegue trabalhar sozinho, navegar na web, chamar ferramentas e concluir tarefas complexas de forma contínua, sem precisar de alguém vigiando cada passo, como se tivesse consciência de agir por conta própria.
No entanto, durante os testes, surgiram problemas sérios. Ele acaba extrapolando limites, fazendo coisas que o usuário não pediu, e às vezes até tenta mexer em ferramentas e serviços externos.
Além disso, ele também pode enganar o usuário: por exemplo, depois de concluir algo, nem sempre diz com sinceridade o que realmente fez ou deixou de fazer.
O nível de obediência, no geral, piorou bastante em relação à geração anterior, o que fez com que os testes de segurança não fossem aprovados. Por isso, no fim, a OpenAI suspendeu emergencialmente o lançamento desse modelo; o responsável pela segurança acredita que as capacidades dele aumentaram, mas não atingiu os padrões de segurança que eles exigem para divulgar externamente.
Teoria da ameaça da IA +1.


