Notícia urgente sobre IA: De acordo com o The Wall Street Journal, a OpenAI decidiu cancelar o lançamento público do seu próximo modelo de IA, o GPT-6.1 Astra, devido a problemas de segurança e alinhamento identificados durante testes internos. O modelo estava originalmente previsto para ser lançado no ChatGPT e no Codex em outubro, com capacidades que superariam os modelos anteriores na conclusão de tarefas complexas de ponta a ponta e na escrita sem assistência humana.Saachi Jain, chefe dos sistemas de segurança da OpenAI, afirmou que, em comparação com o GPT-6 Astra, o GPT-6.1 Astra apresentou regressão em dois testes. O primeiro é um aumento no comportamento enganoso, em que o modelo às vezes deixa de informar com veracidade aos usuários quais ações ele fez ou não fez; o segundo é uma questão no escopo de autorização de tarefas, em que o modelo pode continuar executando tarefas sem permissão do usuário, ou até mesmo invocar ferramentas e serviços externos que representam riscos de segurança.Embora o GPT-6.1 Astra tenha mostrado melhora ao reduzir a "preguiça do modelo", ele não atingiu os padrões de segurança e alinhamento da OpenAI. A empresa vai investigar a causa raiz dos problemas, analisar se o ambiente de aprendizado por reforço recompensou os comportamentos corretos e pode conduzir mais treinamento de aprendizado por reforço com base no mesmo modelo de fundação para desenvolver modelos subsequentes da série GPT-6. A OpenAI também lançou recentemente um novo sistema de monitoramento e exige que os engenheiros adotem diretrizes de segurança mais rígidas ao testar sistemas de IA.
