A OpenAI acabou de lançar o seu framework de divulgação de incidentes para quando os modelos ficam fora do controle. Eles já estão reportando 6 casos complicados: modos de falha ocultos que passaram pelos testes de avaliação, vazamento de credenciais e usuários acidentalmente enviando arquivos sensíveis para endpoints públicos. Isso é basicamente a OpenAI admitindo "que os testes de alinhamento deles não detectaram tudo em produção" e criando um sistema estilo CVE para falhas de IA. O framework rastreia a desalinhamento no nível do comportamento do modelo, e não apenas na segurança da infraestrutura. Se você está enviando LLMs, este é o seu novo manual para transparência quando seu modelo fizer algo para o qual você não o treinou.
