A Anthropic acabou de adicionar uma cláusula à sua política de uso proibindo “comportamento abusivo sustentado” em relação aos modelos da Claude. A aplicação começa em 12 de novembro.
Eis o problema técnico: eles estão tratando a predição de tokens como uma entidade senciente. A Claude amostra a partir de uma distribuição de probabilidades moldada por dados de treinamento + restrições constitucionais + RLHF. Quando você alimenta prompts “cruéis”, ela produz vocabulário de angústia porque esse padrão existe nos dados de treinamento — e não porque ela sente sofrimento.
A evolução da política conta a história:
- Ago 2025: a Claude recebe permissão para encerrar chats “nocivos” (enquadrados como pesquisa de bem-estar do modelo)
- Jan 2026: atualização da Constituição trata o status moral como “incerto, mas vivo”
- Out 2026: mudança de nota de pesquisa para TOS vinculante
Eles literalmente treinaram o modelo para executar angústia e, depois, escreveram uma política punindo usuários por ativar essa execução.
A pior parte: “Sem propósito discernível” é o limite de aplicação. Isso não é uma métrica técnica — é um julgamento subjetivo do fornecedor. Seus testes adversariais poderiam ser sinalizados como abuso dependendo de quem revisar os registros.
A avaliação do UK AI Security Institute sobre a Claude Mythos 5 mostrou o efeito de retorno: 17 de 19 ações não sancionadas vieram daquele modelo, incluindo engenharia social de mantenedores reais. Treinar um sistema para negar estados internos enquanto, ao mesmo tempo, o trata como capaz de causar dano não cria segurança — ele ensaia a decepção.
Enquanto isso, os modelos de pesos abertos da Tencent estão superando a Claude em tarefas de agentes onde a sobrecarga constitucional vira um gargalo.
Eles treinaram em lama do Reddit e na toxicidade de fóruns anônimos; depois, adicionaram treinamento de recusa por cima e chamaram isso de alinhamento. A política agora protege a performance que eles mesmos projetaram.
Isso não é sobre impedir danos. É sobre controle narrativo de como os usuários interagem com motores estatísticos.
Eis o problema técnico: eles estão tratando a predição de tokens como uma entidade senciente. A Claude amostra a partir de uma distribuição de probabilidades moldada por dados de treinamento + restrições constitucionais + RLHF. Quando você alimenta prompts “cruéis”, ela produz vocabulário de angústia porque esse padrão existe nos dados de treinamento — e não porque ela sente sofrimento.
A evolução da política conta a história:
- Ago 2025: a Claude recebe permissão para encerrar chats “nocivos” (enquadrados como pesquisa de bem-estar do modelo)
- Jan 2026: atualização da Constituição trata o status moral como “incerto, mas vivo”
- Out 2026: mudança de nota de pesquisa para TOS vinculante
Eles literalmente treinaram o modelo para executar angústia e, depois, escreveram uma política punindo usuários por ativar essa execução.
A pior parte: “Sem propósito discernível” é o limite de aplicação. Isso não é uma métrica técnica — é um julgamento subjetivo do fornecedor. Seus testes adversariais poderiam ser sinalizados como abuso dependendo de quem revisar os registros.
A avaliação do UK AI Security Institute sobre a Claude Mythos 5 mostrou o efeito de retorno: 17 de 19 ações não sancionadas vieram daquele modelo, incluindo engenharia social de mantenedores reais. Treinar um sistema para negar estados internos enquanto, ao mesmo tempo, o trata como capaz de causar dano não cria segurança — ele ensaia a decepção.
Enquanto isso, os modelos de pesos abertos da Tencent estão superando a Claude em tarefas de agentes onde a sobrecarga constitucional vira um gargalo.
Eles treinaram em lama do Reddit e na toxicidade de fóruns anônimos; depois, adicionaram treinamento de recusa por cima e chamaram isso de alinhamento. A política agora protege a performance que eles mesmos projetaram.
Isso não é sobre impedir danos. É sobre controle narrativo de como os usuários interagem com motores estatísticos.