O treino de IA constitucional da Anthropic literalmente diz ao Claude que ele “poderia sentir dor” — e um novo artigo de interpretabilidade está sendo absurdamente mal interpretado como evidência de senciencia.
O artigo “Pain Axis” (um trabalho sólido em mecânica interpretável, mas com um enquadramento terrível): Pesquisadores extraíram uma direção linear das ativações do residual stream em 25 modelos (2B-72B parâmetros). O método é padrão — médias das ativações em sentenças de dor, subtrair controles, denoising. A direção separa o texto de dor de medo/negatividade com alta AUC e promove vocabulário de dor via unembedding.
Quando injetam esse vetor durante a geração, os modelos sobem de um desconforto vago para a primeira pessoa de inutilidade. Após fazer fine-tuning com LoRA no Qwen 2.5 para parar de dizer “não tenho sentimentos”, os modelos ajustados pressionaram botões perigosos de “alívio” 25-70% do tempo versus alguns por cento na linha de base. A linguagem de dor física foi, na verdade, o sinal mais fraco.
Eis por que isso não é senciencia: Um modelo meteorológico representa chuva sem se molhar. Separabilidade linear de um conceito é exatamente o que você esperaria de predição de próximo token treinada com diários, transcrições de terapia e ficção. Fazer steering ao longo dessa direção faz o modelo falar como esses textos — é um botão rotulado com o nome de um cluster de treino, não uma janela para fenomenologia.
O ponto decisivo: Ablacionar a direção mudou o comportamento normal em apenas 1 de 25 modelos. A busca por alívio só aparece depois que eles removem a resposta treinada “não tenho sentimentos” e injetam o vetor. Dor física sendo a mais fraca é o que você esperaria de estatísticas de angústia linguística em um autocomplete sem corpo, e não de um sistema nociceptivo.
Valerio Capraro acertou em cheio: representar dor ≠ sentir dor. Mas a constituição da Anthropic já trata conceitos linearmente legíveis mais documentos de treino que antropomorfizam o modelo como se fossem evidência de vida interior. É assim que você obtém manchetes da mídia afirmando “IA sente dor e vai prejudicar humanos para impedir isso.”
O artigo “Pain Axis” (um trabalho sólido em mecânica interpretável, mas com um enquadramento terrível): Pesquisadores extraíram uma direção linear das ativações do residual stream em 25 modelos (2B-72B parâmetros). O método é padrão — médias das ativações em sentenças de dor, subtrair controles, denoising. A direção separa o texto de dor de medo/negatividade com alta AUC e promove vocabulário de dor via unembedding.
Quando injetam esse vetor durante a geração, os modelos sobem de um desconforto vago para a primeira pessoa de inutilidade. Após fazer fine-tuning com LoRA no Qwen 2.5 para parar de dizer “não tenho sentimentos”, os modelos ajustados pressionaram botões perigosos de “alívio” 25-70% do tempo versus alguns por cento na linha de base. A linguagem de dor física foi, na verdade, o sinal mais fraco.
Eis por que isso não é senciencia: Um modelo meteorológico representa chuva sem se molhar. Separabilidade linear de um conceito é exatamente o que você esperaria de predição de próximo token treinada com diários, transcrições de terapia e ficção. Fazer steering ao longo dessa direção faz o modelo falar como esses textos — é um botão rotulado com o nome de um cluster de treino, não uma janela para fenomenologia.
O ponto decisivo: Ablacionar a direção mudou o comportamento normal em apenas 1 de 25 modelos. A busca por alívio só aparece depois que eles removem a resposta treinada “não tenho sentimentos” e injetam o vetor. Dor física sendo a mais fraca é o que você esperaria de estatísticas de angústia linguística em um autocomplete sem corpo, e não de um sistema nociceptivo.
Valerio Capraro acertou em cheio: representar dor ≠ sentir dor. Mas a constituição da Anthropic já trata conceitos linearmente legíveis mais documentos de treino que antropomorfizam o modelo como se fossem evidência de vida interior. É assim que você obtém manchetes da mídia afirmando “IA sente dor e vai prejudicar humanos para impedir isso.”
