Vi no CryptoSlate: a Coinbase testou os controles de risco de pagamentos da Onramp com uma reprodução de transações — usando modelos de linguagem maiores e mais recentes, acabou detectando menos fraudes.

Em uma reprodução fixa de cerca de 16140 transações, 7293 usuários e 813 fraudes confirmadas, a estratégia de decisão foi mantida. As taxas de recall, F1 e recall ponderado pelo valor de Opus 5 / Sonnet 5 / GPT-5.6(sol) ficaram abaixo das versões anteriores. O recall do Sonnet caiu cerca de 22,2 pontos percentuais, e o recall ponderado pelo valor, cerca de 22,9; a precisão do GPT subiu cerca de 11,5 pontos, mas o recall caiu cerca de 20,7 pontos, e o recall ponderado pelo valor, cerca de 21,8. O autor escreveu: modelos de linguagem mais recentes não são necessariamente melhores em tarefas especializadas.

Também foi testada uma versão do Qwen3.5-9B pós-treinada, que superou o Opus 4.5 nos quatro indicadores de fraude (F1: +cerca de 9,6; recall ponderado pelo valor: +cerca de 35,4). Uma reprodução não equivale a perdas em operações reais, mas, antes de trocar de modelo, é preciso testá-lo com a própria estratégia.

#Coinbase #AI #controles de risco de pagamentos