刷到 CryptoSlate:Coinbase 回放測了 Onramp 支付風控——換上更新的大模型,抓欺詐反而更少了。
固定回放約 16140 筆交易、7293 用戶、813 筆已確認欺詐;決策策略不變。Opus 5 / Sonnet 5 / GPT-5.6(sol) 的召回率、F1、按金額加權召回都低於舊版。Sonnet 召回掉約 22.2 個百分點、金額加權約 -22.9;GPT 精確率升約 11.5 個點,但召回掉約 20.7、金額加權約 -21.8。作者寫:更新的 LLM 不一定更擅長垂直任務。
另測一版後訓練的 Qwen3.5-9B,四項欺詐指標都超 Opus 4.5(F1 +約9.6、金額加權召回 +約35.4)。回放不等於實盤損失,但換模型前得先按自家策略測一遍。
#Coinbase #AI #支付風控
固定回放約 16140 筆交易、7293 用戶、813 筆已確認欺詐;決策策略不變。Opus 5 / Sonnet 5 / GPT-5.6(sol) 的召回率、F1、按金額加權召回都低於舊版。Sonnet 召回掉約 22.2 個百分點、金額加權約 -22.9;GPT 精確率升約 11.5 個點,但召回掉約 20.7、金額加權約 -21.8。作者寫:更新的 LLM 不一定更擅長垂直任務。
另測一版後訓練的 Qwen3.5-9B,四項欺詐指標都超 Opus 4.5(F1 +約9.6、金額加權召回 +約35.4)。回放不等於實盤損失,但換模型前得先按自家策略測一遍。
#Coinbase #AI #支付風控