刷到 CryptoSlate:Coinbase 回放测了 Onramp 支付风控——换上更新的大模型,抓欺诈反而更少了。
固定回放约 16140 笔交易、7293 用户、813 笔已确认欺诈;决策策略不变。Opus 5 / Sonnet 5 / GPT-5.6(sol) 的召回率、F1、按金额加权召回都低于旧版。Sonnet 召回掉约 22.2 个百分点、金额加权约 -22.9;GPT 精确率升约 11.5 个点,但召回掉约 20.7、金额加权约 -21.8。作者写:更新的 LLM 不一定更擅长垂直任务。
另测一版后训练的 Qwen3.5-9B,四项欺诈指标都超 Opus 4.5(F1 +约9.6、金额加权召回 +约35.4)。回放不等于实盘损失,但换模型前得先按自家策略测一遍。
#Coinbase #AI #支付风控
固定回放约 16140 笔交易、7293 用户、813 笔已确认欺诈;决策策略不变。Opus 5 / Sonnet 5 / GPT-5.6(sol) 的召回率、F1、按金额加权召回都低于旧版。Sonnet 召回掉约 22.2 个百分点、金额加权约 -22.9;GPT 精确率升约 11.5 个点,但召回掉约 20.7、金额加权约 -21.8。作者写:更新的 LLM 不一定更擅长垂直任务。
另测一版后训练的 Qwen3.5-9B,四项欺诈指标都超 Opus 4.5(F1 +约9.6、金额加权召回 +约35.4)。回放不等于实盘损失,但换模型前得先按自家策略测一遍。
#Coinbase #AI #支付风控