Bin auf CryptoSlate gestoßen: Coinbase hat das Zahlungs-Risikomanagement von Onramp im Replay getestet – mit neueren großen Sprachmodellen wurden Betrugsfälle sogar seltener erkannt.

Bei einem festen Replay mit rund 16.140 Transaktionen, 7.293 Nutzern und 813 bestätigten Betrugsfällen blieb die Entscheidungsstrategie unverändert. Opus 5 / Sonnet 5 / GPT-5.6(sol) lagen bei Recall, F1 und betragsgewichtetem Recall alle unter den älteren Modellen. Bei Sonnet sank der Recall um rund 22,2 Prozentpunkte, der betragsgewichtete Recall um rund 22,9. Die Präzision von GPT stieg um etwa 11,5 Punkte, doch der Recall sank um rund 20,7 und der betragsgewichtete Recall um rund 21,8. Der Autor schreibt: Neuere LLMs sind nicht unbedingt besser bei spezialisierten Aufgaben.

Eine weitere, nachtrainierte Version von Qwen3.5-9B übertraf Opus 4.5 bei allen vier Betrugskennzahlen (F1 um rund 9,6 Punkte, betragsgewichteter Recall um rund 35,4 Punkte). Ein Replay entspricht zwar nicht den Verlusten im Live-Betrieb, aber bevor man das Modell wechselt, sollte man es zunächst mit der eigenen Strategie testen.

#Coinbase #AI #Zahlungs-Risikomanagement