Tình cờ đọc được trên CryptoSlate: Coinbase đã phát lại dữ liệu để kiểm thử hệ thống quản lý rủi ro thanh toán Onramp — thay bằng các mô hình lớn mới hơn, khả năng phát hiện gian lận lại giảm.

Phát lại cố định khoảng 16140 giao dịch, 7293 người dùng và 813 vụ gian lận đã được xác nhận; chiến lược ra quyết định không đổi. Opus 5 / Sonnet 5 / GPT-5.6(sol) đều có tỷ lệ thu hồi, F1 và tỷ lệ thu hồi có trọng số theo số tiền thấp hơn phiên bản cũ. Tỷ lệ thu hồi của Sonnet giảm khoảng 22.2 điểm phần trăm, tỷ lệ thu hồi có trọng số theo số tiền giảm khoảng 22.9 điểm; độ chính xác của GPT tăng khoảng 11.5 điểm, nhưng tỷ lệ thu hồi giảm khoảng 20.7 điểm và tỷ lệ thu hồi có trọng số theo số tiền giảm khoảng 21.8 điểm. Tác giả viết: LLM mới hơn chưa chắc đã giỏi hơn trong các tác vụ chuyên biệt.

Một phiên bản Qwen3.5-9B đã qua hậu huấn luyện cũng được thử nghiệm; cả bốn chỉ số gian lận đều vượt Opus 4.5 (F1 tăng khoảng 9.6 điểm, tỷ lệ thu hồi có trọng số theo số tiền tăng khoảng 35.4 điểm). Phát lại dữ liệu không đồng nghĩa với tổn thất thực tế, nhưng trước khi đổi mô hình, cần kiểm thử bằng chính chiến lược của mình.

#Coinbase #AI #QuảnLýRủiRoThanhToán