Попалась новость в CryptoSlate: Coinbase протестировала систему управления платёжными рисками Onramp на исторических данных — с обновлёнными более крупными моделями она стала выявлять меньше мошенничества.

На фиксированном наборе для тестирования было около 16140 транзакций, 7293 пользователей и 813 подтверждённых случаев мошенничества; стратегия принятия решений не менялась. Полнота, F1 и полнота, взвешенная по сумме, у Opus 5 / Sonnet 5 / GPT-5.6(sol) оказались ниже, чем у предыдущих версий. Полнота Sonnet снизилась примерно на 22.2 процентного пункта, а полнота с учётом суммы — примерно на 22.9; точность GPT выросла примерно на 11.5 пункта, но полнота упала примерно на 20.7, а полнота с учётом суммы — примерно на 21.8. Автор пишет: более новые LLM не обязательно лучше справляются с узкоспециализированными задачами.

Также протестировали дообученную Qwen3.5-9B: по всем четырём показателям мошенничества она превзошла Opus 4.5 (F1 — примерно на 9.6, полнота с учётом суммы — примерно на 35.4). Тестирование на исторических данных не равнозначно потерям в реальной работе, но перед сменой модели стоит сначала проверить её на собственных данных и с учётом своей стратегии.

#Coinbase #AI #УправлениеПлатёжнымиРисками