AI salah pada 88% pertanyaan keuangan yang rumit — studi

Perusahaan Saturn memeriksa 18 model ChatGPT, Claude, Copilot, Grok, dan Gemini pada lebih dari 10.000 permintaan. Rata-rata, jawaban tidak benar pada 57% kasus, dan pada tugas dengan beberapa perhitungan — 88%.

Chatbot keliru dalam perhitungan, mengabaikan perubahan aturan pajak, dan mengarang sendiri. Dalam salah satu pengujian, kesalahan Claude bisa berdampak hingga £17.500 bagi seorang pensiunan.

Model berbayar bekerja lebih baik daripada yang gratis, tetapi bahkan hasil terbaik dalam tugas-tugas kompleks — 39% jawaban salah.

$USDC


USDC
USDC
0.99989
-0.01%

#BinanceSquareTalks #BTC #BTC走势分析