AI salah pada 88% pertanyaan keuangan yang rumit — studi
Perusahaan Saturn memeriksa 18 model ChatGPT, Claude, Copilot, Grok, dan Gemini pada lebih dari 10.000 permintaan. Rata-rata, jawaban tidak benar pada 57% kasus, dan pada tugas dengan beberapa perhitungan — 88%.
Chatbot keliru dalam perhitungan, mengabaikan perubahan aturan pajak, dan mengarang sendiri. Dalam salah satu pengujian, kesalahan Claude bisa berdampak hingga £17.500 bagi seorang pensiunan.
Model berbayar bekerja lebih baik daripada yang gratis, tetapi bahkan hasil terbaik dalam tugas-tugas kompleks — 39% jawaban salah.

USDC
0.99989
-0.01%