#новости ИИ

🤖 AI 在 88% 的複雜金融問題上算錯了——研究

公司 Saturn 在超過 10 000 個提問中,測試了 18 款 ChatGPT、Claude、Copilot、Grok 與 Gemini 模型。平均而言,答案在 57% 的情況下是錯的,而在包含多次計算的任務中——錯誤率高達 88%。

聊天機器人會在計算上混亂、忽略稅務規則的變動,並自行編造內容。在其中一項測試中,Claude 的錯誤可能會讓退休金儲蓄者損失高達 17 500 英鎊。

付費模型表現得比免費模型更好,但在複雜任務中,即使是最佳結果也仍有 39% 的錯誤答案。