ME AI 消息,Artificial Analysis 完成 Gemini 4 Argon 第三方评测。在最高推理档位下,Argon 的 Intelligence Index 得到 53 分,追平 GPT-6 Astra,比 GPT-6.1 Sol 高 1 分。相比 Google 上一款非 Flash 模型 Gemini 3.1 Pro Preview,分数提高了 23 分。 按目前 API 首发半价计算,Argon 每个 Intelligence Index 任务平均花费 1.99 美元,只有 GPT-6 Astra 的约 60%。但它并没有少生成内容,平均每个任务输出约 6.2 万 tokens,Astra 只有 2.7 万。优惠结束后,Argon 单任务成本预计升至 3.98 美元,反而约为 Astra 的 1.2 倍。 Argon 一个比较突出的变化是更少瞎猜。在 AA-Omniscience 中,它的幻觉率只有 15%,是 Intelligence Index 得分 45 以上模型中最低的。GPT-6 Astra 和 GPT-6.1 Sol 分别为 51% 和 54%。不过 Argon 的答案准确率只有 50%,低于 Astra 的 63%。 (来源:ME)
