Anthropic がまた新しいモデルを出しました
特にすごいのは研究分野です。Terminal-Bench-Science では、Fable 5 が 24.7% なのに対し、Fable 5.1 は 52.6% まで到達しています。Opus 5 は 29.0%、GPT-5.6 Sol は 22.4% です。
コーディング面でも改善が大きく、Terminal-Bench 4.0 は 42.0% から 55.8% に。AutomationBench は 17.1% から 31.4% へ上がっています。これらの数字だけ見ても
モデル性能は伸びているのに、実際の利用コストはむしろ下がっています。キャッシュ読み取りの価格は Fable 5 より 75% 低く、Anthropic の試算では一般的な workload の実コストはおおむね 25% 下がっています。
Fable 5.1 はもう使えるようになりました。みなさんも、思ったほど強くなっているのか試してみてください。
引用: https://x.com/i/web/status/2094848581425377479
特にすごいのは研究分野です。Terminal-Bench-Science では、Fable 5 が 24.7% なのに対し、Fable 5.1 は 52.6% まで到達しています。Opus 5 は 29.0%、GPT-5.6 Sol は 22.4% です。
コーディング面でも改善が大きく、Terminal-Bench 4.0 は 42.0% から 55.8% に。AutomationBench は 17.1% から 31.4% へ上がっています。これらの数字だけ見ても
モデル性能は伸びているのに、実際の利用コストはむしろ下がっています。キャッシュ読み取りの価格は Fable 5 より 75% 低く、Anthropic の試算では一般的な workload の実コストはおおむね 25% 下がっています。
Fable 5.1 はもう使えるようになりました。みなさんも、思ったほど強くなっているのか試してみてください。
引用: https://x.com/i/web/status/2094848581425377479