Anthropic がまた新しいモデルを出しました

特にすごいのは研究分野です。Terminal-Bench-Science では、Fable 5 が 24.7% なのに対し、Fable 5.1 は 52.6% まで到達しています。Opus 5 は 29.0%、GPT-5.6 Sol は 22.4% です。

コーディング面でも改善が大きく、Terminal-Bench 4.0 は 42.0% から 55.8% に。AutomationBench は 17.1% から 31.4% へ上がっています。これらの数字だけ見ても

モデル性能は伸びているのに、実際の利用コストはむしろ下がっています。キャッシュ読み取りの価格は Fable 5 より 75% 低く、Anthropic の試算では一般的な workload の実コストはおおむね 25% 下がっています。

Fable 5.1 はもう使えるようになりました。みなさんも、思ったほど強くなっているのか試してみてください。

引用: https://x.com/i/web/status/2094848581425377479