Anthropic hat wieder ein neues Modell herausgebracht
Am krassesten ist das im Bereich Forschung. Bei Terminal-Bench-Science liegt Fable 5 bei nur 24,7%, Fable 5.1 schafft hingegen direkt 52,6%. Opus 5 liegt bei 29,0%, GPT-5.6 Sol bei 22,4%.
Auch beim Codieren gibt es deutliche Verbesserungen: Terminal-Bench 4.0 steigt von 42,0% auf 55,8%, und AutomationBench geht von 17,1% auf 31,4% hoch. Wenn man nur diese Zahlen betrachtet
Die Modellfähigkeiten sind gewachsen, aber die tatsächlichen Nutzungskosten sinken sogar. Der Cache-Read-Preis ist im Vergleich zu Fable 5 um 75% niedriger; Anthropic schätzt, dass die tatsächlichen Kosten für ein typisches Workload ungefähr um 25% gesunken sind.
Fable 5.1 ist jetzt bereits nutzbar. Probiert es aus und schaut, ob es wirklich so viel stärker ist.
Quelle: https://x.com/i/web/status/2094848581425377479
Am krassesten ist das im Bereich Forschung. Bei Terminal-Bench-Science liegt Fable 5 bei nur 24,7%, Fable 5.1 schafft hingegen direkt 52,6%. Opus 5 liegt bei 29,0%, GPT-5.6 Sol bei 22,4%.
Auch beim Codieren gibt es deutliche Verbesserungen: Terminal-Bench 4.0 steigt von 42,0% auf 55,8%, und AutomationBench geht von 17,1% auf 31,4% hoch. Wenn man nur diese Zahlen betrachtet
Die Modellfähigkeiten sind gewachsen, aber die tatsächlichen Nutzungskosten sinken sogar. Der Cache-Read-Preis ist im Vergleich zu Fable 5 um 75% niedriger; Anthropic schätzt, dass die tatsächlichen Kosten für ein typisches Workload ungefähr um 25% gesunken sind.
Fable 5.1 ist jetzt bereits nutzbar. Probiert es aus und schaut, ob es wirklich so viel stärker ist.
Quelle: https://x.com/i/web/status/2094848581425377479