Grok 4.7 steht jetzt auf Platz 1 bei Harvey LAB-AA v1.1
und übertrifft Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 und andere in der Rangliste
Der Benchmark ist brutal: Eine einzige schwerwiegende Halluzination führt dazu, dass die gesamte Aufgabe mit null Punkten bewertet wird
Es geht nicht nur darum, die richtigen Antworten zu geben ... sondern darum, die gesamte Aufgabe korrekt abzuschließen, ohne schwerwiegende Halluzinationen zu erzeugen
Grok 4.7 entwickelt sich zu einem echten Kraftpaket beim Schlussfolgern in Situationen mit hohem Einsatz
und übertrifft Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 und andere in der Rangliste
Der Benchmark ist brutal: Eine einzige schwerwiegende Halluzination führt dazu, dass die gesamte Aufgabe mit null Punkten bewertet wird
Es geht nicht nur darum, die richtigen Antworten zu geben ... sondern darum, die gesamte Aufgabe korrekt abzuschließen, ohne schwerwiegende Halluzinationen zu erzeugen
Grok 4.7 entwickelt sich zu einem echten Kraftpaket beim Schlussfolgern in Situationen mit hohem Einsatz