Grok 4.7 vient de se classer n° 1 sur Harvey LAB-AA v1.1
devançant Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 et bien d’autres au classement
Le benchmark est impitoyable : une seule hallucination importante suffit pour que la tâche entière obtienne zéro
Il ne s’agit pas seulement de donner les bonnes réponses… mais de mener toute la tâche à bien sans produire d’hallucinations importantes
Grok 4.7 devient une véritable bête en matière de raisonnement à forts enjeux
devançant Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 et bien d’autres au classement
Le benchmark est impitoyable : une seule hallucination importante suffit pour que la tâche entière obtienne zéro
Il ne s’agit pas seulement de donner les bonnes réponses… mais de mener toute la tâche à bien sans produire d’hallucinations importantes
Grok 4.7 devient une véritable bête en matière de raisonnement à forts enjeux