Grok 4.7 vient de se classer n° 1 sur Harvey LAB-AA v1.1

devançant Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 et bien d’autres au classement

Le benchmark est impitoyable : une seule hallucination importante suffit pour que la tâche entière obtienne zéro

Il ne s’agit pas seulement de donner les bonnes réponses… mais de mener toute la tâche à bien sans produire d’hallucinations importantes

Grok 4.7 devient une véritable bête en matière de raisonnement à forts enjeux