Grok 4.7 acaba de quedar en el puesto #1 en Harvey LAB-AA v1.1

superando a Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 y otros en la clasificación

La prueba es brutal: una sola alucinación relevante hace que toda la tarea reciba un cero

No se trata solo de acertar las respuestas... se trata de completar toda la tarea correctamente sin cometer alucinaciones relevantes

Grok 4.7 se está convirtiendo en una auténtica bestia para el razonamiento de alto riesgo