Grok 4.7 acaba de quedar en el puesto #1 en Harvey LAB-AA v1.1
superando a Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 y otros en la clasificación
La prueba es brutal: una sola alucinación relevante hace que toda la tarea reciba un cero
No se trata solo de acertar las respuestas... se trata de completar toda la tarea correctamente sin cometer alucinaciones relevantes
Grok 4.7 se está convirtiendo en una auténtica bestia para el razonamiento de alto riesgo
superando a Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 y otros en la clasificación
La prueba es brutal: una sola alucinación relevante hace que toda la tarea reciba un cero
No se trata solo de acertar las respuestas... se trata de completar toda la tarea correctamente sin cometer alucinaciones relevantes
Grok 4.7 se está convirtiendo en una auténtica bestia para el razonamiento de alto riesgo