Grok 4.6 acaba de ocupar el puesto #1 en MedAgentBench.... uno de los benchmarks más interesantes para tareas de atención médica agentica en el mundo real

y ahora Grok tiene dos generaciones situadas entre las tres primeras

• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%

MedAgentBench va mucho más allá de responder preguntas médicas

Pone a prueba agentes de IA en 300 tareas derivadas clínicamente en 10 categorías dentro de un entorno realista de historia clínica electrónica, exigiendo que el modelo razone, use herramientas y ejecute de forma real flujos de trabajo clínicos de varios pasos

Grok 4.5 ya era uno de los agentes médicos más sólidos que se han probado. Grok 4.6 lo acaba de llevar a otro nivel

Grok se está convirtiendo rápidamente en una de las familias de modelos de IA más fuertes para trabajos de atención médica agentica