O Grok 4.6 acabou de assumir o 1º lugar no MedAgentBench....um dos benchmarks mais interessantes para tarefas reais de saúde com agentes
e agora o Grok tem duas gerações ocupando o top 3
• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%
O MedAgentBench vai muito além de responder perguntas médicas
Ele testa agentes de IA em 300 tarefas derivadas clinicamente, distribuídas em 10 categorias, dentro de um ambiente realista de prontuário eletrônico, exigindo que o modelo raciocine, use ferramentas e realmente execute fluxos de trabalho clínicos de múltiplas etapas
O Grok 4.5 já era um dos agentes médicos mais fortes testados. O Grok 4.6 acabou de levá-lo a outro nível
O Grok está rapidamente se tornando uma das famílias de modelos de IA mais fortes para trabalho em saúde com agentes
e agora o Grok tem duas gerações ocupando o top 3
• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%
O MedAgentBench vai muito além de responder perguntas médicas
Ele testa agentes de IA em 300 tarefas derivadas clinicamente, distribuídas em 10 categorias, dentro de um ambiente realista de prontuário eletrônico, exigindo que o modelo raciocine, use ferramentas e realmente execute fluxos de trabalho clínicos de múltiplas etapas
O Grok 4.5 já era um dos agentes médicos mais fortes testados. O Grok 4.6 acabou de levá-lo a outro nível
O Grok está rapidamente se tornando uma das famílias de modelos de IA mais fortes para trabalho em saúde com agentes