Grok 4.6 hat gerade den #1. Platz auf MedAgentBench übernommen....einer der spannendsten Benchmarks für agentische Healthcare-Aufgaben aus der Praxis
und Grok hat jetzt zwei Generationen in den Top 3
• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%
MedAgentBench geht weit über das Beantworten medizinischer Fragen hinaus
Es testet KI-Agenten auf 300 klinisch abgeleiteten Aufgaben in 10 Kategorien in einer realistischen Umgebung mit elektronischen Patientenakten. Dafür muss das Modell logisch denken, Tools nutzen und tatsächlich mehrstufige klinische Workflows ausführen
Grok 4.5 war bereits einer der stärksten getesteten medizinischen Agenten. Grok 4.6 hat ihn auf eine weitere Ebene gebracht
Grok entwickelt sich rasch zu einer der stärksten KI-Modellfamilien für agentische Healthcare-Arbeit
und Grok hat jetzt zwei Generationen in den Top 3
• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%
MedAgentBench geht weit über das Beantworten medizinischer Fragen hinaus
Es testet KI-Agenten auf 300 klinisch abgeleiteten Aufgaben in 10 Kategorien in einer realistischen Umgebung mit elektronischen Patientenakten. Dafür muss das Modell logisch denken, Tools nutzen und tatsächlich mehrstufige klinische Workflows ausführen
Grok 4.5 war bereits einer der stärksten getesteten medizinischen Agenten. Grok 4.6 hat ihn auf eine weitere Ebene gebracht
Grok entwickelt sich rasch zu einer der stärksten KI-Modellfamilien für agentische Healthcare-Arbeit