Grok 4.6 hat gerade den #1. Platz auf MedAgentBench übernommen....einer der spannendsten Benchmarks für agentische Healthcare-Aufgaben aus der Praxis

und Grok hat jetzt zwei Generationen in den Top 3

• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%

MedAgentBench geht weit über das Beantworten medizinischer Fragen hinaus

Es testet KI-Agenten auf 300 klinisch abgeleiteten Aufgaben in 10 Kategorien in einer realistischen Umgebung mit elektronischen Patientenakten. Dafür muss das Modell logisch denken, Tools nutzen und tatsächlich mehrstufige klinische Workflows ausführen

Grok 4.5 war bereits einer der stärksten getesteten medizinischen Agenten. Grok 4.6 hat ihn auf eine weitere Ebene gebracht

Grok entwickelt sich rasch zu einer der stärksten KI-Modellfamilien für agentische Healthcare-Arbeit