Grok 4.6 только что занял 1-е место на MedAgentBench....одном из самых интересных бенчмарков для реальных агентных задач в здравоохранении
и теперь у Grok сразу два поколения в топ-3
• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%
MedAgentBench выходит далеко за рамки ответов на медицинские вопросы
Он тестирует ИИ-агентов на 300 клинически выведенных задачах в 10 категориях внутри реалистичной среды электронной медицинской карты, требуя от модели рассуждать, использовать инструменты и фактически выполнять многошаговые клинические рабочие процессы
Grok 4.5 уже был одним из самых сильных медицинских агентов, которые тестировали. Grok 4.6 поднял его на новый уровень
Grok быстро становится одной из самых сильных семейств ИИ-моделей для агентной работы в здравоохранении
и теперь у Grok сразу два поколения в топ-3
• #1 Grok 4.6 — ~95,9%
• #2 GPT-5.6 Sol — ~94,7%
• #3 Grok 4.5 — ~93,4%
MedAgentBench выходит далеко за рамки ответов на медицинские вопросы
Он тестирует ИИ-агентов на 300 клинически выведенных задачах в 10 категориях внутри реалистичной среды электронной медицинской карты, требуя от модели рассуждать, использовать инструменты и фактически выполнять многошаговые клинические рабочие процессы
Grok 4.5 уже был одним из самых сильных медицинских агентов, которые тестировали. Grok 4.6 поднял его на новый уровень
Grok быстро становится одной из самых сильных семейств ИИ-моделей для агентной работы в здравоохранении