Тестовая среда MedAgentBench оценивает не теоретические знания нейросетей, а их функциональную готовность к роли медицинских ассистентов. Испытания включают 300 различных сценариев и десять типов прикладных задач, требующих от модели самостоятельных действий. По итогам замеров, проведенных 17 августа, Grok 4.6 показал не только лидерство в точности с первой попытки, но и высокую стабильность при повторных запусках. Текущий результат модели оказался на 2,5 процентного пункта выше показателей предыдущей версии, Grok 4.5.
Grok 4.6 возглавил рейтинг медицинских ИИ-агентов

Комментарии (0)
Пока нет комментариев. Будьте первым!