Grok лидирует в MedAgentBench, а MAST выводит вперёд GPT-5.6 Sol и Kimi K3: почему одной LLM мало.
Мы в редакции обратили внимание на заявление Маска: Grok занял первое место в медицинском бенчмарке MedAgentBench от Стэнфорда. Отдельного онлайн-инструмента для просмотра результатов у этого теста нет. В другом бенчмарке, MAST, лидируют GPT-5.6 Sol, за ним следует Kimi K3. Главная проблема медицинских бенчмарков в том, что они проверяют не все LLM и остаются относительно открытыми.
Даже если обращаться к ИИ за медицинскими консультациями, доверять одной модели нельзя: ни Grok 4.6, ни GPT-5.6 Sol. Помимо галлюцинаций, медицинские модели в реальности строят гипотезы, которые с определённой вероятностью могут быть ошибочными. Поэтому в медицинской диагностике важно собирать «ансамбль» из разных LLM и консолидировать ответы. Так видно, где все ИИ приходят к консенсусу и где можно говорить о надёжности, а где остаются спорные моменты.
Это хорошая практика для любого анализа, но в жизненно важных сценариях она обязательна. Поэтому сама постановка вопроса об одной «лучшей медицинской LLM» ошибочна как сценарий эксплуатации.
Результаты MAST можно посмотреть здесь: https://www.arise-ai.org/mast

