DeepSeek V4 Pro в рейтинге Arena: модель фронтирного уровня!
Arena опубликовала рейтинг DeepSeek V4 Pro. По предварительным оценкам, модель находится на фронтирном уровне и сопоставима с лучшими разработками Anthropic, GLM, Qwen и OpenAI.
Интересный момент связан с AutoEval, на основе которого считали рейтинг. Эта система ранее вызвала скандал из-за замены оценок живых людей моделью-судьёй. Она заметно повышала рейтинг Claude и занижала DeepSeek. Позже Arena объяснила, что это был только тест, и рейтинг пересчитали на оценках живых людей. При этом в тестовом режиме модель-судья, лояльная к Claude, поставила очень высокие оценки DeepSeek V4 Pro.
Это может косвенно указывать на активную дистилляцию из Claude в новой версии DeepSeek V4 Pro. Модель-судья, скорее всего, смотрит на код, поэтому на дистилляцию как на похожий код должна реагировать довольно сильно.
Новый судья Arena уже не выглядит так скандально. Посмотрим, как изменится рейтинг по мере накопления оценок живых пользователей.

