LM Arena пересчитала рейтинг после скандала с ИИ-судьей: DeepSeek V4 Flash снова в топе.
После скандала с заменой людей в A/B-тестах на ИИ-судью, платформа LM Arena оперативно изменила позицию. Теперь они заявляют, что их ИИ-судья работает только в тестовом режиме и исключительно на модели inkling-small.
После этого рейтинг был пересчитан заново, и DeepSeek V4 Flash снова вернулся на вершину. По оценкам людей, Qwen 3.8 Max действительно находится на уровне Claude Opus 5 и Fable 5.
Тем не менее столь резкие пересчёты рейтинга и смена курса на ходу выглядят несерьёзно. Мы рекомендуем теперь всегда проверять, не манипулирует ли LM Arena рейтингом с помощью собственного «судьи» на внутренней модели.

