Claude Opus 5 Max вышел в лидеры Arena по коду и фактологической точности.
Модель Claude Opus 5 с Max reasoning вышла на первое место сразу в двух рейтингах Arena: Frontend Code Arena и Text Arena с включённой factuality.
Версия с обычным high reasoning также показывает высокие результаты: 3-е место во Frontend Code Arena, сразу за Kimi K3, и 2-е место в Text Arena.
Это реальные данные по реальным задачам, которые показывают, что новая модель Anthropic хорошо справляется с веб-разработкой, работой с документами и обычным чатом.
При этом результат Claude Opus 5 Max пока предварительный. Оценки ещё будут уточняться по мере накопления данных.
Factuality представляет собой новый режим рейтинга, который учитывает не только человеческие предпочтения, но и фактическую точность ответов. Arena выборочно извлекает проверяемые утверждения из ответов и сравнивает их корректность.
Сейчас factuality доступна в Text Arena и Search Arena как отдельный режим, не включённый по умолчанию.

