Новый бенчмарк DeepSWE попал под шквал критики: абсурдный результат Claude Haiku 4.5 эксперты назвали откровенным бредом.
Мы обратили внимание на дискуссию вокруг нового бенчмарка DeepSWE. Многие пользователи поспешили заявить, что ChatGPT превосходит Claude, однако такой вывод назвали поспешным и некорректным.
Критики указывают на очевидные странности методики. В качестве примера приводят модель Claude Haiku 4.5. Это крайне недооценённая разработка. Создатель ожидал её более широкого использования, но разработчики часто предпочитают более дорогие Opus или Sonnet. Согласно рейтингу LM Arena, Haiku находится примерно на уровне Codex 5.1 или DeepSeek V3.2, и назвать её слабой LLM никак нельзя.
Объективность арены
Бенчмарк Arena считают объективным в следующих аспектах:
- качество дизайна UI;
- юзабилити;
- непосредственный запуск кода без ошибок.
DeepSWE по логике должен адекватно оценивать именно последнее. Однако у «экспертов», проводивших замеры, Haiku получила результат 0. Такой показатель сочли абсолютной бессмыслицей. Это скорее говорит о том, что игры в бенчмарки всё больше превращаются в хайп и погоню за цифрами, а не в научное исследование. Особое удивление вызывает количество людей, которые репостят эту очевидную нелепость, даже не замечая в ней грубых ошибок.
Детали методологии доступны по ссылке.

