Бенчмарк SWE-bench удивил: Haiku обходит Opus, GPT-5 mini превосходит Sonnet на 18%.
Новый бенчмарк, оценивающий способности агентов в задачах типа SWE-bench, вызвал бурное обсуждение. Авторы использовали своего минималистичного агента mini-SWE-agent и получили на удивление низкие результаты для большинства моделей. Если бы замеры проводились в нативных средах Codex, Claude Code или в более умных скаффолдах с поддержкой сжатия контекста, показатели наверняка были бы выше нуля.
Особенно показательной стала статистика воспроизведения популярной задачи SQLite. Второе место заняла Haiku, которая обошла Opus 4.6. Третье место у GPT-5 mini, закрывшей на 18% больше тестов, чем Sonnet 4.6.
Хотя речь идёт лишь об одной задаче, в ней сотни тестов. Столь экстремально низкий балл Opus вряд ли объясняется случайностью. Либо в инфраструктуре или параметрах были допущены ошибки, либо повлияли другие факторы.
Мы ожидаем, что в ближайшую неделю одна из компаний выполнит прогон в Codex, Claude Code или Pi и продемонстрирует ненулевой результат. Решить 80% бенчмарка это не позволит, но 10–15% выглядит достижимым. Ещё более вероятен успех в категории almost solved, где порог пройденных тестов составляет 95%.
Пользователь X прогнал одну из задач с разными настройками Codex и на GPT-5.4/5.5. Результат авторов оказался самым низким с большим отрывом. Также он запустил другую задачу 5 раз в среде Pi, и каждый раз оценка превышала 90%, а в двух случаях достигала 100%.
Остаётся ждать, пока кто-то выделит около десяти тысяч долларов на полноценные прогоны, и следить за новыми релизами. Кстати, свежую модель от Anthropic мы надеемся увидеть уже сегодня.

