Обновленный бенчмарк SWE-rebench показал преимущество OpenAI GPT-5.5 над Claude Opus.
Ребята из Nebius обновили SWE-rebench после двухмесячного перерыва, добавив 110 новых задач. В отличие от многих других бенчмарков, наконец-то добавляют запуски в Codex и Claude Code. Просто писать «GPT-5.5 в очередной раз статистически значимо лучше моделей Anthropic» не хотелось, но Ибрагим, первый автор статьи, добавил немного аналитики по эффективности.
- GPT-5.5 medium выглядит заметно эффективнее, чем Opus 4.8 high (обе настройки — значения по умолчанию)
- Opus 4.8 стал более оптимизирован по сравнению с 4.6: больше решенных задач, на 45% меньше токенов на задачу и примерно на 39% ниже стоимость решения задачи.
- Opus 4.8 high практически не превосходит Opus 4.7 high по качеству, но значительно дешевле в плане вычислительных ресурсов. Количество токенов на задачу снизилось с 1.5 млн до 1 млн, а среднее количество шагов уменьшилось с 44 до 34.
- Полезной метрикой является pass^5. Здесь задача засчитывается только в том случае, если она была решена во всех 5 независимых запусках. GPT-5.5 vs GPT-5.4 — 51 vs 39 задач, модель гораздо меньше полагается на «везение», что один раз получилось решить, другой нет. Для Opus это число практически одинаково во всех версиях модели.
- Open-source очень сильно отстаёт
- Composer 2.5 от Cursor на этом наборе задач выглядит очень перспективно за счёт цены (см. колонку) — в 4 раза дешевле GPT-5.5 medium
- Ещё отметим, что Claude получает гораздо больший прирост качества из-за использования родного скаффолда, в то время как GPT показывает практически тот же результат (хотя цена отличается в два раза, интересно почему).
В целом, можно с уверенностью сказать, что модели OpenAI с появлением 5.5 перешли в новую эпоху. Если долгое время в программировании они отставали от Anthropic, а затем сравнялись, то теперь они часто обходят конкурентов (особенно если не учитывать фронтенд).

