xAI представила бенчмарк DeepSWE для долгосрочной программной инженерии.
Компания xAI представила официальный бенчмарк DeepSWE, созданный для оценки ИИ-агентов в задачах долгосрочной программной инженерии (long-horizon software engineering).
В него вошли 113 оригинальных задач, собранных из 91 открытого репозитория на 5 языках программирования. По сравнению с популярным SWE-Bench, DeepSWE минимизирует риск «загрязнения» (contamination): модели не видели решений заранее. К тому же каждая задача требует в среднем около 668 строк кода, что лучше отражает реальные рабочие процессы разработчиков.
Проще говоря, это тест для автономных ИИ-агентов на длинных дистанциях разработки.

