ModelScope превращает старые бенчмарки в тесты для AI-агентов.
Мир оценки AI-моделей переживает интересный сдвиг: ModelScope добавили в EvalScope режим Agent Evaluation Mode. Это важное обновление, которое позволяет стандартные бенчмарки прогонять не только как связку «вопрос-ответ», а как полноценные агентные сценарии.
Ребята сделали всё максимально удобно. Наборы данных GSM8K, AIME, IFEval и SWE-Bench можно превратить в multi-turn задачи одной настройкой в конфиге. Дальше AgentLoop сам гоняет модель по циклу: сгенерировала шаг, вызвала инструмент, получила наблюдение, повторила. Для оценки агентов это гораздо ближе к реальности. В реальной эксплуатации модель редко просто отвечает текстом. Она вызывает функции, пишет код, запускает shell или Python, ошибается, читает вывод, чинит решение и идёт дальше.
Гибкие стратегии и полный контроль
В EvalScope теперь можно переключать стратегии: Function Calling, ReAct или SWE-Bench protocol. Разработчики могут сохранять полный trace: каждый шаг, ошибку, tool call и наблюдение. Потом всё это воспроизводится в Web Dashboard, что особенно полезно для дебага, а не только для красивой цифры в таблице.
Безопасность через sandbox
Отдельно завезли безопасный sandbox через Docker и ms-enclave, чтобы shell и Python-инструменты запускались изолированно. Это важно, потому что агентные бенчмарки без sandbox быстро превращаются в рискованный запуск чужого кода.
Ничего не ломается
Самое удобное: старые бенчмарки не надо переписывать. Включаешь Agent Mode в TaskConfig, и обычная проверка превращается в агентный прогон.
Мы видим, что оценка AI-систем постепенно уходит от статичного теста «какая модель умнее» к более сложному вопросу: как она ведёт себя в цикле, с инструментами, ошибками, ограничениями и реальным состоянием среды. Вот это уже ближе к тому, что потом ломается в реальной работе.
Подробнее о проекте можно узнать на странице EvalScope на GitHub.

