Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

ModelScope превращает старые бенчмарки в тесты для AI-агентов.

Мир оценки AI-моделей переживает интересный сдвиг: ModelScope добавили в EvalScope режим Agent Evaluation Mode. Это важное обновление, которое позволяет стандартные бенчмарки прогонять не только как связку «вопрос-ответ», а как полноценные агентные сценарии.

Ребята сделали всё максимально удобно. Наборы данных GSM8K, AIME, IFEval и SWE-Bench можно превратить в multi-turn задачи одной настройкой в конфиге. Дальше AgentLoop сам гоняет модель по циклу: сгенерировала шаг, вызвала инструмент, получила наблюдение, повторила. Для оценки агентов это гораздо ближе к реальности. В реальной эксплуатации модель редко просто отвечает текстом. Она вызывает функции, пишет код, запускает shell или Python, ошибается, читает вывод, чинит решение и идёт дальше.

Гибкие стратегии и полный контроль

В EvalScope теперь можно переключать стратегии: Function Calling, ReAct или SWE-Bench protocol. Разработчики могут сохранять полный trace: каждый шаг, ошибку, tool call и наблюдение. Потом всё это воспроизводится в Web Dashboard, что особенно полезно для дебага, а не только для красивой цифры в таблице.

Безопасность через sandbox

Отдельно завезли безопасный sandbox через Docker и ms-enclave, чтобы shell и Python-инструменты запускались изолированно. Это важно, потому что агентные бенчмарки без sandbox быстро превращаются в рискованный запуск чужого кода.

Ничего не ломается

Самое удобное: старые бенчмарки не надо переписывать. Включаешь Agent Mode в TaskConfig, и обычная проверка превращается в агентный прогон.

Мы видим, что оценка AI-систем постепенно уходит от статичного теста «какая модель умнее» к более сложному вопросу: как она ведёт себя в цикле, с инструментами, ошибками, ограничениями и реальным состоянием среды. Вот это уже ближе к тому, что потом ломается в реальной работе.

Подробнее о проекте можно узнать на странице EvalScope на GitHub.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.