Ant Group и CICC представили FinFIRST: бенчмарк проверяет весь путь финансового AI-агента.
Мы изучили новый финансовый бенчмарк FinFIRST, который создан Ant Group вместе с инвестиционно-банковской командой CICC и более чем 50 финансовыми специалистами. Он оценивает AI-агентов на реальных финансовых задачах.
Что проверяет бенчмарк
- как агент ищет источники;
- насколько свежие данные использует;
- умеет ли объединять несколько источников;
- выбирает ли надёжные доказательства;
- правильно ли считает;
- насколько легко проверить полученный результат.
Задачи охватывают Китай, США, Гонконг и другие рынки:
- 60,2% задач представлены на китайском языке;
- 39,8% на английском;
- 61,8% требуют явных вычислений;
- 32,5% требуют нескольких источников;
- в 75,6% случаев агент сам должен найти и выбрать источники.
Для сравнения протестировали 15 конфигураций моделей в одинаковом ReAct-сетапе с Web Search, Visit и Python.
Модель Ling-3.0-flash-Fin набрала 82,45% по source verification, показав один из сильных результатов среди протестированных open-weight моделей.
Уже готовится FinFIRST V2 с более широким набором задач по финансовому поиску и сложным research-сценариям.
Датасет доступен по ссылке: https://huggingface.co/datasets/inclusionAI/FinFIRST

