Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Tencent Hunyuan представила EvolveScaler: бенчмарк, проверяющий умение LLM рассуждать в меняющемся мире.

Tencent Hunyuan представила EvolveScaler: бенчмарк и датасет для проверки того, умеют ли LLM рассуждать в мире, где информация постоянно меняется.

В качестве примера задачи модель читает журнал RPG за 40 дней, а затем получает вопрос: если на 7-й день пропустить мини-босса, получится ли всё равно победить финального босса? Прямого ответа в журнале RPG нет. Нужно фактически «переиграть» цепочку событий с изменённым условием.

Создатели называют это Information Evolution: записи могут отменяться, исправляться и дополняться задним числом. Поэтому простого поиска фактов в длинном контексте недостаточно.

EvolveScaler работает по обратному принципу:

  • сначала мир задаётся как исполняемая машина состояний;
  • логика и зависимости между событиями контролируются кодом;
  • затем эта история преобразуется в естественный язык;
  • модель должна восстановить состояние мира и просчитать последствия изменений.

Масштаб

  • 117 прототипов сценариев;
  • 159 типов вопросов;
  • 5 уровней сложности;
  • до ~1200 событий в одном примере.

Авторы протестировали 14 frontier-моделей. На самом сложном уровне медианный avg@5 падает до 11,3%. При этом обучение на EvolveScaler дало в среднем +5,25 пункта на 8 внешних бенчмарках, которые не использовались при создании датасета.

Работа проверяет не только понимание длинного контекста, но и способность модели поддерживать изменяющееся состояние мира, учитывать исправления и пересчитывать последствия контрфактических изменений.

Статья на arXiv

Страница проекта

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.