Stanford и MIT: Meta-Harness показал, что обвязка LLM меняет результаты до 6×.
Исследователи из Stanford и MIT представили Meta-Harness: End-to-End Optimization of Model Harnesses. Работа показывает, что один и тот же LLM может давать радикально разные результаты в зависимости от того, как устроен surrounding system code.
Что решает harness
- что хранить в контексте;
- что извлекать из памяти;
- какие данные показывать модели;
- как вызывать инструменты;
- как обрабатывать ошибки и повторные попытки;
- как устроен workflow агента.
На одном и том же benchmark разница между harness может доходить до 6× при неизменной базовой модели.
Авторы предлагают Meta-Harness: внешний optimization loop, который автоматически улучшает код harness. Вместо одного score он получает доступ к цепочке code → logs → execution traces → previous attempts через filesystem-like среду и на основе этого переписывает сам harness.
Результаты
- +7,7 пункта на online text classification относительно сильного SOTA context management;
- примерно в 4 раза меньше context tokens;
- +4,7 пункта в среднем на retrieval-augmented math reasoning по 5 held-out моделям и 200 задачам уровня IMO;
- на agentic coding найденные harness обошли сильные hand-engineered baselines на TerminalBench-2.
Мы видим главный вывод работы так: вопрос уже не только в том, «какая модель лучше», а в том, «как построена вся система вокруг модели». Для production это напрямую влияет на reliability, tool use, context management, recovery после ошибок и стоимость запуска.
Статья: arxiv.org/abs/2603.28052

