Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Stanford и MIT: Meta-Harness показал, что обвязка LLM меняет результаты до 6×.

Исследователи из Stanford и MIT представили Meta-Harness: End-to-End Optimization of Model Harnesses. Работа показывает, что один и тот же LLM может давать радикально разные результаты в зависимости от того, как устроен surrounding system code.

Что решает harness

  • что хранить в контексте;
  • что извлекать из памяти;
  • какие данные показывать модели;
  • как вызывать инструменты;
  • как обрабатывать ошибки и повторные попытки;
  • как устроен workflow агента.

На одном и том же benchmark разница между harness может доходить до 6× при неизменной базовой модели.

Авторы предлагают Meta-Harness: внешний optimization loop, который автоматически улучшает код harness. Вместо одного score он получает доступ к цепочке code → logs → execution traces → previous attempts через filesystem-like среду и на основе этого переписывает сам harness.

Результаты

  • +7,7 пункта на online text classification относительно сильного SOTA context management;
  • примерно в 4 раза меньше context tokens;
  • +4,7 пункта в среднем на retrieval-augmented math reasoning по 5 held-out моделям и 200 задачам уровня IMO;
  • на agentic coding найденные harness обошли сильные hand-engineered baselines на TerminalBench-2.

Мы видим главный вывод работы так: вопрос уже не только в том, «какая модель лучше», а в том, «как построена вся система вокруг модели». Для production это напрямую влияет на reliability, tool use, context management, recovery после ошибок и стоимость запуска.

Статья: arxiv.org/abs/2603.28052

Этот пост Вконтакте:

Ещё новости:

WorldCrafter: видеомодель мира с неявной 3D-памятью и возвратом к знакомым ракурсам.
Технический отчёт MiMo V2.6: Reinforcement Learning ускорен, но Сберу и Яндексу стоит сменить курс.
Вышел Jev Skill Suggestion: мод для Claude Code экономит токены в несколько раз.
Сотрудник уволился в первый рабочий день после контроля в Zoom. Как ИИ меняет удалёнку?
OpenAI запустила 4 бесплатных курса: ИИ для работы, разработки, бизнеса и учёбы.
Google представила открытый оркестратор AX для агентных задач.
Цифры те же, а смысл поехал: как вычитывать правки после ИИ?
Доля написанных нейросетями патчей ядра Linux выросла почти в 50 раз за 7 месяцев.
Google представила Googlebook: сенсорный OLED-экран, 14 часов автономности и встроенный Gemini.
Вышел Grok 4.7: новая модель xAI частично опережает GPT 5.6 Sol и Fable 5.1.