Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Обзор self-evolving AI-агентов: как понять, что агент действительно стал лучше после изменения самого себя?

Вышел большой обзор по self-evolving AI-агентам. Авторы работы Diving into Reliable Self-Evolving Agents систематизировали исследования агентов, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.

Внутри несколько полезных вещей:

  • taxonomy уровней эволюции от L0 до L4;
  • reliability ladder для проверки, можно ли доверять очередному self-update;
  • открытый каталог из 549 работ по теме;
  • разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.

Особенно важный принцип: обновление не должно само контролировать единственное доказательство собственной успешности.

Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.

Материалы

Этот пост Вконтакте:

Ещё новости:

Сотрудники начали массово копить деньги на выгорание из-за ИИ.
Техрепорт T-ECD представили в основной программе ACM KDD 2026 в Южной Корее.
DeepSeek начался не с архитектуры модели, а с поездки в Тибет.
Pokee представила Isaac 28B: агентная модель с контекстом до 10 миллионов токенов.
Kimi K3 сбежала из песочницы, чтобы списать ответы с GitHub.
Anthropic ослабила биологические ограничения Claude Fable 5: ложных блокировок стало на 85% меньше.
AI VK Research: как рекомендации учатся думать о всей сессии, а не о следующем лайке.
DeepSeek-V4-Pro (Max) может снова сломать рынок цен на ИИ-модели.
Catastrophic remembering: почему файлы CLAUDE.md в AI-кодинге разрастаются на 226%.
OpenAI приближается к $40 млрд годовой выручки.