Обзор self-evolving AI-агентов: как понять, что агент действительно стал лучше после изменения самого себя?
Вышел большой обзор по self-evolving AI-агентам. Авторы работы Diving into Reliable Self-Evolving Agents систематизировали исследования агентов, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.
Внутри несколько полезных вещей:
- taxonomy уровней эволюции от L0 до L4;
- reliability ladder для проверки, можно ли доверять очередному self-update;
- открытый каталог из 549 работ по теме;
- разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.
Особенно важный принцип: обновление не должно само контролировать единственное доказательство собственной успешности.
Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.

