Sakana AI, MIT и NYU выяснили, почему VLM-агенты не могут повторить успех PicBreeder.
Мы обратили внимание на новое исследование Sakana AI, MIT и NYU, в котором визуально-языковые модели выступили в роли агентов открытого поиска. Идея заключалась в том, чтобы проверить, можно ли повторить феномен PicBreeder с помощью современных VLM-агентов.
Что такое PicBreeder и идея открытого поиска
В оригинальном PicBreeder не было целевой картинки. Люди просто выбирали изображения, которые казались им перспективными, и передавали их дальше. Через много поколений из случайных форм появлялись лица, животные, машины, черепа и другие неожиданные структуры.
Это важная идея из книги Кеннета Стэнли «Иллюзия целей»: сильные открытия часто рождаются не из оптимизации метрики, а из открытого поиска.
Как работали VLM-агенты
В новом эксперименте VLM-агенты действовали похожим образом:
- смотрели общий архив изображений
- выбирали то, что считают интересным
- развивали выбранные варианты
- публиковали новые изображения
- оценивали работы других агентов
Им не давали целевую картинку, функцию прогресса и не говорили, к чему нужно прийти.
Что показал эксперимент
VLM-агенты действительно находят визуальные и семантические зацепки. Если добавить агентов с разными «личностями», архив становится заметно шире и по разнообразию приближается к человеческому.
Но главный провал тоже виден: модели слишком быстро фиксируются на найденном мотиве. Вместо резкого смещения в новую область они часто начинают улучшать уже знакомую форму, стиль или смысл.
Человек в PicBreeder может увидеть случайную странность и превратить её в новое направление. VLM чаще видит паттерн и начинает его эксплуатировать.
Похоже, для open-ended discovery мало уметь распознавать новизну. Нужно ещё уметь менять собственный критерий интересного, бросать локально удачную ветку и сохранять слабые сигналы, которые пока не выглядят полезными.
Подробнее в блоге и научной статье:
pub.sakana.ai/picbreeder-vlm
arxiv.org/abs/2605.23908

