Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Sakana AI, MIT и NYU выяснили, почему VLM-агенты не могут повторить успех PicBreeder.

Мы обратили внимание на новое исследование Sakana AI, MIT и NYU, в котором визуально-языковые модели выступили в роли агентов открытого поиска. Идея заключалась в том, чтобы проверить, можно ли повторить феномен PicBreeder с помощью современных VLM-агентов.

Что такое PicBreeder и идея открытого поиска

В оригинальном PicBreeder не было целевой картинки. Люди просто выбирали изображения, которые казались им перспективными, и передавали их дальше. Через много поколений из случайных форм появлялись лица, животные, машины, черепа и другие неожиданные структуры.

Это важная идея из книги Кеннета Стэнли «Иллюзия целей»: сильные открытия часто рождаются не из оптимизации метрики, а из открытого поиска.

Как работали VLM-агенты

В новом эксперименте VLM-агенты действовали похожим образом:

  • смотрели общий архив изображений
  • выбирали то, что считают интересным
  • развивали выбранные варианты
  • публиковали новые изображения
  • оценивали работы других агентов

Им не давали целевую картинку, функцию прогресса и не говорили, к чему нужно прийти.

Что показал эксперимент

VLM-агенты действительно находят визуальные и семантические зацепки. Если добавить агентов с разными «личностями», архив становится заметно шире и по разнообразию приближается к человеческому.

Но главный провал тоже виден: модели слишком быстро фиксируются на найденном мотиве. Вместо резкого смещения в новую область они часто начинают улучшать уже знакомую форму, стиль или смысл.

Человек в PicBreeder может увидеть случайную странность и превратить её в новое направление. VLM чаще видит паттерн и начинает его эксплуатировать.

Похоже, для open-ended discovery мало уметь распознавать новизну. Нужно ещё уметь менять собственный критерий интересного, бросать локально удачную ветку и сохранять слабые сигналы, которые пока не выглядят полезными.

Подробнее в блоге и научной статье:
pub.sakana.ai/picbreeder-vlm
arxiv.org/abs/2605.23908

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.