FLUX 3 засветился раньше времени: это не просто генератор картинок?
Вокруг FLUX 3 разгорелся настоящий ажиотаж. На сайте Black Forest Labs ненадолго появилась страница с обещанием единой мультимодальной модели, которая генерирует не только изображения, но и видео, звук, а также некие «действия», при этом обладая пониманием мира.
Страницу быстро удалили, но её копия сохранилась в Wayback Machine. Почти одновременно глава BFL Робин Ромбах опубликовал загадочный видеотизер, а разработчик Machine Delusions заявил, что уже тестирует «новую модель» и что публика к ней не готова.
Судя по всему, FLUX 3 метит не в очередной продвинутый text-to-image, а в полноценную модель мира. Техническая база у BFL уже есть: весной компания показала Self-Flow, архитектуру для совместного обучения на изображениях, видео и аудио с заделом на планирование и робототехнику.
На Reddit энтузиазм быстро сменился привычными вопросами: будут ли открытые веса, сколько сотен гигабайт займёт модель и не окажется ли вся магия доступна только через API.
Мы считаем, что Black Forest Labs готовится переориентироваться с генерации картинок на создание миров, подобно Hunyuan. Ожидаем, что компания по традиции представит открытую дев-версию и закрытую про-версию, доступную через API.

