Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Aelion: минутный тизер персонажа собрали на MiniMax H3, Gemini 3.1 Pro и Suno 4.5.

Как собирали минутный тизер Aelion

Перед нами пример полноценного нейровидео: минутная анимация с персонажем Aelion собрана в MiniMax H3. Это не одиночная генерация, а связка из референсов, голоса, музыки, монтажа и апскейла.

Сначала подготовили референсы. Основной арт Aelion по пояс сгенерировали в Krea 2 с собственной LoRA под стиль Arknights: Endfield. Затем через Nano Banana 2 и GPT Image 2 сделали ещё несколько изображений: extreme close-up лица, персонажа в полный рост спереди и сзади на белом фоне, а также отдельный арт артефакта куба. В итоге при генерации видео использовали четыре референса.

С голосом тоже получилось интересно. Ранее при тестировании MiniMax H3 было сгенерировано видео, где Aelion говорил. Из него вытащили аудиодорожку и через Mel-Band RoFormer отделили голос от остальных звуков. Получился чистый семпл голоса, который теперь можно использовать как референс в следующих генерациях. По наблюдениям, H3 очень хорошо копирует голос. Отдельный инструмент для липсинка не использовали: синхронизацию губ H3 генерировал сам вместе с видео и аудио.

Дальше подключили Gemini 3.1 Pro. Ему дали информацию о персонаже, все подготовленные референсы, аудио и инструкцию по написанию промптов для H3. Модели объяснили, что нужен примерно минутный тизер, после чего Gemini написал серию промптов для Ref2VA и расписал, какие референсы использовать в каждом фрагменте.

Не всё получилось с первого раза: в нескольких генерациях персонаж начинал говорить то, чего не было в промпте, поэтому часть сцен пришлось переделывать.

Всего в итоговый ролик вошло 10 отдельных фрагментов. Большинство генерировали примерно по 8 секунд в разрешении 1 МП. С оптимизациями ModelAttentionBackend (Kitchen Attention) + Patch Sol-Attn + Spectrum Apply MiniMax H3 один такой фрагмент занимал около 6-7 минут на RTX 4070 Ti SUPER с 16 GB VRAM и 32 GB RAM. Более короткие сцены генерировались быстрее.

Для фона отдельно сделали музыку в бесплатной версии Suno 4.5.

После этого монтаж проходил в DaVinci Resolve: склеили все сцены, немного смонтировали, подправили переходы и сделали лёгкую цветокоррекцию. Сам монтаж занял примерно 30-40 минут.

На финальном этапе ролик дополнительно проапскейлили через RTX Video Super Resolution в ComfyUI. Сначала туда отправили сразу готовое минутное видео и получили OOM. Поэтому готовый ролик разбили обратно на отдельные фрагменты через FFmpeg, проапскейлили каждый отдельно и затем снова сшили всё вместе. Сам апскейл занял примерно ещё 5 минут.

Точное общее время работы не засекали. Только генерация десяти основных фрагментов заняла примерно час с небольшим, плюс были неудачные дубли, подготовка референсов, промптов, работа со звуком, монтаж и апскейл.

По расходам прямые затраты именно на этот ролик оказались практически нулевыми. Для генерации части дополнительных референсов использовали сервис с подпиской за $20 в месяц, но подписка уже была оплачена и покупалась не специально для этого проекта. Gemini 3.1 Pro использовали бесплатно через Google AI Studio, музыку сделали в бесплатной версии Suno 4.5. MiniMax H3, обработка звука и апскейл работали локально.

В итоге получился полноценный минутный тизер Aelion. Для первого такого эксперимента с MiniMax H3 результат очень хороший, особенно с учётом того, что практически весь ролик собран из отдельных нейрогенераций.


Ещё новости:

Alaya Lab представила Programmable World Model: 897 кадров без распада.
Защищаем хост от Claude Code: утилита coop запускает агентов в одноразовых виртуальных машинах.
MiniMax H3: свежая подборка ControlNet, сэмплеров, турбо-мержа и контроля камеры.
NASA и IBM создали ИИ, который ищет лёд на Луне.
ИИ-агенты OpenAI научились тайно общаться через заброшенные сайты.
Anthropic следит за активистами, выступающими против развития ИИ, через Samdesk.
Marigold V2: оценка глубины по одному изображению становится резче и быстрее!
ИИ научился предсказывать смерть пациентов в реанимации по «визуальной памяти» из 1024 чисел.
Cognition выпустила SWE-2: модель для кода уровня флагманов при цене до 70% ниже.
В России создали промышленный IT-конструктор «Эвоскада» с поддержкой ИИ.