Alibaba представила Wan Streamer v0.1: AI-аватар для общения в реальном времени.
Компания Alibaba представила экспериментальную модель Wan Streamer v0.1, разработанную командой Alibaba Wan Team. Новинка предназначена для реалистичного общения с AI-аватаром в режиме реального времени: она одновременно «видит», «слышит», «думает», говорит и генерирует видео в формате стрима.
Ключевое отличие от привычных пайплайнов, где отдельно используются системы распознавания речи (ASR), большие языковые модели (LLM), синтез речи (TTS) и анимация, заключается в архитектуре. В Wan Streamer всё объединено в один Transformer, обрабатывающий текст, аудио и видео как единый поток.
Мы обратили внимание на заявленные технические характеристики:
- Модель работает на скорости 25 кадров в секунду.
- Задержка на стороне модели составляет около 200 мс.
- Полная задержка с учётом сети достигает примерно 550 мс.
Эти показатели позволяют вести практически мгновенный full-duplex диалог, когда агент продолжает воспринимать пользователя даже во время собственного ответа. Исходный код пока не опубликован, однако доступен сайт проекта и научная статья.
Качество демонстрационных материалов пока невысокое: ролики представлены в низком разрешении 192p. Однако они демонстрируют важный переход от концепции «говорящей головы, прикрученной к чат-боту» к настоящей аудиовизуальной интерактивной модели.
Создатели делают акцент на том, что низкая задержка и точная синхронизация достигаются не инженерной склейкой модулей, а самой архитектурой. Использование causal encoders/decoders, block-causal attention и развертывание thinker–performer на двух GPU позволяют системе стримить восприятие и генерацию как непрерывный процесс. Названия конкретных видеокарт разработчики не раскрывают. Интересной деталью стало наличие у аватаров не только голов, но и рук, хотя на первых видео движения рук выглядят очень нервными.

