Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Alibaba представила Wan Streamer v0.1: AI-аватар для общения в реальном времени.

Компания Alibaba представила экспериментальную модель Wan Streamer v0.1, разработанную командой Alibaba Wan Team. Новинка предназначена для реалистичного общения с AI-аватаром в режиме реального времени: она одновременно «видит», «слышит», «думает», говорит и генерирует видео в формате стрима.

Ключевое отличие от привычных пайплайнов, где отдельно используются системы распознавания речи (ASR), большие языковые модели (LLM), синтез речи (TTS) и анимация, заключается в архитектуре. В Wan Streamer всё объединено в один Transformer, обрабатывающий текст, аудио и видео как единый поток.

Мы обратили внимание на заявленные технические характеристики:

  • Модель работает на скорости 25 кадров в секунду.
  • Задержка на стороне модели составляет около 200 мс.
  • Полная задержка с учётом сети достигает примерно 550 мс.

Эти показатели позволяют вести практически мгновенный full-duplex диалог, когда агент продолжает воспринимать пользователя даже во время собственного ответа. Исходный код пока не опубликован, однако доступен сайт проекта и научная статья.

Качество демонстрационных материалов пока невысокое: ролики представлены в низком разрешении 192p. Однако они демонстрируют важный переход от концепции «говорящей головы, прикрученной к чат-боту» к настоящей аудиовизуальной интерактивной модели.

Создатели делают акцент на том, что низкая задержка и точная синхронизация достигаются не инженерной склейкой модулей, а самой архитектурой. Использование causal encoders/decoders, block-causal attention и развертывание thinker–performer на двух GPU позволяют системе стримить восприятие и генерацию как непрерывный процесс. Названия конкретных видеокарт разработчики не раскрывают. Интересной деталью стало наличие у аватаров не только голов, но и рук, хотя на первых видео движения рук выглядят очень нервными.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.