Выпуск Wan-Streamer v0.2: двусторонняя генерация аудио и видео для взаимодействия в реальном времени

Команда Alibaba Wan Team представила Wan-Streamer v0.2 — мультимодальную модель для двустороннего аудиовизуального взаимодействия в реальном времени. В основе системы лежит единый авторегрессионный Transformer, который обрабатывает текст, звук и видео в рамках нативной потоковой архитектуры, заменяя собой каскадные пайплайны из модулей распознавания речи, языкового понимания и генерации анимации.
Ключевым изменением версии 0.2 стало повышение разрешения видеопотока до 640×368 при частоте 25 FPS, при этом задержка обработки на стороне модели сохранилась на уровне 200 миллисекунд. Баланс между скоростью реакции и качеством картинки достигается за счет архитектуры Thinker-Performer, где первый узел отвечает за быстрое обновление состояний, а второй берет на себя ресурсоемкую генерацию визуальных данных через контекстно-параллельную обработку на нескольких GPU.
Возросшая детализация выводит генерацию за пределы крупных планов. В процессе общения система обеспечивает стабильную отрисовку мимики, направления взгляда, жестикуляции рук и положения тела, что означает переход к моделированию полноценных пространственных диалогов на средних планах при сохранении общей сетевой задержки отклика в пределах 550 миллисекунд.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад