ЗДЕСЬ медиа
seed.bytedance.com

ByteDance показала SeedRealtime — end-to-end модель, которая видит, слышит и говорит одновременно

ByteDance выпустила SeedRealtime — нативную аудиовизуальную full-duplex модель. В отличие от привычных каскадных систем, где модули распознавания речи, зрения и генерации ответа работают по очереди, здесь всё собрано в единую архитектуру. Модель непрерывно анализирует видеопоток и звук, параллельно принимая решения о происходящем в кадре, без использования внешних детекторов голосовой активности (VAD) для определения пауз.

Главное техническое отличие кроется в совместном моделировании звука, картинки и времени. Если пользователь указывает на предмет и спрашивает «как это работает», нейросеть считывает жесты и визуальный контекст для понимания отсылки. В шумной комнате система способна сопоставить голоса с лицами спикеров и удерживать этот контекст. При этом модель не ждет прямой команды: она может сама инициировать диалог, заметив нужный объект в камере, или прервать пользователя в реальном времени, если тот совершает ошибку при работе с оборудованием.

Отказ от жесткой очередности «вопрос-ответ» решает базовую проблему современных ассистентов — рваный темп беседы. SeedRealtime игнорирует фоновый шум, отличает обращение к себе от разговора людей между собой и умеет вовремя вступать в диалог. По данным разработчиков, энтузиастам больше не придется ждать окончания генерации ответа: архитектура позволяет нейросети слушать, смотреть и говорить одновременно, переводя интерфейсы из режима пассивного реагирования в формат активного соучастия.

Поделиться:

Telegram

Ещё из архива

Все публикации