Модульный пайплайн LTX 2.3 All-in-One для ComfyUI с поддержкой ControlNet, липсинка и анимации по ключевым кадрам

Опубликована вторая версия модульного воркфлоу LTX 2.3 All-in-One для среды узлового программирования ComfyUI. Пайплайн работает как мультимодальная система генерации видео на базе нейросетей семейства LTX, что позволяет переключаться между текстовой генерацией, трансформацией изображений, синхронизацией губ и полностью управляемой анимацией за счет активации или отключения определенных групп нод.
Архитектура сборки поддерживает квантованные модели в формате GGUF и обработку сегментированных текстовых запросов, при этом стилизация и фиксация персонажей осуществляются через интеграцию LoRA. Для работы со звуком внедрена поддержка пользовательских аудиодорожек и функция клонирования голоса через ID LoRA, в результате чего система автоматически выстраивает синхронизацию артикуляции с аудиорядом. Временной и пространственный контроль анимации обеспечивается применением ControlNet на основе референсных видеороликов, а также системой ключевых кадров, которая в текущем обновлении поддерживает до восьми изображений для жесткого структурирования промежуточных состояний сцены.
Баланс между скоростью рендеринга и детализацией достигается за счет алгоритма сэмплинга в половинном разрешении с последующим двукратным апскейлом. Процесс масштабирования был переработан таким образом, что теперь в качестве референса используются все заданные ключевые кадры, а не только стартовый, что означает более высокую визуальную консистентность объектов при финальной обработке инструментом LTX detailer.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад