Китайский стартап MiniMax представил мультимодальную видеомодель Hailuo H3 с открытыми весами

Китайский ИИ-стартап MiniMax выпустил мультимодальную модель генерации видео Hailuo H3, способную одновременно обрабатывать текст, визуальные входные данные и аудио. Согласно информации Reuters, этот релиз напрямую обостряет конкуренцию на быстрорастущем рынке видеогенерации, где ранее доминировали решения от технологических гигантов ByteDance и Kuaishou.
Архитектура системы представляет собой не просто минорное обновление предыдущей версии Hailuo 2.3, а попытку объединить алгоритмы генерации, виртуальной режиссуры и звукового сопровождения в едином вычислительном контуре. Модель поддерживает базовые форматы text-to-video и image-to-video, при этом разработчики добавили возможность создания последовательности из нескольких сцен с сохранением общей логики повествования.
Ключевым фактором на фоне конкурентов становится экономическая и дистрибуционная стратегия проекта, поскольку заявленная стоимость использования API в три раза ниже существующих закрытых аналогов. При этом команда MiniMax анонсировала планы по переводу H3 в статус open-source, в результате чего публикация открытых весов может существенно изменить техническую расстановку сил в сегменте коммерческой видеогенерации.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад