Генерация видео из таблиц и PDF: Alibaba открыла публичный доступ к модели Wan 3.0

Очередной релиз в сфере генерации видео пытается удивить нестандартным подходом к исходным данным. Alibaba вывела в публичную бету модель Wan 3.0, способную выдавать ролики со звуком длиной до 30 секунд. Главный акцент разработчики делают на так называемой всеядности системы. Теперь нейросети можно скармливать не только промпты и картинки, но и документы форматов doc, xls, ppt и pdf размером до 100 мегабайт. Предполагается, что алгоритм проанализирует структуру файла и выдаст готовую инфографику или видеоряд.
Идея автоматизировать превращение квартальных отчетов в динамичные презентации звучит логично для корпоративного сектора. Правда, возникает резонное сомнение в качестве интерпретации сложных данных. Одно дело — анимировать простой график из таблицы, и совсем другое — заставить нейросеть вычленить смыслы из пятидесяти страниц текста без галлюцинаций. Обещанное жесткое сохранение консистентности персонажей на тридцатисекундной дистанции тоже вызывает скепсис. Текущие диффузионные архитектуры все еще имеют хроническую склонность к морфингу объектов на длинных планах.
Доступ к API уже открыт и тарифицируется посекундно. Генерация в разрешении 480p обойдется примерно в $0.04 за секунду, а за 1080p попросят около 1.2 юаня. Но пока заявленная функция создания роликов из электронных таблиц выглядит скорее как демонстрация серверных мощностей Alibaba, чем надежный пайплайн для продакшена. Вопрос в том, захотят ли пользователи платить за анимацию эксель-файлов, пока базовые проблемы с пространственной логикой в генеративном видео остаются нерешенными.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад