Релиз Wan 3.0: мультимодальная генерация видео до 30 секунд в 1080p и запуск по API

Это самая функциональная All-in-One модель для генерации видео за последние месяцы. Архитектура Wan 3.0 принимает на вход практически всё: текст, статику, видео и даже аудио. Движок умеет собирать ролики с нуля, анимировать изображения по первому и последнему кадру, а также стилизовать исходники на основе референсов. На выходе получается стабильный контент длительностью до 30 секунд с честным разрешением 1080p!
Изначально модель тестировали в закрытом режиме на мощностях Alibaba, но сейчас она массово выходит в паблик через API. Официальная бета для пользователей уже открыта на wan.video, а интерфейс подхватили ребята из VivaReel. Для разработчиков условия еще интереснее. На WaveSpeedAI секунда рендера в максимальном качестве стоит $0.24, а платформа Pixazo демпингует и отдает тот же Full HD за $0.17. Интеграция в Fal и Replicate ожидается со дня на день.
Главная ценность релиза кроется именно в унификации. Вместо того чтобы гонять пайплайны через три разные нейросети для анимации, работы со звуком и стилизации, теперь достаточно одного эндпоинта. Такой подход радикально снижает затраты на разработку креативных агентов и автоматизацию сложного медиапродакшена.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад