ЗДЕСЬ медиа
fal.ai

API Seedance 2.5: генерация 30-секундных видео с 50 мультимодальными референсами и анализ стоимости

ByteDance открыла доступ к API Seedance 2.5, где ключевым обновлением стал эндпоинт reference-to-video. Модель обрабатывает до 50 мультимодальных референсов одновременно, позволяя комбинировать изображения, видео и аудио для контроля над внешностью, движением и композицией. Генерация происходит единым 30-секундным дублем без скрытых склеек, при этом звук и видеоряд создаются совместно в одном латентном пространстве, что делает аудио полноценным сигналом для тайминга происходящего на экране.

Взаимодействие с API построено на позиционном цитировании. Разработчики передают массивы ссылок на медиафайлы, а в текстовом промпте ссылаются на них через теги формата [Image1] или [Video1]. Этот подход позволяет в одном запросе описать замену объекта, перенос движений или изменение стиля, при этом параметры duration и aspect_ratio могут вычисляться моделью автоматически на основе загруженных исходников. Для интеграции используется клиент @fal-ai/client, поддерживающий асинхронную обработку очередей, поскольку запросы с видеореференсами требуют наибольшего времени вычислений.

Стоимость использования модели напрямую зависит от выбранного провайдера. На платформе fal тарификация базируется на токенах: секунда видео в 720p обойдется примерно в $0.473, что составляет около $14.19 за 30-секундный ролик. При загрузке видеореференсов применяется понижающий коэффициент 0.6, однако биллинг учитывает длительность как выходного, так и исходного видео. При этом базовая тарификация самой ByteDance составляет около $10.37 за миллион токенов, а альтернативные агрегаторы вроде Atlas Cloud предлагают ставки от $0.134 за секунду. Подобный разброс цен делает выбор инфраструктуры определяющим фактором при масштабировании генеративных видеопродуктов.

Поделиться:

Telegram

Ещё из архива

Все публикации