FLUX 3 от Black Forest Labs: генерация 20-секундных видео с нативным аудио и драфт-режимом

Black Forest Labs выдали один из самых продуманных апдейтов на рынке генеративного видео. FLUX 3 — это единая мультимодальная архитектура, которая одновременно работает с текстом, изображениями, видео, аудио и даже предсказанием действий. Теперь можно генерировать ролики длиной до 20 секунд одним запросом, причём звук создаётся нативно вместе с видеорядом. Модель без костылей справляется с синхронизацией речи и фоновыми эффектами.
Главная фича, которая реально меняет пайплайн работы — режим Draft. Модель быстро и дёшево рендерит черновой вариант в HD-качестве за $0.06 за секунду. Если композиция и динамика устраивают, драфт отправляется на рендер и превращается в полноценное FHD-видео. Это избавляет от необходимости сжигать бюджеты на неудачные генерации в поиске нужного ракурса!
В основе модели лежит внутренняя разработка Self-Flow, которая выравнивает понимание разных модальностей на базовом уровне. Пока через API и дашборд доступна только видеогенерация. Открытые веса мультимодальной базы FLUX 3 Dev, генерация изображений и модуль Action для робототехники появятся на следующих этапах раскатки.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад