Pika запустила музыкальную нейросеть с поддержкой голосовых референсов и автотюна

Команда Pika выпустила собственное семейство аудиомоделей, где главным релизом стала Pika Music. Разработчики сделали ставку не на массовый веб-интерфейс, а на глубокий контроль через API и экстремальную скорость синтеза, напрямую атакуя позиции Suno и MiniMax.
На вход модель принимает не только текстовый промпт и стихи. Система поддерживает загрузку аудиореференсов для точного копирования музыкального стиля и сэмплы голоса для генерации вокала. Алгоритм умеет автоматически корректировать фальшивое пение из пользовательских исходников, вытягивая ноты до нужной тональности. Максимальная длина одного генерируемого трека достигает шести минут.
Ключевое техническое отличие новой модели кроется в скорости работы. Девяносто секунд готового аудио рендерятся в среднем за 6.21 секунды — это в 14.5 раза быстрее реального времени воспроизведения. Генератор уже доступен в песочнице API-платформы, а стоимость составляет $0.015 за минуту итогового материала с оплатой только за успешные запросы.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад