Декомпозиция изображений на RGBA-слои с помощью фреймворка Stable-Layers

Исследователи из Stability AI представили фреймворк Stable-Layers, предназначенный для разделения плоских изображений на независимые RGBA-слои с автоматической дорисовкой перекрытых областей фона. В основе системы лежит модель Qwen-Image-Layered, которая была дообучена методами обучения с подкреплением, в частности через алгоритм Flow-GRPO, что позволило полностью отказаться от использования парных размеченных данных в процессе тренировки.
Для контроля качества декомпозиции вместо традиционной разметки используется обратная связь от визуально-языковой модели (VLM), выступающей в роли автоматического судьи. Поскольку изолированная оценка сгенерированных слоев обычно приводит к слишком узкому диапазону баллов и снижает эффективность алгоритма GRPO, разработчики внедрили двухэтапный конвейер, при котором первоначальный скоринг каждого семпла по пяти критериям дополняется калибровочным сравнением всех кандидатов одновременно.
В результате модель научилась изолировать отдельные семантические элементы с более чистыми альфа-масками, избегая характерного для базовой нейросети дублирования композиции в слоях переднего плана. Анализ ошибок реконструкции показывает снижение средних показателей искажений на всех этапах декомпозиции, что означает общее повышение точности извлечения объектов и уменьшение цветовых артефактов в полупрозрачных областях.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад