ЗДЕСЬ медиа
stability-ai.github.io

Декомпозиция изображений на RGBA-слои с помощью фреймворка Stable-Layers

Исследователи из Stability AI представили фреймворк Stable-Layers, предназначенный для разделения плоских изображений на независимые RGBA-слои с автоматической дорисовкой перекрытых областей фона. В основе системы лежит модель Qwen-Image-Layered, которая была дообучена методами обучения с подкреплением, в частности через алгоритм Flow-GRPO, что позволило полностью отказаться от использования парных размеченных данных в процессе тренировки.

Для контроля качества декомпозиции вместо традиционной разметки используется обратная связь от визуально-языковой модели (VLM), выступающей в роли автоматического судьи. Поскольку изолированная оценка сгенерированных слоев обычно приводит к слишком узкому диапазону баллов и снижает эффективность алгоритма GRPO, разработчики внедрили двухэтапный конвейер, при котором первоначальный скоринг каждого семпла по пяти критериям дополняется калибровочным сравнением всех кандидатов одновременно.

В результате модель научилась изолировать отдельные семантические элементы с более чистыми альфа-масками, избегая характерного для базовой нейросети дублирования композиции в слоях переднего плана. Анализ ошибок реконструкции показывает снижение средних показателей искажений на всех этапах декомпозиции, что означает общее повышение точности извлечения объектов и уменьшение цветовых артефактов в полупрозрачных областях.

Поделиться:

Telegram

Ещё из архива

Все публикации