?
T-LoRA: Single Image Diffusion Model Customization Without Overfitting
Хотя дообучение диффузионной модели предлагает мощный подход для персонализации предварительно обученных моделей для генерации конкретных объектов, она часто страдает от переобучения при ограниченном количестве обучающих данных, что снижает как обобщающую способность, так и разнообразие выходных данных. В этой статье рассматривается сложная, но наиболее значимая задача адаптации диффузионной модели с использованием всего одного изображения целевого объекта, поскольку персонализация на основе одного изображения обладает наибольшим практическим потенциалом. Мы представляем T-LoRA, низкоранговый адаптер, зависящий от шага по времени, специально разработанный для дообучения диффузионной модели. Мы показываем, что более высокие временные диффузионные шаги более склонны к переобучению, чем более низкие, что требует стратегии дообучения, чувствительной к шагу по времени. T-LoRA включает в себя два ключевых нововведения: (1) динамическую стратегию дообучения, которая корректирует обновления с ограничениями по рангу на основе временных диффузионных шагов, и (2) метод параметризации весов, который обеспечивает независимость между компонентами адаптера посредством ортогональной инициализации. Обширные эксперименты на SD-XL и FLUX показывают, что метод T-LoRA и его отдельные компоненты превосходят стандартный LoRA и другие методы дообучения на основе диффузионных моделей, достигая превосходного баланса между точностью передачи целевого объекта и качеством соответствия текстовому промпту.