SLDDM-TPG: Semi-supervised Latent Disentangled Diffusion Model for Textile Pattern Generation
给定一个自然衣服图像,SLDDM-TPG 可以精准解耦复杂图案与衣物非刚性形变,生成一张平整、清晰、无缺陷的高保真工业级纺织品设计图,可直接用于时装设计图生产 (详情可点击上面的Arxiv标志查看论文,点击上面的Github标志访问项目代码)。
图 0: SLDDM-TPG 整个工作的架构
1. 概述
本文提出了首个用于纺织图案生成(TPG, Textile Pattern Generation)的半监督潜在解耦扩散模型 SLDDM-TPG。其核心目标是从真实的衣物穿搭图像中提取复杂的图案内容与设计,克服衣物形变、遮挡和模糊等问题,重建成高保真、结构规整且无纹理缺陷的平面纺织品设计图。该研究极大降低了时尚工程的设计成本并保持了极高的创作保真度。
图 1: SLDDM-TPG生成效果
2. 动机与解决的问题
- 现有的图像到图像(I2I)扩散模型在直接应用于 TPG 任务时,存在极其严重的 特征混淆(Feature Confusion) 问题:
- 纹理缺陷纠缠:真实的衣物图像不仅包含目标图案信息,还混杂了由于衣物折叠、环境光影导致的非刚性畸变和遮挡。模型直接摄取这些表征会导致输出结果不忠实且丢失细粒度特征。
- 语义描述瓶颈:纯文本引导在描述复杂、抽象的视觉纺织品设计时表现乏力。
- 数据稀缺导致过拟合:由于高质量的“衣物-图案”成对训练数据极度短缺,常规的监督学习模型极易陷入过拟合且泛化表现极差。
图 2: SLDDM-TPG与其他方法在CTP-HD数据集上的比较效果
3. 核心方法
为解决上述挑战,SLDDM-TPG 被精心设计为两阶段框架,实现了“特征解耦”与“半监督对齐”的完美结合:
图 3: SLDDM-TPG的整体架构
Stage 1: 潜在解耦网络 (LDN)
LDN 旨在通过多维独立特征空间,彻底解耦有用的图案信息和无关的纹理缺陷:
- 相似性对比模块 (SCM):提取衣物与目标图案间的共享语义内容,作为生成过程的正向引导信号 。
- 反向注意力模块 (RAM):专门捕捉衣物特有的纹理瑕疵,以此构建负向提示(Negative Prompts)。
- 结构仿射变换 (SATs):将提取出的低级缺陷特征 ,映射为具备“平整、清晰、全可视”等结构化属性的表征 ,与 RAM 联合训练以防特征空间偏移,弥补衣服图像所缺失的结构性。
Stage 2: 半监督潜在扩散模型 (S-LDM)
在 LDN 的空间指导下,S-LDM 通过标记数据与额外无标签数据的混合训练来提升图像保真度:
- 级联架构:采用去噪过程(Denoising Process)与对齐过程(Alignment Process)。
- 稳态变换域损失 (STD Loss):在对齐阶段,将模型输出转化为半监督优化目标,不仅使其契合自然图案的全局分布,还能精准对齐当前参考衣物的特定细节。
- 卷积局部相似性 (CLS):针对图案本质上的“局部一致性”规律,通过局部特征匹配来保障输出设计的视觉连贯性。
图 4: SLDDM-TPG与其他方法在VITON-HD数据集(泛化实验)上的比较效果
4. 创新性贡献
- 首创任务框架:提出了首个实现高保真、细粒度且基于真实衣物的纺织图案生成模型 SLDDM-TPG。
- 核心痛点攻克:创新性提出潜在解耦网络(LDN),从根本上解决了衣物表征学习中的“特征混淆”问题。
- 半监督对齐策略:S-LDM 结合全新的 STD 损失对齐过程,高效利用无标注数据,极大突破了数据稀缺带来的泛化瓶颈。
- 全新数据集构建:开源了首个链接衣物与图案配对的高分辨率数据集 CTP-HD,如下图所示。
图 5: CTP-HD 数据集每个样本包含的数据示例
5. 总结
SLDDM-TPG 为时尚设计领域的纹理提取与重建立了一套极具潜力的标准范式。通过精妙的潜在特征解耦机制和半监督生成对齐策略,模型在 CTP-HD 数据集上优于主流 I2I 与相关 TPG 方法取得 SOTA (FID 高 4.1,SSIM 高 0.116), 并且在公开的虚拟试衣数据集 VITON-HD 上展现出良好的 Zero-shot 泛化性能。这为未来数字服装、智能设计制造等产业提供了强有力的技术支撑。
图 6: 不同方法以及我们提出的 SLDDM-TPG 方法在 CTP-HD 数据集上的更多定性结果