主页

SLDDM-TPG: Semi-supervised Latent Disentangled Diffusion Model for Textile Pattern Generation

(第一作者 Accepted by AAAI 2026 [CCF-A])
SLDDM-TPG: Semi-supervised Latent Disentangled Diffusion Model for Textile Pattern Generation

给定一个自然衣服图像,SLDDM-TPG 可以精准解耦复杂图案与衣物非刚性形变,生成一张平整、清晰、无缺陷的高保真工业级纺织品设计图,可直接用于时装设计图生产 (详情可点击上面的Arxiv标志查看论文,点击上面的Github标志访问项目代码)。

SLDDM-TPG 整个工作的架构
图 0: SLDDM-TPG 整个工作的架构

1. 概述

本文提出了首个用于纺织图案生成(TPG, Textile Pattern Generation)的半监督潜在解耦扩散模型 SLDDM-TPG。其核心目标是从真实的衣物穿搭图像中提取复杂的图案内容与设计,克服衣物形变、遮挡和模糊等问题,重建成高保真、结构规整且无纹理缺陷的平面纺织品设计图。该研究极大降低了时尚工程的设计成本并保持了极高的创作保真度。

SLDDM-TPG Model Architecture
图 1: SLDDM-TPG生成效果

2. 动机与解决的问题

  • 现有的图像到图像(I2I)扩散模型在直接应用于 TPG 任务时,存在极其严重的 特征混淆(Feature Confusion) 问题:
    • 纹理缺陷纠缠:真实的衣物图像不仅包含目标图案信息,还混杂了由于衣物折叠、环境光影导致的非刚性畸变和遮挡。模型直接摄取这些表征会导致输出结果不忠实且丢失细粒度特征。
    • 语义描述瓶颈:纯文本引导在描述复杂、抽象的视觉纺织品设计时表现乏力。
    • 数据稀缺导致过拟合:由于高质量的“衣物-图案”成对训练数据极度短缺,常规的监督学习模型极易陷入过拟合且泛化表现极差。

SLDDM-TPG Model Architecture
图 2: SLDDM-TPG与其他方法在CTP-HD数据集上的比较效果

3. 核心方法

为解决上述挑战,SLDDM-TPG 被精心设计为两阶段框架,实现了“特征解耦”与“半监督对齐”的完美结合:

SLDDM-TPG Model Architecture
图 3: SLDDM-TPG的整体架构

Stage 1: 潜在解耦网络 (LDN)

LDN 旨在通过多维独立特征空间,彻底解耦有用的图案信息和无关的纹理缺陷:

  • 相似性对比模块 (SCM):提取衣物与目标图案间的共享语义内容,作为生成过程的正向引导信号 fScf^c_S
  • 反向注意力模块 (RAM):专门捕捉衣物特有的纹理瑕疵,以此构建负向提示(Negative Prompts)fTcf^c_T
  • 结构仿射变换 (SATs):将提取出的低级缺陷特征 fTcf^c_T,映射为具备“平整、清晰、全可视”等结构化属性的表征 fAcf^c_A,与 RAM 联合训练以防特征空间偏移,弥补衣服图像所缺失的结构性。

Stage 2: 半监督潜在扩散模型 (S-LDM)

在 LDN 的空间指导下,S-LDM 通过标记数据与额外无标签数据的混合训练来提升图像保真度:

  • 级联架构:采用去噪过程(Denoising Process)与对齐过程(Alignment Process)。
  • 稳态变换域损失 (STD Loss):在对齐阶段,将模型输出转化为半监督优化目标,不仅使其契合自然图案的全局分布,还能精准对齐当前参考衣物的特定细节。
    • LSTD=vrealvpred22+dgendref22\mathcal{L}_{\text{STD}} = \left\| \mathbf{v}_{\text{real}} - \mathbf{v}_{\text{pred}} \right\|_2^2 + \left\| \mathbf{d}_{\text{gen}} - \mathbf{d}_{\text{ref}} \right\|_2^2
  • 卷积局部相似性 (CLS):针对图案本质上的“局部一致性”规律,通过局部特征匹配来保障输出设计的视觉连贯性。
    • LCLS=i=1N2(W^ipWip)W^ip+Wip\mathcal{L}_{CLS} = -\sum_{i=1}^{N} \frac{2 \sum \left( \hat{W}_i^p W_i^p \right)}{\sum \hat{W}_i^p + \sum W_i^p}

SLDDM-TPG Model Architecture
图 4: SLDDM-TPG与其他方法在VITON-HD数据集(泛化实验)上的比较效果

4. 创新性贡献

  1. 首创任务框架:提出了首个实现高保真、细粒度且基于真实衣物的纺织图案生成模型 SLDDM-TPG。
  2. 核心痛点攻克:创新性提出潜在解耦网络(LDN),从根本上解决了衣物表征学习中的“特征混淆”问题。
  3. 半监督对齐策略:S-LDM 结合全新的 STD 损失对齐过程,高效利用无标注数据,极大突破了数据稀缺带来的泛化瓶颈。
  4. 全新数据集构建:开源了首个链接衣物与图案配对的高分辨率数据集 CTP-HD,如下图所示。

SLDDM-TPG Model Architecture
图 5: CTP-HD 数据集每个样本包含的数据示例

5. 总结

SLDDM-TPG 为时尚设计领域的纹理提取与重建立了一套极具潜力的标准范式。通过精妙的潜在特征解耦机制和半监督生成对齐策略,模型在 CTP-HD 数据集上优于主流 I2I 与相关 TPG 方法取得 SOTA (FID 高 4.1,SSIM 高 0.116), 并且在公开的虚拟试衣数据集 VITON-HD 上展现出良好的 Zero-shot 泛化性能。这为未来数字服装、智能设计制造等产业提供了强有力的技术支撑。

SLDDM-TPG Model Architecture
图 6: 不同方法以及我们提出的 SLDDM-TPG 方法在 CTP-HD 数据集上的更多定性结果