Distribution-Aware Data Expansion with Diffusion Models
Haowei Zhu∗ Tsinghua University、Ling Yang Peking University、Jun-Hai Yong Tsinghua University、Hongzhi Yin University of Queensland、Jiawei Jiang Wuhan University、Meng Xiao CNIC, CAS、Wentao Zhang Peking University、Bin Wang Tsinghua University Equal Contribution.
Abstract
The scale and quality of a dataset significantly impact the performance of deep models. However, acquiring large-scale annotated datasets is both a costly and time-consuming endeavor. To address this challenge, dataset expansion technologies aim to automatically augment datasets, unlocking the full potential of deep models. Current data expansion techniques include image transformation and image synthesis methods. Transformation-based methods introduce only local variations, leading to limited diversity. In contrast, synthesis-based methods generate entirely new content, greatly enhancing informativeness. However, existing synthesis methods carry the risk of distribution deviations, potentially degrading model performance with out-of-distribution samples. In this paper, we propose DistDiff, a training-free data expansion framework based on the distribution-aware diffusion model. DistDiff constructs hierarchical prototypes to approximate the real data distribution, optimizing latent data points within diffusion models with hierarchical energy guidance. We demonstrate its capability to generate distribution-consistent samples, significantly improving data expansion tasks. DistDiff co
中文速览
数据少、标注贵是训练深度模型的老大难,现有靠扩散模型(diffusion model)合成新样本的方法虽然能生成新颖图片,却很容易跑偏——生成的样本与真实数据分布不符,反而拉低模型性能。为此,研究者提出了 DistDiff 这个无需额外训练的数据扩充框架:它先对原始数据做层次聚类,提取类级和组级两层原型来近似真实分布,再把这两层原型转化为能量函数,在扩散模型的中间去噪步骤中实时引导生成方向,让合成样本既贴近真实分布又携带新信息。实验结果表明,DistDiff 在多种数据集和网络架构上均优于现有的图像变换和生成式扩充方法,生成的扩充数据集还能与主流变换增强手段无缝结合。这项工作的价值在于,它以低成本、无微调的方式解决了合成数据"跑偏"的核心问题,为数据稀缺场景下训练高性能模型提供了更可靠的路径。
原文 arXiv:2403.06741;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2403.06741v2