身份条件化潜在一致性蒸馏加速人脸图像合成
原文:Identity-Conditioned Latent Consistency Distillation for Face Synthesis
扩散模型在高保真图像合成中取得了出色的结果,但其迭代采样过程使大规模生成的计算成本高昂。这一局限在为人脸识别生成合成人脸数据集时尤为突出,因为这类任务需要大量身份,且每个身份需有不同姿态、表情、年龄等多张样本。在本工作中,我们表明身份条件的人脸合成可以通过迭代次数很少的潜在一致性模型(Consistency Model)以显著更低的计算成本完成,同时不牺牲图像质量。在训练中,我们从基础扩散模型Arc2Face(教师)蒸馏知识,将其原有的文本到图像流程改造为嵌入到人脸的设置,用ArcFace身份嵌入替代文本提示。我们蒸馏出的模型(学生)生成身份条件人脸图像的平均推理时间为每张0.4819秒,而Arc2Face为2.102秒,实现4.36倍加速。基于FID分数的定量结果表明,蒸馏模型在所有评估协议下均与Arc2Face具有竞争力。在10万张生成图像上,它在CelebA上接近持平(13.921 vs 12.928),在WebFace42M上超越教师模型(9.317 vs 9.802)。在Synth-500和AgeDB上的进一步评估显示,前者存在一定性能差距,后者结果相当。这些结果表明,通过任务特定的潜在一致性蒸馏可以加速Arc2Face,同时在大规模合成人脸生成中保持高图像质量。我们的方案已在 https://github.com/UFPR-IPASP-PR/FaceRec-IdentityConsistency 公开提供。