首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

ECCV 2026|突破伪目标天花板:ART重新定义高保真妆容迁移

2026-09-05 1 阅读 约10分钟阅读 机器之心
分享:
字号:
论文: Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer 团队: vivo BlueImage Lab × 哈尔滨工业大学 × 南京大学 关键词: 妆容迁移、人像美化、虚拟试妆、伪目标上限 论文链接: https://arxiv.org/abs/2606.31089 项目主页: https://csbowei.github.io/ART/ 设想一个具体的需求:把一张参考照片里的妆容,完整迁移到另一张人像上。不是替换口红色号这种程度,而是连舞台妆亮片的分布、脸绘花纹的走向、眼角水钻的位置都一一对应,同时严格保持被迁移者的五官结构、表情和背景。 这正是妆容迁移(makeup transfer)要解决的问题。经过近十年发展,日常淡妆、眼影、唇色的迁移已经比较成熟。但一旦面对贴纸、亮片、艺术脸绘这类复杂妆容,现有方法普遍失效:纹理模糊、图案缺失,甚至人物身份被一并改变。 ECCV 2026 论文《Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer》(ART)聚焦两个核心问题: 这个领域究竟被什么卡住了,以及如何突破它。 图 1:从日常淡妆到复杂艺术妆,从夸张表情到面部遮挡,ART 都能完整迁移参考妆容,同时稳定保持人物身份。右栏为与现有最优方法的对比。 动图:左下角为参考妆容,展示从源图到迁移结果的转变 —— 亮片分布、脸绘线条与文字细节均被完整保留。 一、问题的根源: 没有真实配对,就没有真正的监督 训练一个换妆模型,最理想的数据是配对样本:同一个人、同一角度、同一表情,一张素颜、一张带妆,两张图之间只差一层妆容。有足够多这样的样本,监督学习自然收敛。 问题是这种数据在物理上几乎不存在。你不可能让几千个人化好妆再卸掉,在完全相同的光线和姿势下各拍一张照片。 没有配对数据,行业走了两条替代路线。 路线一:用弱先验代替监督。 以循环一致性、域对抗为代表的 GAN 方法,不直接告诉模型目标是什么,而是用 "化了妆再卸掉应当还原" 这类间接约束来训练。这类方法能学到颜色和整体氛围,但学不到 "在眼角特定位置贴一颗钻" 这种有明确形状和空间坐标的妆容 —— 因为监督信号里从来不包含这些信息。 路线二:用大模型生成伪目标(pseudo-target)。 这是近年扩散模型时代的主流做法:请一个大型图像编辑模型,根据素颜照和参考妆容照合成一张 "带妆结果图",把它当作监督目标来训练学生模型。妆容迁移由此从无监督变成了有监督,效果大幅提升。 但这条路线有一个结构性缺陷,并且随着方法迭代越来越明显: 伪目标里的每一处错误,都会被学生模型原样继承。 生成模型丢失了亮片细节,学生就学会丢细节;生成模型改变了人物面部结构,学生就学会改变身份。学生的上限,被锁死在老师的水平上。 这就是论文提出的 "伪目标天花板"(pseudo-target ceiling):用来提供监督的合成图像,最终成为模型质量的上限。 ART 的核心想法可以一句话说完:监督信号不应该来自合成的伪目标,而应该来自真实照片本身。 伪目标可以用,但只能用来起步。 二、方法:两阶段训练, 把真实参考图变成监督信号 ART 没有抛弃伪目标,而是重新定义了它在训练中的位置:从最终的监督目标,降级为初始化的起点。 Stage I:伪目标初始化。 用 "源图 — 参考图 — 伪目标" 三元组训练迁移模型,让模型先掌握基本能力:妆容在脸上的空间分布、色彩映射、贴纸的大致位置。同时训练一个辅助的卸妆模型,负责从带妆图像还原素颜人像 —— 它在下一阶段承担关键角色。这一阶段结束时,模型已经可用,但能力边界仍由伪目标决定。 Stage II:现实锚定细化(reality-anchored refinement)。 这是论文的核心。 ART 的设计思路是让模型完成这样一件事 : 迁移模型输出的结果,不被当作最终图像,而是被保留为一层 可 微分的妆容载体(makeup carrier) —— 可以理解为一张独立的、数学上可求导的 "妆容图层"。然后,把这层妆容从源人脸上 "取下来",叠加到参考图的素颜版本上(由 Stage I 的卸妆模型生成),并问一个问题: 用迁移出来的这层妆容,能否重建出真实的参考图? 如果迁移是完整、准确的,重建结果应当与参考图一致。只要有任何遗漏 —— 亮片少了、花纹位置偏了、边界出现伪影 —— 重建误差就会暴露出来。 这个误差就是监督信号: 它沿着可微分的载体反向传播回迁移模型,精确指出哪一处妆容被遗漏或画错。 图 2:Stage I 用伪目标建立基础迁移能力并训练卸妆模型;Stage II 将迁移结果保留为可微的妆容载体,通过重建真实参考图,让真实图像的监督信号反向修正迁移结果。 这个设计的关键价值在于: 监督信号直接来自真实图像本身,而不是对伪目标的模仿。 真实图像中的每一处妆容细节 —— 纹理、边界、空间布局 —— 都成为可直接学习的信号。模型的学习目标从 "模仿合成结果" 变成了 "对齐真实图像"。 Stage II 中还有一个需要标定的旋钮:细化从什么起点开始。ART 从施加了受控噪声的伪目标出发进行细化。噪声强度决定模型保留多少伪目标先验:噪声太小,细化被草稿束缚,难以摆脱其中的错误;噪声太大,自由度过高,人物结构和背景容易漂移。实验表明 0.6 是最优点 —— 足以放开细节修正,又不至于动摇身份结构。 三、MF2K: 第一个 2K 分辨率真实场景妆容数据集 方法之外,论文还补齐了这个领域长期缺失的一块基础设施。 已有妆容数据集有两个短板:分辨率低 —— 睫毛、亮片这类精细结构在低分辨率下物理上不存在,模型无从学习;覆盖面窄 —— 艺术脸绘、密集贴纸、男性人像等真实场景严重缺失。 研究团队从互联网收集了约 10 万张高分辨率人像,并补充 FFHQ 数据集在 Flickr 上的原始图像,经过人脸对齐裁剪、CLIP 特征去重、质量与姿态过滤、视觉语言模型标注和人工复核,最终构建出 MakeupFaces2K(MF2K) :8,573 张 2048×2048 人像,覆盖素颜(3,139 张)、淡妆(2,063 张)、浓妆(1,798 张)和艺术妆(1,573 张)四个类别。 图 3:MF2K 的类别构成,以及与现有数据集的局部细节对比。睫毛、亮片、唇纹这类高频细节,只有在高分辨率下才能完整保留。 四、实验: 复杂妆容还原度与身份稳定性同时提升 实验在 MT、LADN、MT-Wild、MF2K 四个测试集上评测,共 400 组身份不重叠的源图 — 参考图组合,其中 MF2K 测试集的参考图全部来自艺术妆子集,专门考察复杂图案的迁移能力。对比方法覆盖三代技术路线:GAN 方法(PSGAN、EleGANt),专用扩散模型(StableMakeup、SHMT、MAD),以及通用商业模型(Nano Banana Pro、GPT Image 1.5)。 定性结果。 日常妆容上,GAN 方法常见边缘生硬与肤色偏移,通用大模型虽图像质量高,但经常改变人物面部结
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱