(来源:机器之心)
"把光线调成午后暖阳"、"换成霓虹灯下的赛博氛围"、"来一束伦勃朗光,侧脸更有质感"。人像修图里,换光效是最常见也最难做好的需求之一,因为在复杂光照场景下,现有 AI 重打光方案常出现光照不稳定、阴影方向错乱,甚至把脸 "修成另一个人" 的问题。
当前三类基于扩散模型的人像重打光主流方法各有短板,其中控制信号驱动(Control-based)的方案可控性有所提升,但结果高度依赖控制信号的准确性和完整性;本征分解驱动(Decomposition-based)在复杂光照下容易出错,误差会传导至最终图像,导致阴影不一致、颜色偏移或细节丢失;直接图到图翻译(Image-to-image)未显式建模 "光照专属" 的特征位移,光照编辑的精度与表达力不足。
此外,由于公开人像重打光数据集规模有限,且多在受控环境下采集,缺乏复杂光照效果(多色温、空间变化阴影、非均匀照明等),难以支撑真实场景下的可控重打光学习。
对此,美图影像研究院(MT Lab) 提出 Consistent Feature Transport(CFT,一致特征传输),将人像重打光重新表述为光照一致的特征传输问题,在 Rectified Flow 框架上显式学习源图与目标图分布之间的光照变换,而非泛泛的图像翻译,该成果已被计算机视觉顶级会议 ECCV 2026 (European Conference on Computer Vision)录用。
论文标题:Consistent Feature Transport for Image Relighting
项目主页:https://github.com/Dixin-Lab/CFT
CFT 的 核心思路
CFT 在噪声、源图、目标图三个分布之间建立联合建模,训练目标由三部分组成:
1. 噪声→目标图(L₁)给定源图 (xsrc)、重打光目标图 (xtgt) 及文本条件 (ctgt),学习从先验噪声到目标 latent 的速度场,完成条件生成。
2. 噪声→源图(L₂)在同一先验噪声下,以中性条件 (csrc) 重建源图分布。这条重建路径强化了对非光照内容(身份、几何、场景结构)的保持能力。
3. 源图→目标图:光照一致的特征传输(L₃,CFT 核心)借鉴无反演编辑方法,利用 Rectified Flow 的线性性质,通过 平行四边形法则 构造源到目标的直接传输路径:ztdirect=zsrc+zttgt−ztsrc 对应速度场为:vtdirect=vθ(zttgt,t,xsrc,ctgt)−vθ(ztsrc,t,xsrc,csrc)
值得注意的是 L₃的监督使用的是身份与场景内容不同,但光照变换相同的图像对作为真值(ground truth)。这样做的优势在于,如果监督来自同一对图像,模型容易拟合样本特有的内容差异,把光照变化与非光照变化混在一起;而换用 “同光照变换、不同内容” 的配对,可以让模型学习可跨实例复用的光照特征传输。 在生成稳定性与光照传输监督之间取得平衡。
此外,为了支撑复杂光照场景的学习,团队构建了包括室内、室外等主流场景的大规模人像重打光数据集,覆盖 14 类光照效果类别,该数据集强调空间结构化照明、多色温与复杂阴影,弥补了现有 portrait relighting 数据在复杂光效上的不足。
实验结果
在自建测试集上,CFT 相比目前的方案, 在像素保真、感知相似度、分布真实感与光照专用指标上均表现更优。定性实验结果显示,CFT 在多光源交互、空间结构化照明、色温大幅偏移等困难场景下,一致性及稳定性方面均有明显优势。
根据 30 名用户对 40 组随机样本打分结果显示,Flux-Kontext + CFT 在评估光照质量(IQ)、内容一致性(CC)、物理合理性(PP)、图像美学(IA)上表现最佳。此外,消融实验显示,单独增加 L₂不能提升重打光质量,但与 L₃联用时提供额外结构保持,完整 CFT 效果最优;L₃若用原始 (xsrc,xtgt) 或随机配对监督,性能反而下降甚至不如仅 L₁;传输速度场方差分析表明,完整 CFT 在训练集与测试集上均具有最低方差,能够学习到更一致、稳定的光照特征传输场。共四项指标上均获得最高分,
配置 | SSIM↑ | PSNR↑ | LPIPS↓ | FID↓ |
仅 L₁ | 0.9153 | 22.92 | 0.0985 | 20.38 |
L₁ + L₂ | 0.9141 | 22.83 | 0.1018 | 21.61 |
L₁ + L₃ | 0.9161 | 23.38 | 0.0972 | 19.32 |
L₃用原始配对监督 | 0.9141 | 22.8 | 0.1003 | 20.3 |
L₃用随机配对监督 | 0.9135 | 22.8 | 0.1035 | 19.55 |
完整 CFT(L₁+L₂+L₃) | 0.9202 | 23.51 | 0.0946 | 18.73 |
CFT 在风格迁移方面的可泛化能力
CFT 的 “一致特征传输” 思想并不局限于光照编辑,通过在 OmniStyle-150k 上构建风格迁移数据集并将 CFT 应用于 OmniStyle 与 Qwen-Image-Edit 上发现,CFT 在内容结构与感知保真上实现持续提升,生成结果在风格化上取得了更好平衡,这表明 CFT 还可迁移至风格迁移等多种属性的编辑任务。
方法 | SSIM↑ | PSNR↑ | LPIPS↓ |
OmniStyle(w.o. CFT) | 0.5222 | 13.8 | 0.4125 |
OmniStyle(w. CFT) | 0.5275 | 14.12 | 0.3945 |
Qwen-Image-Edit(w.o. CFT) | 0.4422 | 12.97 | 0.3697 |
Qwen-Image-Edit(w. CFT) | 0.4648 | 13.37 | 0.3562 |
目前,图片打光能力已经上线美图旗下产品 Picchi、AirBrush 与 BeautyPlus,不需要输入冗长的提示词,就可以实现各种不同的光线效果。
美图影像研究院(MT Lab)是美图公司旗下核心研发团队,于厦门、北京、深圳、上海、悉尼、西雅图等海内外地区均设有研发分部。团队专注于计算机视觉、深度学习、机器学习等人工智能领域的前沿科技研发,并为美图旗下影像与设计产品提供技术支持,现已在CVPR、ICCV、ECCV、ICML、ICLR、AAAI、ACM MM、NeurIPS、TPAMI、TIP等顶级学术会议及期刊上累计发表75篇学术论文。