从DragGAN到ICRDrag:AI拖拽式图像编辑的三年进化史

上海交大ICRDrag入选ECCV 2026,用"上下文区域拖拽"彻底解决了控制模糊和边界割裂问题。拖拽编辑这条路线,终于从"能用"走向了"好用"。

从DragGAN到ICRDrag:AI拖拽式图像编辑的三年进化史

什么是"拖拽式图像编辑"?

如果你用过Photoshop,你一定熟悉这些操作:选中一个区域、旋转、拉伸、变形、液化。这些操作的本质,是用户用手指(或鼠标)直接"拖拽"图像中的内容,让它按自己的意愿变形。

2023年,斯坦福的DragGAN把这件事搬到了AI上——你只需要在图片上点几个点,告诉AI"把这个点拖到那个位置",AI就能自动完成变形,而且效果惊人地自然。人像转头、动物换姿势、物体变形,一切都只需要几个点。这篇论文一出来,整个社区都炸了。

但"点拖拽"有一个根本性的问题——歧义

从DragGAN到ICRDrag:AI拖拽式图像编辑的三年进化史

点的困境:信息太少,AI猜不透你在想什么

想象一下这个场景:你在一张人像照片的脸颊上点了一个点,然后把它往右边拖了一段距离。你的意图是什么?

可能是"把头转过去一点",也可能是"把脸拉宽",还可能是"把整个头往右移"。仅凭两个点(源位置和目标位置),AI根本无法确定你到底想要什么。

这就是DragGAN以及后续的DragDiffusion、StableDrag等点拖拽方法的核心痛点。点越稀疏,歧义越大。想要精确调整物体形态?基本靠运气。

学术界和工业界随后从两个方向尝试突破:

💡 方向一:在"点"的框架内优化

DragNeXt2026年1月):把拖拽重新定义为"潜在区域优化"问题,用区域级几何变换替代点级运动监督,提出渐进式后向自干预(PBSI)策略。

StableDrag(南大&腾讯):用判别式学习改进点跟踪精度,设计基于置信度的潜空间增强策略,在DragBench上显著超越DragGAN和DragDiffusion。

💡 方向二:跳出"点"的框架,用区域掩码取代点

RegionDrag(2024):首个区域拖拽方法,用源区域掩码和目标区域掩码替代点对。但本质是"复制粘贴"——把源区域特征直接搬到目标位置,边界融合生硬,复杂形变力不从心。

DragFlow、FastDrag:用预定义映射函数替代迭代优化,提升了效率但牺牲了灵活性和质量。

从DragGAN到ICRDrag:AI拖拽式图像编辑的三年进化史

ICRDrag:上下文学习遇上区域拖拽

2026年6月,上海交通大学牛力实验室提交了ICRDrag论文,并被ECCV 2026接收。核心贡献:把上下文学习(In-Context Learning)引入区域拖拽编辑,一举解决了控制精度和编辑质量的双重不足。

🎯 核心思路:把掩码当成"上下文"

ICRDrag的全称是"In-Context Region-based Drag"。做法很优雅:把源图像、源区域掩码(蓝色,标记原始位置/形状)、目标区域掩码(红色,标记目标位置/形状)作为统一的上下文输入,让基于DiT架构的扩散模型在一次前向传播中直接生成编辑后的图像。

这和传统方法的区别是根本性的。RegionDrag在"复制粘贴",ICRDrag在"理解意图后重新生成"。模型不是简单地把像素从A搬到B,而是理解了"这个区域要从这个形状变成那个形状"的语义,然后以全局一致的方式完成编辑。

光有框架不够,ICRDrag还引入了两个关键的注意力正则化机制

图像-掩码注意力一致性(IMAC):要求模型在生成目标图像时,对目标区域的注意力分布必须与源掩码的空间结构对齐。翻译成人话就是:AI在"画"目标区域的时候,必须严格参考你在源图上画的掩码轮廓,不能乱来。

源-目标双向注意力对应(STAC):让源区域和目标区域在注意力机制中互相"看"对方——源区域关注目标区域,目标区域反向关注源区域。建立起编辑前后的精确对应关系,确保变形连贯一致。

从DragGAN到ICRDrag:AI拖拽式图像编辑的三年进化史

课程式训练:从"标准答案"到"真实场景"

ICRDrag的训练策略同样巧妙。现实场景中用户手动画的掩码往往粗糙、不完整,直接用噪声数据训练很难收敛。

团队采用了两阶段课程式训练

第一阶段:用完整的语义掩码训练,让模型学会区域变换的基本逻辑。

第二阶段:用稀疏、不完整的不完整掩码训练(通过随机膨胀模拟手绘粗糙选区),大幅提升模型的容错能力。

这意味着,即使你的掩码画得很潦草,ICRDrag依然能准确理解你的编辑意图。这个设计非常贴近实际使用场景——毕竟不是每个人都能画出精确的选区。

PRD:补齐行业缺失的数据拼图

拖拽编辑领域还有一个长期被忽视的问题——缺乏大规模训练数据

ICRDrag团队基于百万级视频数据集OpenVid,构建了PRD(Paired Region Dataset)——该领域首个大规模配对数据集:

📦 训练集:287,153组配对样本,每组包含源图像、源掩码、目标图像、目标掩码。数据从静态相机视频中提取,天然包含拖拽编辑所需的变换模式(缩放、姿态变化、朝向变化等)。

📊 评测基准PRDBench:1,000组人工校验的高质量样本,同时标注掩码和关键点,可同时评测点拖拽和区域拖拽两类方法。

这个数据集的意义不亚于模型本身。有了PRD,后续研究者终于有了一个公平、可复现的训练和评测基础。

2026年拖拽编辑全景图

ICRDrag并不是2026年唯一的拖拽编辑新工作。这条赛道正在进入百花齐放的阶段:

方法时间机构核心创新
DragGAN2023斯坦福开山之作,GAN + 点拖拽
DragDiffusion2023多机构将拖拽适配到扩散模型
StableDrag2024南大 & 腾讯判别式点跟踪,提升稳定性
RegionDrag2024首个区域拖拽,复制粘贴策略
DragNeXt2026.01潜在区域优化 + PBSI
DynaDrag2026.01上海交大预测-移动框架,动态选择控制点
LightningDrag2026从视频数据学习,快速拖拽编辑
ContextDrag2026快手 KlingAI基于FLUX-Kontext,无需反演
ICRDrag2026.06上海交大上下文区域拖拽 + 注意力正则化,ECCV 2026
从DragGAN到ICRDrag:AI拖拽式图像编辑的三年进化史

从中可以看到两个清晰的趋势:

📈 趋势一:从"点"到"区域"的范式转换

越来越多的工作认识到,点提供的控制信号太稀疏,区域掩码才是更自然的交互方式。ICRDrag和DragNeXt分别从不同方向推进了这一趋势。用户的操作直觉本来就是"选一块区域然后改动它",区域拖拽比点拖拽更符合人的操作习惯。

📈 趋势二:上下文学习成为主流范式

无论是ICRDrag还是快手的ContextDrag,都在利用扩散模型(特别是DiT架构)的上下文学习能力,把参考图像、掩码等条件直接作为输入,避免了传统方法中耗时的反演(inversion)或微调(fine-tuning)过程。一次前向传播就能出结果,这是实用化的关键。

实际应用场景

拖拽编辑解决的是"精确控制"这个图像编辑中的核心需求。ICRDrag的Demo已经上线(drag.ustcnewly.com),支持最多5对源/目标区域同时编辑。

👤
人像修图
框选人脸或身体部位,调整姿态、比例、五官位置,不变形不失真
📦
产品设计
拖拽商品调整摆放位置、缩放大小,无需重新渲染光影
🏞️
场景构图
移动画面中的人物、建筑、物体,AI自动填充背景
🎨
创意设计
自由扭曲物体轮廓,实现复杂的创意形变,告别生硬拼接

代码已经开源在GitHub(bcmi/ICRDrag-Region-Drag-Editing),基于DiT架构,训练数据来自视频,整套方案可复现。Demo还提供了"锁定区域"功能——如果某个区域你不希望被影响,可以额外画一个掩码来固定它。

从"点"到"面",从"猜意图"到"懂意图"

从2023年DragGAN惊艳亮相,到2026年ICRDrag入选ECCV,拖拽式图像编辑走过了三年进化路。核心矛盾始终是:如何让AI准确理解用户的编辑意图?

DragGAN用"点"来回答,但点太稀疏;RegionDrag用"区域"来回答,但方法太粗糙;ICRDrag给出了更优雅的答案——用上下文学习框架,把区域掩码作为模型理解意图的"语境",再通过精心设计的注意力正则化,确保模型真正"看懂"了你要改什么、改成什么样。

对于设计师和创作者来说,AI图像编辑正在从"碰运气"走向"精确可控"。

参考来源:ICRDrag论文(arXiv:2606.25907)、DragNeXt论文(arXiv:2506.07611)、ContextDrag论文、机器之心报道、DragDiffusion项目

版权声明:NavCN 发表于 2026-07-06 21:11:55。
转载请注明:从DragGAN到ICRDrag:AI拖拽式图像编辑的三年进化史 | NavCN

暂无评论

暂无评论...
NavCN AI工具导航

NavCN是一个专业的AI工具导航网站,收录最新AI工具和热门AI应用,涵盖AI写作、AI绘画、AI视频、AI办公、AI编程等1000+AI工具,并提供AI工具推荐、评测和教程,帮助用户快速找到好用的AI工具。

Copyright © 2026 NavCN 桂ICP备2026002643号-2  Design by NavCN