上海交大ICRDrag入选ECCV 2026,用"上下文区域拖拽"彻底解决了控制模糊和边界割裂问题。拖拽编辑这条路线,终于从"能用"走向了"好用"。

什么是"拖拽式图像编辑"?
如果你用过Photoshop,你一定熟悉这些操作:选中一个区域、旋转、拉伸、变形、液化。这些操作的本质,是用户用手指(或鼠标)直接"拖拽"图像中的内容,让它按自己的意愿变形。
2023年,斯坦福的DragGAN把这件事搬到了AI上——你只需要在图片上点几个点,告诉AI"把这个点拖到那个位置",AI就能自动完成变形,而且效果惊人地自然。人像转头、动物换姿势、物体变形,一切都只需要几个点。这篇论文一出来,整个社区都炸了。
但"点拖拽"有一个根本性的问题——歧义。

点的困境:信息太少,AI猜不透你在想什么
想象一下这个场景:你在一张人像照片的脸颊上点了一个点,然后把它往右边拖了一段距离。你的意图是什么?
可能是"把头转过去一点",也可能是"把脸拉宽",还可能是"把整个头往右移"。仅凭两个点(源位置和目标位置),AI根本无法确定你到底想要什么。
这就是DragGAN以及后续的DragDiffusion、StableDrag等点拖拽方法的核心痛点。点越稀疏,歧义越大。想要精确调整物体形态?基本靠运气。
学术界和工业界随后从两个方向尝试突破:
DragNeXt(2026年1月):把拖拽重新定义为"潜在区域优化"问题,用区域级几何变换替代点级运动监督,提出渐进式后向自干预(PBSI)策略。
StableDrag(南大&腾讯):用判别式学习改进点跟踪精度,设计基于置信度的潜空间增强策略,在DragBench上显著超越DragGAN和DragDiffusion。
RegionDrag(2024):首个区域拖拽方法,用源区域掩码和目标区域掩码替代点对。但本质是"复制粘贴"——把源区域特征直接搬到目标位置,边界融合生硬,复杂形变力不从心。
DragFlow、FastDrag:用预定义映射函数替代迭代优化,提升了效率但牺牲了灵活性和质量。

ICRDrag:上下文学习遇上区域拖拽
2026年6月,上海交通大学牛力实验室提交了ICRDrag论文,并被ECCV 2026接收。核心贡献:把上下文学习(In-Context Learning)引入区域拖拽编辑,一举解决了控制精度和编辑质量的双重不足。
ICRDrag的全称是"In-Context Region-based Drag"。做法很优雅:把源图像、源区域掩码(蓝色,标记原始位置/形状)、目标区域掩码(红色,标记目标位置/形状)作为统一的上下文输入,让基于DiT架构的扩散模型在一次前向传播中直接生成编辑后的图像。
这和传统方法的区别是根本性的。RegionDrag在"复制粘贴",ICRDrag在"理解意图后重新生成"。模型不是简单地把像素从A搬到B,而是理解了"这个区域要从这个形状变成那个形状"的语义,然后以全局一致的方式完成编辑。
光有框架不够,ICRDrag还引入了两个关键的注意力正则化机制:
图像-掩码注意力一致性(IMAC):要求模型在生成目标图像时,对目标区域的注意力分布必须与源掩码的空间结构对齐。翻译成人话就是:AI在"画"目标区域的时候,必须严格参考你在源图上画的掩码轮廓,不能乱来。
源-目标双向注意力对应(STAC):让源区域和目标区域在注意力机制中互相"看"对方——源区域关注目标区域,目标区域反向关注源区域。建立起编辑前后的精确对应关系,确保变形连贯一致。

课程式训练:从"标准答案"到"真实场景"
ICRDrag的训练策略同样巧妙。现实场景中用户手动画的掩码往往粗糙、不完整,直接用噪声数据训练很难收敛。
团队采用了两阶段课程式训练:
第一阶段:用完整的语义掩码训练,让模型学会区域变换的基本逻辑。
第二阶段:用稀疏、不完整的不完整掩码训练(通过随机膨胀模拟手绘粗糙选区),大幅提升模型的容错能力。
这意味着,即使你的掩码画得很潦草,ICRDrag依然能准确理解你的编辑意图。这个设计非常贴近实际使用场景——毕竟不是每个人都能画出精确的选区。
PRD:补齐行业缺失的数据拼图
拖拽编辑领域还有一个长期被忽视的问题——缺乏大规模训练数据集。
ICRDrag团队基于百万级视频数据集OpenVid,构建了PRD(Paired Region Dataset)——该领域首个大规模配对数据集:
📦 训练集:287,153组配对样本,每组包含源图像、源掩码、目标图像、目标掩码。数据从静态相机视频中提取,天然包含拖拽编辑所需的变换模式(缩放、姿态变化、朝向变化等)。
📊 评测基准PRDBench:1,000组人工校验的高质量样本,同时标注掩码和关键点,可同时评测点拖拽和区域拖拽两类方法。
这个数据集的意义不亚于模型本身。有了PRD,后续研究者终于有了一个公平、可复现的训练和评测基础。
2026年拖拽编辑全景图
ICRDrag并不是2026年唯一的拖拽编辑新工作。这条赛道正在进入百花齐放的阶段:
| 方法 | 时间 | 机构 | 核心创新 |
|---|---|---|---|
| DragGAN | 2023 | 斯坦福 | 开山之作,GAN + 点拖拽 |
| DragDiffusion | 2023 | 多机构 | 将拖拽适配到扩散模型 |
| StableDrag | 2024 | 南大 & 腾讯 | 判别式点跟踪,提升稳定性 |
| RegionDrag | 2024 | — | 首个区域拖拽,复制粘贴策略 |
| DragNeXt | 2026.01 | — | 潜在区域优化 + PBSI |
| DynaDrag | 2026.01 | 上海交大 | 预测-移动框架,动态选择控制点 |
| LightningDrag | 2026 | — | 从视频数据学习,快速拖拽编辑 |
| ContextDrag | 2026 | 快手 KlingAI | 基于FLUX-Kontext,无需反演 |
| ICRDrag | 2026.06 | 上海交大 | 上下文区域拖拽 + 注意力正则化,ECCV 2026 |

从中可以看到两个清晰的趋势:
越来越多的工作认识到,点提供的控制信号太稀疏,区域掩码才是更自然的交互方式。ICRDrag和DragNeXt分别从不同方向推进了这一趋势。用户的操作直觉本来就是"选一块区域然后改动它",区域拖拽比点拖拽更符合人的操作习惯。
无论是ICRDrag还是快手的ContextDrag,都在利用扩散模型(特别是DiT架构)的上下文学习能力,把参考图像、掩码等条件直接作为输入,避免了传统方法中耗时的反演(inversion)或微调(fine-tuning)过程。一次前向传播就能出结果,这是实用化的关键。
实际应用场景
拖拽编辑解决的是"精确控制"这个图像编辑中的核心需求。ICRDrag的Demo已经上线(drag.ustcnewly.com),支持最多5对源/目标区域同时编辑。
代码已经开源在GitHub(bcmi/ICRDrag-Region-Drag-Editing),基于DiT架构,训练数据来自视频,整套方案可复现。Demo还提供了"锁定区域"功能——如果某个区域你不希望被影响,可以额外画一个掩码来固定它。
从"点"到"面",从"猜意图"到"懂意图"
从2023年DragGAN惊艳亮相,到2026年ICRDrag入选ECCV,拖拽式图像编辑走过了三年进化路。核心矛盾始终是:如何让AI准确理解用户的编辑意图?
DragGAN用"点"来回答,但点太稀疏;RegionDrag用"区域"来回答,但方法太粗糙;ICRDrag给出了更优雅的答案——用上下文学习框架,把区域掩码作为模型理解意图的"语境",再通过精心设计的注意力正则化,确保模型真正"看懂"了你要改什么、改成什么样。
对于设计师和创作者来说,AI图像编辑正在从"碰运气"走向"精确可控"。
参考来源:ICRDrag论文(arXiv:2606.25907)、DragNeXt论文(arXiv:2506.07611)、ContextDrag论文、机器之心报道、DragDiffusion项目
