ECCV 2026 Oral|首个端到端实时 DETR 旋转检测模型,中科大联合华为发布 RiO-DETR:2.7 ms 达到 78.4 AP50
创始人
2026-08-16 07:52:53
0

(来源:机器之心)

遥感影像、交通感知、场景文字识别等任务中,待检测目标很少横平竖直规整排布。采用水平边界框做检测,虽然能够包住目标,但常会纳入大量无关背景;改用旋转框虽能更贴合物体轮廓,可新增的角度维度会显著提升检测器的训练与调参难度,想要在终端设备上实现实时推理更是一大挑战。

以往旋转目标检测追求速度的方案,基本都以 CNN 架构为主。DETR 框架优势突出,端到端的形式还省去了 NMS 后处理;但一旦从水平框拓展至旋转检测,繁重的注意力运算、角度周期性歧义问题,再加上更为复杂的匹配搜索空间,很容易直接丢掉实时推理能力。

最近,中科大联合华为、清华等机构提出了 RiO-DETR,终于把端到端旋转检测推到了真正的实时区间。在 DOTA-1.0 单尺度设置下,最轻量的 RiO-DETR-n 仅有 4.0M 参数,端到端延迟低至 2.7ms,AP50 却能达到 78.4;而最强的 RiO-DETR-x 在 29.9ms 下跑出 81.8 AP50。该工作已被 ECCV 2026 接收为 Oral(Spotlight)。

该论文的第一作者为胡张驰,中国科学技术大学博士研究生,研究方向为通用视觉、视频生成与世界模型。迄今已在 ICCV、ECCV、AAAI、ACM MM 等顶级会议发表多篇论文,是当前目标检测领先模型 D-FINE 的重要贡献者。本文由孙晓艳教授、李和倍博士和彭岩松博士共同指导,作者团队还包括来自华为技术有限公司、清华大学的研究人员。

这篇论文从模型结构、训练策略到部署效率,做了全方位的考量。它的目标很清晰:不只要让旋转检测的精度再上一个台阶,更要让基于 DETR 的旋转目标检测模型真正具备实时运行的能力。

更值得关注的是,RiO-DETR 并不是简单给 RT-DETR 多接一个角度回归头。作者重新审视了一个更根本的问题:角度究竟应该被当作普通坐标,还是一种由视觉内容决定、且生活在周期空间里的变量?

  • 论文标题:RiO-DETR: DETR for Real-time Oriented Object Detection

  • 合作机构:中国科学技术大学、华为技术有限公司、清华大学、合肥综合性国家科学中心人工智能研究院

  • 论文状态:ECCV 2026,Oral(Spotlight)

  • 论文链接:https://arxiv.org/abs/2603.09411

  • 项目主页:https://github.com/RicePasteM/RiO-DETR

从水平框到旋转框,难点不只是 “多一个角度”

标准 DETR 一般通过中心点坐标、宽、高表征边界框,再由解码器逐层迭代优化预测结果。直观来看,只需额外增加一个角度预测参数,就能将水平框方案拓展为旋转框检测。但现有研究表明,这一改动本质上对应着完全不同的优化问题。

水平目标检测里,中心坐标与宽高参数定义在连续欧氏空间:检测框位置偏左便向右调整,尺寸偏大则向内收缩,参数的更新方向清晰直观。旋转框却面临多重难点:角度具备周期性,同一个矩形还能通过互换宽高产生多组等价参数表达;特别是处于周期临界点附近时,两组数值差异巨大的角度,对应的几何框却几乎完全重合。

除此之外,目标朝向无法单纯依靠框体位置与尺寸推断。飞机机头朝向、舰船航向、车辆行进方向,都需要依托目标纹理、部件结构乃至语义上下文综合判断。倘若模型将角度视作和中心坐标、宽高同类的位置参数,训练初期不准确的角度预测,极易干扰注意力模块的采样区域,造成训练偏差。

过去很多基于 DETR 改造的旋转检测方法,为提升精度堆叠了复杂度较高的注意力机制与特征采样模块,推理速度始终难以追上 YOLO、RTMDet 等 CNN 实时检测器。而 RiO-DETR 选择另一条路径:首先基于 RT-DETRv2 构建高性能旋转检测基线,引入 D-FINE 的通用匹配策略与 DEIM 的 Dense O2O 训练范式,随后围绕旋转检测独有的三大底层痛点,对网络结构开展系统性针对性优化。

挑战一,语义与几何耦合:位置和尺寸主要由几何关系决定,角度却常常需要结合纹理方向、物体朝向和部件布局判断。把角度硬塞进位置查询,可能在训练早期引入噪声。

挑战二,角度不是普通数轴:在周期空间里,接近 0 度和接近 180 度的两个方向,几何上可能非常接近,数值上却相距很远。普通加法更新和 L1 损失会在周期边界处给出错误的优化方向。

挑战三,搜索空间扩大:旋转框增加了自由度,二分图匹配与角度预测收敛更慢;水平检测里常见的密集监督,也未必能提供足够的角度多样性。

RiO-DETR 的三项核心设计,正好逐一对应这三个问题。

RiO-DETR 总体架构:内容驱动角度估计、旋转校正正交注意力与解耦周期细化。图片来源:论文 Figure 2

角度要“看内容”,而不是写死在位置里

现有多数旋转 DETR 方案,会将中心点、宽高与角度共五个参数一并编码至位置查询。该方式暗含一个前提假设:这几组参数属于同一类几何信息。但角度具备显著特殊性 —— 中心坐标与框尺寸回答的是 “目标位于何处、范围多大”,而角度刻画的是 “目标朝向”,二者承载的信息本质并不相同。

以遥感影像中的舰船为例:狭长目标的轮廓虽然能够体现主轴走向,却无法区分船头与船尾;而储罐、运动场、近方形建筑这类目标,还会因宽高互换产生多组等价旋转框参数。这类场景下,能够判别真实朝向的依据,不再单纯依靠坐标数值,而是物体轮廓、纹理走向、构件排布等视觉内容线索。

基于这一观察,RiO-DETR 提出内容驱动角度估计(Content-Driven Angle Estimation)机制:位置查询仅负责编码中心坐标与宽高信息,将角度从刚性几何先验中解耦剥离,交由独立的内容查询,依托图像特征自主学习预测。

对应论文公式:式 (1) 仅利用中心坐标与宽高构建位置查询;式 (2) 将注意力头进行划分,分别用于目标主方向及其正交方向的预测。

消融实验结果印证了上述思路。在 DIOR-R 数据集上,仅对中心坐标进行编码时模型 AP50 为 72.56;若将角度一并纳入位置编码,精度反而回落至 72.34;仅编码中心坐标与尺寸、剔除角度编码时,AP50 能够提升至 73.81。这说明,并不是向查询中塞入越多几何参数效果就越好,核心在于让角度依靠恰当的视觉线索推导得到。

不过仅仅将角度从位置查询中分离尚且不足。旋转目标往往同时存在纵向与横向结构,倘若所有注意力头都沿着目标主轴进行特征采样,模型极易过度关注目标长度特征,忽视宽度维度信息。为此本文提出 Rotation-Rectified Orthogonal Attention(旋转校正正交注意力):将注意力头均分,一半沿预测目标角度执行采样,另一半沿该角度的正交方向采样。

采用 4:4 的均衡划分方式,既不引入额外参数,也不会增加计算量(FLOPs),相比 8 个注意力头全部沿单一方向采样的基线,将 AP50 由 73.81 提升至 74.18。该机制促使模型同步捕获目标主轴与侧向边界特征,防止注意力表征在单一方向发生坍缩。

针对旋转目标的自适应采样流程如公式所示:式 (3) 依据目标尺度对学习得到的采样偏移进行缩放;随后借助式 (4) 的旋转矩阵,将采样坐标系对齐至目标朝向。

下方可视化结果能够更加直观地展现该机制的作用:两组采样点并未在目标中心附近无序散布,而是分别沿着目标纵向、横向结构进行覆盖。针对舰船、桥梁、跑道这类长宽比例悬殊的目标,这种正交采样视角可以有效补齐单一主轴采样容易丢失的边缘特征;与此同时,该方案无需引入额外庞大的特征提取模块,不会带来显著的计算开销。

正交注意力在 DOTA 场景中的采样点:两组注意力头分别覆盖目标的主轴与正交方向。图片来源:论文 Figure 4

角度生活在圆上,优化也要走“最短路”

角度预测的核心难点,在于角度固有的周期边界歧义问题。当目标真实朝向接近 180 度、而模型预测结果趋近 0 度时,二者在视觉上几乎完全重合,但标准 L1 损失会判定两者误差极大,引导模型沿着错误的大幅偏差方向迭代修正。

这一问题可以用时钟逻辑通俗理解:11 点 59 分与 0 点 01 分在数值上处于刻度两端,实际时间间隔却仅有两分钟。若直接采用欧式直线距离计算损失、迭代优化,在角度周期边界附近,梯度反而会持续误导模型参数更新,造成角度预测抖动、来回跳变、无法收敛的问题。

与此同时,DETR 解码器采用多层迭代细化的预测机制,并非一次性输出最终检测结果。这就导致网络浅层产生的微小角度偏差,会在后续逐层的迭代优化中不断累积放大,最终造成整体旋转预测的不稳定。针对这一痛点,RiO-DETR 没有局限于优化最终输出的损失函数,而是对网络每一层的角度更新逻辑都进行了系统性重构,从全程解决角度预测偏差累积的问题。

RiO-DETR 提出 Decoupled Periodic Refinement(解耦周期细化),同时改写更新规则和损失函数:

第一步,有界、由粗到细地更新角度:早期解码层允许较大幅度地修正朝向,后期逐层缩小更新范围,用更细的步幅对齐边界。

第二步,进行周期归一化:每次更新后都把角度映射回规范区间,避免角度值在边界外漂移。

由粗到细的周期更新:式(5)控制各解码层的步长衰减,式(6)限制单层角度改变量,式(7)再把结果映射回规范角度区间。

第三步,使用最短路径周期 L1 损失:不再比较数轴上的直接距离,而是比较圆周上的最短角距离,让梯度始终指向更近的方向。

最短路径损失:式(8)在直接角度差与跨越周期边界的距离之间取较小值,让梯度始终沿圆周上的短路径移动。

这不是在损失函数上打一个补丁,而是让 DETR 的角度细化过程与旋转几何本身保持一致。实验中,只用周期更新或只用最短路径损失都不稳定;两者配合,AP50 从 74.18 提升到 74.74。

左:周期细化让角度梯度沿圆周最短路径流动;右:Oriented Dense O2O 在单张训练图中注入多方向目标。图片来源:论文 Figure 3

让一张训练图同时拥有四种朝向

收敛速度缓慢,是旋转检测任务的另一大瓶颈。水平框检测仅需完成目标位置与尺度的匹配,而旋转检测需要额外遍历目标朝向,大幅扩大了二分图匹配的候选搜索空间。不仅如此,即便单张图像内包含大量目标,若多数目标的朝向趋于一致,角度分支能够获取的有效监督信号依然十分稀疏,严重拖累模型收敛效率。

常规 Dense O2O 的核心思路是将四张图像拼接为一张大图,在单次训练迭代中提升批次内的目标数量,以此强化模型学习效果。但 RiO-DETR 通过实验验证,单纯增加目标数量远远不够,旋转检测的训练核心,在于让模型同时接触丰富多样的目标朝向。基于此,本文对原有策略进行改进:在图像拼接前,对四张待拼接图像分别执行独立旋转变换,再整合为一张高密度训练图像。

具体而言,每一张子图都会从 0°、90°、180°、270° 四个角度中随机独立选择一个朝向完成旋转。该方式既能高效覆盖各类差异化目标朝向,丰富角度监督信号,又能避免对近正方形目标产生大量等价参数噪声,干扰模型学习。同一训练批次内,模型需要同时处理多朝向目标,让角度分支的学习更快趋于稳定。

本文提出的 Oriented Dense O2O 策略,无需增加推理开销,也几乎不会提升训练阶段的计算量,仅通过优化批次内的角度分布多样性,就能推动角度分支更早完成特征细化、收敛至稳定状态。

相关实验数据充分验证了该策略的有效性:在模型第一阶段训练中,无数据增强的基线方法需要 94 个 epoch 达到最优 AP50,常规增强方案需要 86 个 epoch,原版 Dense O2O 缩短至 68 个 epoch,而 Oriented Dense O2O 仅需 60 个 epoch,且能达到 73.88 的更高 AP50 精度。由此可见,高效收敛的关键不在于无差别增加旋转变换的数量,而在于将角度多样性深度融入密集一对一的监督学习过程。

实验结果:从 2.7 ms 到 29.9 ms,

整条模型族都留在实时区间

本文在 DOTA-1.0、DIOR-R、FAIR-1M-2.0 三大主流旋转检测基准数据集上完成全面评测。所有推理延迟均基于单张 NVIDIA T4 显卡、TensorRT 10 框架及 FP16 精度条件下统一测试。其中,本文端到端模型统计的延迟不含图像预处理与后处理环节,其余对比模型则通过 BatchedNMSPlugin 统计含 NMS 的实际工程推理延迟,贴合真实落地场景。

从完整模型家族的实时性能来看,RiO-DETR 覆盖 n、s、m、l、x 五种不同参数量化规格,在 DOTA-1.0 单尺度测试设置下,推理延迟分别为 2.7 ms、5.2 ms、8.8 ms、13.4 ms 和 29.9 ms,与同级别 YOLO26 系列模型的速度表现基本持平。这一结果证明,RiO-DETR 的实时推理优势并非轻量化模型的特例,而是贯穿轻量、中等、高精度全档位模型的通用性能。

对应的模型梯队也可适配不同实际任务需求,实现精度与体量的灵活权衡。面向边缘终端部署场景,参数量仅 4.0M 的 RiO-DETR-n 可满足轻量化、低延迟的检测需求;针对高精度遥感解析、精细目标检测任务,RiO-DETR-l 与 RiO-DETR-x 则能提供更优异的检测精度。整体速度–精度曲线始终处于当前方法的前沿水平,相较于单一展示最优精度指标,完整的模型梯队性能更能体现该方法的工程落地价值与泛用性。

DOTA-1.0 单尺度主性能表:表中同时列出非实时 CNN、非实时 DETR、实时检测器及 RiO-DETR 全系列;粗体为论文强调的关键结果。

DOTA-1.0 单尺度训练与测试下的主性能对比。来源:论文 Table 1

在 DOTA-1.0 单尺度设置下,RiO-DETR-x 的 81.8 AP50 高于相近延迟的 YOLO26x-obb(80.4 AP50,30.5 ms),也高于更慢的 RHINO-DETR(79.4 AP50,57.0 ms)。轻量端的 RiO-DETR-n 则以 2.7 ms 达到 78.4 AP50。

在 DIOR-R 上,RiO-DETR-x 以 17.31 ms 达到 77.43 AP50,相比 YOLO26x-obb 的 76.48 AP50、17.66 ms,在相近速度下继续保持精度优势。到了超过 100 万实例的 FAIR-1M-2.0,RiO-DETR-x 在多尺度设置下达到 47.4 AP50,超过论文列出的 YOLO26x-obb、LSKNet-S 和 ReDet。

完整的路线消融也很清晰。作者先构建了一个 73.47 AP50 的强基线;加入几何解耦查询编码后升至 74.18,说明把角度从位置先验中拿掉本身就能改善优化;再加入正交注意力后达到 74.74,证明纵向与横向信息确实互补。

在此基础上,周期细化和 Oriented Dense O2O 继续把结果推至 75.73 AP50。整个过程中,参数量、FLOPs 和延迟几乎不变。也就是说,这些增益主要不是来自更大的骨干网络或更高的计算预算,而是来自对角度表示、角度更新和角度监督方式的重新设计。

这一点与最终的速度对比相互印证:RiO-DETR 的目标不是用更重的结构换取少量精度,而是在保持实时基线轻量特性的前提下,逐项消除旋转 DETR 独有的性能损失。

真正的突破,不是让 DETR “也会画旋转框”

RiO-DETR 真正的价值,不在于多挤出了几个点的 AP,而在于它为旋转检测任务梳理出了一套清晰的设计思路:

  • 语义上,角度由物体自身的视觉内容和朝向线索决定,不能把它当成普通坐标来对待;

  • 几何上,角度活在周期空间里,更新和损失计算都得尊重圆周拓扑;

  • 监督上,旋转检测需要显式引入角度多样性,不能照搬水平检测的数据增广套路。

这三点归结起来,其实就是一个判断:想让 Transformer 在旋转检测上真正跑进实时区间,关键不是堆叠更重的模块,而是把旋转任务特有的几何约束,写进表示、注意力、细化和监督的每一个核心环节。

从应用视角看,这种速度与精度的平衡,直接关系到卫星遥感、无人机巡检、港口监测、交通感知和场景文字识别等需要处理任意朝向目标的场景。高分辨率图像里往往挤满了密集的小目标,检测器不仅要看得准,还得在有限的显存和时延预算下持续运转。

RiO-DETR 的另一层工程意义,在于它保留了 DETR 端到端、无需 NMS 的基本路线。传统密集检测器通常还要依赖阈值和后处理去除重复框,在类别多、目标密集的场景中会增加部署复杂度;端到端预测则让训练目标和最终输出更直接地对应起来。论文里的延迟数据是在 NVIDIA T4、TensorRT 10、FP16 下测的,在统一评测协议下,RiO-DETR 证明了一件事:Transformer 不必天然以高延迟为代价,也可以在与 YOLO 系列模型接近的速度区间内建立竞争力。

总结

RiO-DETR 把旋转目标检测中最棘手的三个问题拆开处理:用内容驱动角度估计解决语义与几何耦合,用解耦周期细化解决角度边界处的错误梯度,用 Oriented Dense O2O 加速扩展搜索空间中的角度收敛。

最终,它在 DOTA-1.0 上以 2.7 ms / 78.4 AP50 覆盖轻量端,以 29.9 ms / 81.8 AP50 覆盖高精度端,并在 DIOR-R 与 FAIR-1M-2.0 上展示出一致的速度 - 精度优势。

更深一层看,这项工作的启示是:旋转检测不是水平检测后面多出来的一列角度值,而是一套不同的语义与几何问题。当模型真正尊重角度的来源、结构和训练规律,端到端与实时性才不再是二选一。

相关内容

我国制造业里的“服务增量”...
转自:央视新闻客户端今年以来,我国服务业持续扩能提质。上半年,服务...
2026-08-16 08:33:26
直冲35℃!长沙高温马上回...
8月14日进入末伏“加长版”三伏天不知不觉已步入尾声“长沙你‘冷’...
2026-08-16 08:33:21
这种常见食物营养价值高,心...
转自:央视网  花生,一种我们日常生活中很常见的食物,虽然脂肪含量...
2026-08-16 08:33:16
珠海彰显“骑行之城”魅力 ...
羊城晚报记者 钱瑜随着省运会的战鼓擂响,南粤大地再次掀起体育热潮。...
2026-08-16 08:33:12
广州 锚定“国际赛事中心”...
羊城晚报记者 苏荇当省运会在茂名激战正酣,广州体育代表团在多个项目...
2026-08-16 08:33:05
热评丨“胶片回潮”之外先解...
  杨靖岫  有一种“回潮”,正在悄然发生。数据显示,在各大主流社...
2026-08-16 08:33:01
女皇帝与寒门宰相——武周时...
8月8日下午,《狄仁杰与武则天:武周革命与平民官僚的崛起》新书分享...
2026-08-16 08:32:56
访谈︱亚历山德拉·沃尔沙姆...
【编者按】当一台机器能够在数秒内概括一篇论文、提炼一本专著的核心论...
2026-08-16 08:32:38
低空旅游如何“起飞”?
转自:工人日报阅读提示从直升机俯瞰太行山脊,到千米高空纵身一跃——...
2026-08-16 08:22:52

热门资讯

我国制造业里的“服务增量” 正... 转自:央视新闻客户端今年以来,我国服务业持续扩能提质。上半年,服务业增加值同比增长5.2%,对经济增...
直冲35℃!长沙高温马上回归 8月14日进入末伏“加长版”三伏天不知不觉已步入尾声“长沙你‘冷’到我了……”有市民惊叹今年三伏长沙...
这种常见食物营养价值高,心血管... 转自:央视网  花生,一种我们日常生活中很常见的食物,虽然脂肪含量不低,却常常出现在各种健康饮食推荐...
珠海彰显“骑行之城”魅力 跨越... 羊城晚报记者 钱瑜随着省运会的战鼓擂响,南粤大地再次掀起体育热潮。在这场全省规格最高、规模最大的体育...
广州 锚定“国际赛事中心”定位... 羊城晚报记者 苏荇当省运会在茂名激战正酣,广州体育代表团在多个项目中交出亮眼答卷。从柔道到拳击、从射...
热评丨“胶片回潮”之外先解决“...   杨靖岫  有一种“回潮”,正在悄然发生。数据显示,在各大主流社交平台上,与“胶片”相关的话题浏览...
女皇帝与寒门宰相——武周时代的... 8月8日下午,《狄仁杰与武则天:武周革命与平民官僚的崛起》新书分享会“女皇帝与寒门宰相——武周时代的...
访谈︱亚历山德拉·沃尔沙姆:剑... 【编者按】当一台机器能够在数秒内概括一篇论文、提炼一本专著的核心论点,历史学家还能做什么?人工智能(...
低空旅游如何“起飞”? 转自:工人日报阅读提示从直升机俯瞰太行山脊,到千米高空纵身一跃——低空旅游正加速走进大众生活。河南低...
中国戏曲学院原院长周育德离世,... 中国戏曲学院原院长、教授、研究员、著名戏曲教育家、理论家,享受国务院政府特殊津贴专家周育德同志,于2...