Ultralytics YOLO27:
Get Started

RTDETRv2 与 DAMO-YOLO#

计算机视觉领域不断发展,研究人员和工程师一直在努力构建能完美平衡速度、精度和效率的模型。在这一领域颇具影响力的两种架构是百度开发的 RTDETRv2 和阿里巴巴集团打造的 DAMO-YOLO。两种模型都拓展了实时目标检测的能力边界,但它们采用了截然不同的架构理念来实现出色的效果。

在这篇技术对比中,我们将深入探讨它们的架构、训练方法和实际部署能力。我们还会了解这些模型与更广泛生态系统的对比,尤其是高度优化的 Ultralytics Platform 和先进的 YOLO26 架构。

架构创新#

对于负责为生产环境选择合适工具的机器学习工程师来说,了解这些模型的核心机制至关重要。

RTDETRv2:Transformer 方法#

在原版 RT-DETR 成功的基础上,RTDETRv2 采用了混合编码器和Transformer 解码器。这种设计使模型能够高效处理全局上下文,因此特别擅长区分密集场景中的重叠对象。该架构最显著的优势是原生支持无需 NMS(非极大值抑制)的设计。通过省去 NMS 后处理步骤,RTDETRv2 简化了推理流程,并确保在不同硬件配置下延迟更加稳定。

进一步了解 RTDETRv2

DAMO-YOLO:提升 CNN 效率#

另一方面,DAMO-YOLO 仍然植根于成功的 CNN YOLO 系列,但引入了多项突破性改进。它利用神经架构搜索(NAS)优化骨干网络,确保最高的特征提取效率。此外,它还采用高效的 RepGFPN(重参数化广义特征金字塔网络)和 ZeroHead 设计,并结合 AlignedOTA 和蒸馏增强技术。这些创新使 DAMO-YOLO 能够实现快速推理,同时保持极具竞争力的 mAPval得分。

进一步了解 DAMO-YOLO

架构差异

RTDETRv2 专注于利用注意力机制理解全局特征,无需 NMS;DAMO-YOLO 则通过 NAS 和先进的蒸馏技术最大限度地提高传统 CNN 的效率,需要标准后处理,但在某些硬件上具有独特的速度优势。

性能与指标对比#

在评估部署模型时,性能指标,例如平均精度均值(mAP)、推理速度和参数量,至关重要。下面是这两个模型系列的详细对比。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

结果分析#

如表所示,RTDETRv2-x 的 mAPval达到 54.3,精度最高,体现了 Transformer 架构在COCO 数据集等复杂验证场景中的强大能力。不过,这需要付出参数量(76M)和 FLOPs 显著增加的代价。

相比之下,DAMO-YOLOt(Tiny)极为轻量,只需 8.5M 个参数,因此非常适合 CUDA 内存严重受限的环境。对于较旧的边缘设备,DAMO-YOLO 通常能在速度和精度之间取得有利的平衡。

生态系统、易用性与 Ultralytics 优势#

虽然官方的 RT-DETR GitHub 和 DAMO-YOLO GitHub 等独立代码库提供了训练这些模型所需的原始代码,但将它们集成到生产流程中往往需要编写大量样板代码并手动优化。

Ultralytics 生态系统能大幅简化开发者的使用体验。Ultralytics 将原版 RT-DETR 等 Transformer 检测器直接集成到统一 API 中,让用户只需一行代码即可训练、验证和导出模型。此外,与庞大的独立 Transformer 代码库相比,Ultralytics 模型在训练期间的内存需求以低而著称。

代码示例:无缝集成#

下面介绍如何轻松使用 Ultralytics Python 库运行推理。无论你使用的是 Transformer 模型还是先进的 CNN,API 都保持一致。

from ultralytics import RTDETR, YOLO

# 加载 RT-DETR 模型以理解复杂场景
model_rtdetr = RTDETR("rtdetr-l.pt")

# 加载最新的 Ultralytics YOLO26 模型,实现极致边缘性能
model_yolo26 = YOLO("yolo26n.pt")

# 轻松对示例图像运行推理
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# 显示结果
results_yolo[0].show()
导出用于生产环境的模型

使用 Ultralytics API,你可以轻松将训练好的模型导出为 TensorRT、ONNX 或 CoreML 等格式,只需运行简单的 model.export(format="engine") 命令,即可大幅降低部署难度。

理想应用场景#

选择这些架构完全取决于你的具体项目需求:

  • RTDETRv2 在 VRAM 充足的服务器端处理场景中表现出色。它对全局上下文的感知能力非常适合医学成像和密集人群分析等遮挡频繁的场景。
  • DAMO-YOLO 非常适合嵌入式 IoT 应用和高速工业检测生产线,这些场景对低参数量和高 FPS 有严格要求。

未来方向:Ultralytics YOLO26#

RTDETRv2 和 DAMO-YOLO 各有优势,但计算机视觉领域发展迅速。对于新项目,最新的 Ultralytics YOLO26 代表了速度、精度和开发者体验的终极融合。

YOLO26 采用端到端无 NMS 设计,在避免巨大计算开销的同时,保留了 Transformer 的主要优势。它融入了创新的 MuSGD 优化器——其灵感来自大型语言模型训练——从而实现稳定、快速的收敛。此外,YOLO26 通过移除 DFL(移除分布焦点损失,以简化导出流程并更好地兼容边缘设备和低功耗设备),实现了 CPU 推理速度最高提升 43%,成为边缘计算领域无可争议的佼佼者。此外,ProgLoss + STAL 提供了改进的损失函数,显著提升小目标识别能力,这对 IoT、机器人和航空影像至关重要。

YOLO26 系列并非局限于边界框任务,而是具备无与伦比的通用性,支持从实例分割和姿态估计到有向边界框(OBB)等多种任务,所有任务都可通过直观的 Ultralytics Platform 无缝管理。

模型详情与参考资料#

RTDETRv2#

  • 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
  • 组织: 百度
  • 日期: 2024-07-24
  • Arxiv: 2407.17140
  • GitHub:RT-DETR 仓库

DAMO-YOLO#

如果你还想了解其他模型对比,可以查看我们的 RTDETRv2 与 YOLO11 对比指南或 DAMO-YOLO 与 YOLOv8 对比指南,了解这些模型与 Ultralytics 系列前几代模型的表现差异。

评论