YOLO Vision 2026:

YOLOv9 与 RTDETRv2 对比#

近年来,实时object detection领域经历了范式转变。该领域涌现出了两种截然不同的架构哲学:高度优化的卷积神经网络(CNN)与实时检测 Transformer(DETR)。代表这两种方法巅峰的是 YOLOv9RTDETRv2

本综合指南对这两款强大的模型进行了对比,分析了它们的架构创新、performance metrics以及理想的部署场景,帮助你为自己的computer vision流水线选择正确的模型。

执行摘要#

这两款模型都取得了业界领先的成果,但它们分别适用于略有不同的部署约束和开发生态系统。

  • 选择 YOLOv9,如果: 你需要极高的参数利用效率和边缘设备上的快速推理。YOLOv9 推向了 CNN 效率的理论极限,使其成为计算资源受限环境的理想选择。
  • 选择 RTDETRv2,如果: 你需要 Transformer 提供的细致上下文理解能力,特别是在存在严重遮挡或复杂对象关系的场景中,并且你拥有支持较重架构的硬件。
  • 如果符合以下情况,建议选择 YOLO26(推荐): 你希望鱼与熊掌兼得。作为 Ultralytics Platform 上可用的最新一代产品,YOLO26 具备原生的端到端 NMS-Free 设计(类似于 DETR 模型,但速度要快得多),消除了后处理瓶颈,并且与上一代相比,CPU 推理速度提升高达 43%。

技术规格与作者信息#

了解这些模型的起源和设计意图,可以为理解其架构选择提供至关重要的背景信息。

YOLOv9#

作者: Chien-Yao Wang 和 Hong-Yuan Mark Liao
机构: Institute of Information Science, Academia Sinica
日期: 2024-02-21
Arxiv: https://arxiv.org/abs/2402.13616
GitHub: WongKinYiu/yolov9

了解更多关于 YOLOv9 的信息

RTDETRv2#

作者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang 和 Yi Liu
机构: Baidu
日期: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR

了解更多关于 RTDETR 的信息

架构创新#

YOLOv9:解决信息瓶颈#

Ultralytics YOLOv9 引入了两项重大创新,旨在解决数据流经深度神经网络时产生的信息丢失问题:

  1. 可编程梯度信息 (PGI): 这种辅助监督框架确保生成可靠的梯度来更新网络权重,即使在极深的网络层中也能保留关键的特征信息。
  2. 通用高效层聚合网络 (GELAN): 一种结合了 CSPNet 和 ELAN 优点的创新架构。GELAN 优化了参数效率,使 YOLOv9 相比传统 CNN 能以更少的 FLOPs 实现更高的精度。

RTDETRv2:增强实时 Transformer#

在继承原版 RT-DETR 成功经验的基础上,RTDETRv2 采用了基于 Transformer 的架构,天然地避免了对非极大值抑制(NMS)的需求。其改进包括:

  1. Bag-of-Freebies 策略: v2 迭代结合了先进的训练技术和数据增强手段,在不增加推理延迟的情况下显著提升了准确度。
  2. 高效混合编码器: 通过解耦的尺度内和跨尺度注意力机制处理多尺度特征,RTDETRv2 有效地管理了 Vision Transformer 传统上极高的计算成本。
原生端到端检测

虽然 RTDETRv2 利用 Transformer 实现了免 NMS 检测,但全新的 YOLO26 architecture 在高度优化的 CNN 结构中原生实现了这一点,提供了同样精简的部署,但边缘推理速度要快得多。

性能比较#

在评估用于生产环境的模型时,accuracy与计算需求之间的权衡至关重要。下表概述了各种模型大小在标准基准测试中的性能。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
参数量
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

分析#

如数据显示,YOLOv9 在参数效率方面保持了严格的优势。YOLOv9c 模型在仅有 25.3M 参数的情况下实现了令人印象深刻的 53.0 mAP,使其极其轻量化。

相比之下,RTDETRv2 在中大型模型类别中表现出强劲的竞争力。然而,这是以更高的参数量和显著更大的 FLOPs 为代价的,这是Transformer models的典型特征。这种架构上的差异也体现在内存使用上:与 Transformer 对应模型相比,YOLO 模型在训练和推理过程中通常需要少得多的 CUDA 内存。

Ultralytics 优势:生态系统与多功能性#

虽然单纯的架构指标很重要,但软件生态系统往往决定了一个 AI 项目的成败。通过 Ultralytics Python API 访问这些先进模型可提供无与伦比的优势。

简化的训练与部署#

训练检测 Transformer 通常需要复杂的配置文件和高端 GPU。通过利用 Ultralytics framework,开发者可以使用相同且简单的语法来训练 YOLOv9 和 RTDETR 模型,从而受益于高效的训练流水线和随时可用的预训练权重。

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")

无与伦比的任务多功能性#

像 RTDETRv2 这样专业化模型的一个主要局限性在于它们狭隘地专注于边界框检测。相比之下,更广泛的 Ultralytics 生态系统包含 YOLO11YOLOv8 等模型,支持广泛的computer vision tasks。这包括像素级的instance segmentation、骨骼pose estimation、全图classification,以及用于航拍图像的Oriented Bounding Box (OBB)检测。

实际应用场景#

高速边缘分析#

对于需要在边缘设备上进行实时产品识别的零售环境或制造生产线,YOLOv9 是更优的选择。其GELAN architecture确保了在 NVIDIA Jetson 系列等受限硬件上的高吞吐量,从而能够在没有明显延迟的情况下实现自动化质量控制。

复杂场景分析#

在诸如密集人群监控或复杂交通路口等对象频繁发生相互遮挡的场景中,RTDETRv2 的全局注意力机制表现出色。该模型对整个图像上下文进行原生推理的能力,使其即使在对象被部分隐藏的情况下也能保持稳健的追踪和检测。

应用场景与建议#

在 YOLOv9 和 RT-DETR 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv9#

YOLOv9 是以下场景的有力选择:

  • 信息瓶颈研究: 研究可编程梯度信息 (PGI) 和通用高效层聚合网络 (GELAN) 架构的学术项目。
  • 梯度流优化研究: 专注于理解和减轻训练过程中深度网络层信息丢失的研究。
  • 高精度检测基准测试: 需要将 YOLOv9 强大的 COCO 基准表现作为架构对比参考点的场景。

何时选择 RT-DETR#

推荐使用 RT-DETR 的场景为:

  • 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构以实现无 NMS 的端到端目标检测的项目。
  • 高精度、延迟要求宽松的场景: 将检测精度置于首位,且可以容忍稍高推理延迟的应用。
  • 大目标检测: 以中大型目标为主的场景,在这种场景下,Transformer 的全局注意力机制具有天然优势。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26 提供了性能与开发者体验的最佳结合:

  • 无 NMS 的边缘部署: 需要一致、低延迟推理且无需复杂非极大值抑制后处理的应用。
  • 仅 CPU 环境: 没有专用 GPU 加速的设备,YOLO26 带来的高达 43% 的 CPU 推理提速可提供决定性优势。
  • 小目标检测: 诸如航拍无人机图像或物联网传感器分析等具有挑战性的场景,其中 ProgLoss 和 STAL 显著提高了微小目标的准确率。

未来展望:YOLO26 的到来#

尽管 YOLOv9 和 RTDETRv2 代表了巨大的成就,但computer vision领域发展迅速。对于想要启动新项目的开发者而言,YOLO26 是推荐的先进解决方案。

YOLO26 发布于 2026 年,融合了 CNN 和 DETR 的最佳特性。它采用端到端 NMS-Free 设计,完全消除了后处理延迟——这一技术最早在 YOLOv10 中开创。此外,YOLO26 移除了分布式焦点损失(DFL)以获得更好的边缘兼容性,并引入了革命性的 MuSGD Optimizer。受大语言模型训练(特别是 Moonshot AI 的 Kimi K2)启发,这种混合优化器确保了前所未有的训练稳定性和更快的收敛速度。

结合 ProgLoss 和 STAL 等改进的损失函数以实现出色的细小目标识别,YOLO26 提供了高达 43% 的 CPU 推理速度提升,巩固了其作为现代 AI 部署终极模型的地位。

评论