Ultralytics YOLO27:
Get Started

YOLOv9 与 RTDETRv2#

近年来,实时目标检测领域经历了范式转变。两种截然不同的架构理念脱颖而出,主导了这一领域:高度优化的卷积神经网络 (CNNs) 和实时检测 Transformer (DETRs)。YOLOv9 和 RTDETRv2 分别代表了这两种方法的巅峰。

本指南全面对比这两款强大的模型,分析它们的架构创新、性能指标和理想部署场景,帮助你为计算机视觉流程选择合适的模型。

执行摘要#

两款模型都达到了最先进的水平,但它们适用于略有不同的部署限制和开发生态系统。

  • 选择 YOLOv9 的情况: 你需要高效利用参数,并在边缘设备上实现快速推理。YOLOv9 将 CNN 效率的理论极限推向新高度,非常适合计算资源受到严格限制的环境。
  • 选择 RTDETRv2 的情况: 你需要 Transformer 提供的细致上下文理解能力,尤其是在存在严重遮挡或复杂对象关系的场景中,并且硬件能够支持略重的架构。
  • 选择 YOLO26(推荐)的情况: 你希望两全其美。作为 Ultralytics Platform 上提供的最新一代模型,YOLO26 采用可选的端到端无 NMS 设计(nms=False,与 DETR 模型相似,但速度快得多),消除了后处理瓶颈,并使 CPU 推理速度比前几代最高提升 43%。

技术规格与作者信息#

了解这些模型的起源和设计意图,有助于深入理解其架构选择。

YOLOv9#

了解有关 YOLOv9 的更多信息

RTDETRv2#

进一步了解 RTDETRv2

架构创新#

YOLOv9:解决信息瓶颈#

YOLOv9 引入了两项重大创新,旨在解决数据通过深层神经网络时出现的信息丢失问题:

  1. 可编程梯度信息 (PGI): 这一辅助监督框架可确保生成可靠的梯度来更新网络权重,即使在非常深的网络层中也能保留关键特征信息。
  2. 广义高效层聚合网络 (GELAN): 一种融合 CSPNet 和 ELAN 优势的新型架构。GELAN 优化了参数效率,使 YOLOv9 能以更少的 FLOPs 达到比传统 CNN 更高的准确率。

RTDETRv2:增强实时 Transformer#

在原版 RT-DETR 成功的基础上,RTDETRv2 采用基于 Transformer 的架构,从根本上避免了对非极大值抑制 (NMS) 的需求。它的改进包括:

  1. 免费增益策略: v2 版本纳入了先进的训练技术和数据增强方法,大幅提升准确率,同时不会增加推理延迟开销。
  2. 高效混合编码器: RTDETRv2 通过解耦的尺度内和跨尺度注意力机制处理多尺度特征,高效降低了视觉 Transformer 通常较高的计算成本。
原生端到端检测

RTDETRv2 利用 Transformer 实现无需 NMS 的检测,而新的 YOLO26 架构 则在高度优化的 CNN 结构中通过可选的一对一检测头 (nms=False) 实现这一点,提供同样精简的部署体验,同时显著提升边缘推理速度。

性能对比#

在评估用于生产环境的模型时,准确率与计算需求之间的权衡至关重要。下表概述了不同模型尺寸在标准基准测试中的性能。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

分析#

数据显示,YOLOv9 在参数效率方面保持明显优势。YOLOv9c 模型仅用 25.5M 个参数便达到出色的 53.0 mAP,体积十分轻巧。

相比之下,RTDETRv2 在中大型模型类别中表现出强劲竞争力。不过,这也意味着参数量更高,FLOPs 显著增加,这是 Transformer 模型的典型特点。这种架构差异也会影响内存用量:与 Transformer 模型相比,YOLO 模型在训练和推理期间通常需要少得多的 CUDA 内存。

Ultralytics 的优势:生态系统与多功能性#

纯粹的架构指标固然重要,但软件生态系统往往决定了 AI 项目的成败。通过 Ultralytics Python API 使用这些先进模型,可以获得无与伦比的优势。

简化训练与部署流程#

训练检测 Transformer 通常需要复杂的配置文件和高端 GPU。借助 Ultralytics 框架,开发者可以使用相同的简单语法训练 YOLOv9 和 RT-DETR 模型,并受益于高效的训练流水线和随时可用的预训练权重。

from ultralytics import RTDETR, YOLO

# 训练 YOLOv9 模型
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# 使用完全相同的 API 训练 RTDETR 模型
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# 轻松将模型导出为 OpenVINO 或 TensorRT
model_yolo.export(format="openvino")

无与伦比的任务灵活性#

RTDETRv2 等专用模型的一个主要局限是仅专注于边界框检测。相比之下,更广泛的 Ultralytics 生态系统涵盖 YOLO11 和 YOLOv8 等模型,支持种类繁多的计算机视觉任务。其中包括像素级精准的实例分割、骨架姿态估计、整幅图像分类,以及用于航空影像的有向边界框 (OBB)检测。

实际应用#

高速边缘分析#

对于需要在边缘设备上实时识别产品的零售环境或制造产线,YOLOv9 是更优的选择。其 GELAN 架构可在 NVIDIA Jetson 系列等受限硬件上实现高吞吐量,从而支持自动化质量控制,且不会产生明显延迟。

复杂场景分析#

在密集人群监控或复杂交通路口等场景中,物体经常相互遮挡,RTDETRv2 的全局注意力机制表现出色。该模型能够原生地理解整幅图像的上下文,即使物体被部分遮挡,也能保持稳健的跟踪和检测能力。

用例与建议#

在 YOLOv9 和 RT-DETR 之间做出选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv9#

YOLOv9 适用于:

  • 信息瓶颈研究:研究可编程梯度信息 (PGI) 和广义高效层聚合网络 (GELAN) 架构的学术项目。
  • 梯度流优化研究:重点研究如何理解并缓解训练期间深层网络层中的信息损失。
  • 高准确率检测基准测试:需要将 YOLOv9 在 COCO 基准测试中的出色表现作为架构对比参照的场景。

何时选择 RT-DETR#

以下情况推荐使用 RT-DETR:

  • 基于 Transformer 的检测研究:探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测。
  • 对延迟要求灵活的高精度场景:检测准确率至关重要,且可以接受略高推理延迟的应用。
  • 大型目标检测:场景中的目标以中大型为主,此时 Transformer 的全局注意力机制能够发挥天然优势。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

未来已来:YOLO26 登场#

YOLOv9 和 RTDETRv2 都取得了巨大成就,但计算机视觉领域发展迅速。对于希望启动新项目的开发者,YOLO26 是推荐的先进解决方案。

YOLO26 于 2026 年发布,融合了 CNN 和 DETR 的最佳特性。它采用可选的端到端无 NMS 设计 (nms=False),无需进行 NMS 后处理;这一技术最早由 YOLOv10 首创。此外,YOLO26 移除了分布焦点损失 (DFL),以提升边缘端兼容性,并引入了革命性的 MuSGD 优化器。这一混合优化器的设计灵感源自大语言模型训练(尤其是 Moonshot AI 的 Kimi K2),可确保前所未有的训练稳定性和更快的收敛速度。

结合 ProgLoss 和 STAL(渐进式损失与小目标感知标签分配),YOLO26 能够出色地识别小目标,CPU 推理速度最高提升 43%,进一步巩固了其作为现代 AI 部署首选模型的地位。

评论