YOLOv9 与 RTDETRv2#
近年来,实时目标检测领域经历了范式转变。两种截然不同的架构理念脱颖而出,主导了这一领域:高度优化的卷积神经网络 (CNNs) 和实时检测 Transformer (DETRs)。YOLOv9 和 RTDETRv2 分别代表了这两种方法的巅峰。
本指南全面对比这两款强大的模型,分析它们的架构创新、性能指标和理想部署场景,帮助你为计算机视觉流程选择合适的模型。
执行摘要#
两款模型都达到了最先进的水平,但它们适用于略有不同的部署限制和开发生态系统。
- 选择 YOLOv9 的情况: 你需要高效利用参数,并在边缘设备上实现快速推理。YOLOv9 将 CNN 效率的理论极限推向新高度,非常适合计算资源受到严格限制的环境。
- 选择 RTDETRv2 的情况: 你需要 Transformer 提供的细致上下文理解能力,尤其是在存在严重遮挡或复杂对象关系的场景中,并且硬件能够支持略重的架构。
- 选择 YOLO26(推荐)的情况: 你希望两全其美。作为 Ultralytics Platform 上提供的最新一代模型,YOLO26 采用可选的端到端无 NMS 设计(
nms=False,与 DETR 模型相似,但速度快得多),消除了后处理瓶颈,并使 CPU 推理速度比前几代最高提升 43%。
技术规格与作者信息#
了解这些模型的起源和设计意图,有助于深入理解其架构选择。
YOLOv9#
- 作者:Chien-Yao Wang 和 Hong-Yuan Mark Liao
- 机构:中央研究院信息科学研究所
- 日期:2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
- 组织: 百度
- 日期: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
架构创新#
YOLOv9:解决信息瓶颈#
YOLOv9 引入了两项重大创新,旨在解决数据通过深层神经网络时出现的信息丢失问题:
- 可编程梯度信息 (PGI): 这一辅助监督框架可确保生成可靠的梯度来更新网络权重,即使在非常深的网络层中也能保留关键特征信息。
- 广义高效层聚合网络 (GELAN): 一种融合 CSPNet 和 ELAN 优势的新型架构。GELAN 优化了参数效率,使 YOLOv9 能以更少的 FLOPs 达到比传统 CNN 更高的准确率。
RTDETRv2:增强实时 Transformer#
在原版 RT-DETR 成功的基础上,RTDETRv2 采用基于 Transformer 的架构,从根本上避免了对非极大值抑制 (NMS) 的需求。它的改进包括:
- 免费增益策略: v2 版本纳入了先进的训练技术和数据增强方法,大幅提升准确率,同时不会增加推理延迟开销。
- 高效混合编码器: RTDETRv2 通过解耦的尺度内和跨尺度注意力机制处理多尺度特征,高效降低了视觉 Transformer 通常较高的计算成本。
RTDETRv2 利用 Transformer 实现无需 NMS 的检测,而新的 YOLO26 架构 则在高度优化的 CNN 结构中通过可选的一对一检测头 (nms=False) 实现这一点,提供同样精简的部署体验,同时显著提升边缘推理速度。
性能对比#
在评估用于生产环境的模型时,准确率与计算需求之间的权衡至关重要。下表概述了不同模型尺寸在标准基准测试中的性能。
| 模型 | 尺寸 (像素) | mAP验证集 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
分析#
数据显示,YOLOv9 在参数效率方面保持明显优势。YOLOv9c 模型仅用 25.5M 个参数便达到出色的 53.0 mAP,体积十分轻巧。
相比之下,RTDETRv2 在中大型模型类别中表现出强劲竞争力。不过,这也意味着参数量更高,FLOPs 显著增加,这是 Transformer 模型的典型特点。这种架构差异也会影响内存用量:与 Transformer 模型相比,YOLO 模型在训练和推理期间通常需要少得多的 CUDA 内存。
Ultralytics 的优势:生态系统与多功能性#
纯粹的架构指标固然重要,但软件生态系统往往决定了 AI 项目的成败。通过 Ultralytics Python API 使用这些先进模型,可以获得无与伦比的优势。
简化训练与部署流程#
训练检测 Transformer 通常需要复杂的配置文件和高端 GPU。借助 Ultralytics 框架,开发者可以使用相同的简单语法训练 YOLOv9 和 RT-DETR 模型,并受益于高效的训练流水线和随时可用的预训练权重。
from ultralytics import RTDETR, YOLO
# 训练 YOLOv9 模型
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# 使用完全相同的 API 训练 RTDETR 模型
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# 轻松将模型导出为 OpenVINO 或 TensorRT
model_yolo.export(format="openvino")无与伦比的任务灵活性#
RTDETRv2 等专用模型的一个主要局限是仅专注于边界框检测。相比之下,更广泛的 Ultralytics 生态系统涵盖 YOLO11 和 YOLOv8 等模型,支持种类繁多的计算机视觉任务。其中包括像素级精准的实例分割、骨架姿态估计、整幅图像分类,以及用于航空影像的有向边界框 (OBB)检测。
实际应用#
高速边缘分析#
对于需要在边缘设备上实时识别产品的零售环境或制造产线,YOLOv9 是更优的选择。其 GELAN 架构可在 NVIDIA Jetson 系列等受限硬件上实现高吞吐量,从而支持自动化质量控制,且不会产生明显延迟。
复杂场景分析#
在密集人群监控或复杂交通路口等场景中,物体经常相互遮挡,RTDETRv2 的全局注意力机制表现出色。该模型能够原生地理解整幅图像的上下文,即使物体被部分遮挡,也能保持稳健的跟踪和检测能力。
用例与建议#
在 YOLOv9 和 RT-DETR 之间做出选择,取决于你的具体项目需求、部署限制和生态系统偏好。
何时选择 YOLOv9#
YOLOv9 适用于:
- 信息瓶颈研究:研究可编程梯度信息 (PGI) 和广义高效层聚合网络 (GELAN) 架构的学术项目。
- 梯度流优化研究:重点研究如何理解并缓解训练期间深层网络层中的信息损失。
- 高准确率检测基准测试:需要将 YOLOv9 在 COCO 基准测试中的出色表现作为架构对比参照的场景。
何时选择 RT-DETR#
以下情况推荐使用 RT-DETR:
- 基于 Transformer 的检测研究:探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测。
- 对延迟要求灵活的高精度场景:检测准确率至关重要,且可以接受略高推理延迟的应用。
- 大型目标检测:场景中的目标以中大型为主,此时 Transformer 的全局注意力机制能够发挥天然优势。
何时选择 Ultralytics (YOLO26)#
对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:
- 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
- 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
- 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。
未来已来:YOLO26 登场#
YOLOv9 和 RTDETRv2 都取得了巨大成就,但计算机视觉领域发展迅速。对于希望启动新项目的开发者,YOLO26 是推荐的先进解决方案。
YOLO26 于 2026 年发布,融合了 CNN 和 DETR 的最佳特性。它采用可选的端到端无 NMS 设计 (nms=False),无需进行 NMS 后处理;这一技术最早由 YOLOv10 首创。此外,YOLO26 移除了分布焦点损失 (DFL),以提升边缘端兼容性,并引入了革命性的 MuSGD 优化器。这一混合优化器的设计灵感源自大语言模型训练(尤其是 Moonshot AI 的 Kimi K2),可确保前所未有的训练稳定性和更快的收敛速度。
结合 ProgLoss 和 STAL(渐进式损失与小目标感知标签分配),YOLO26 能够出色地识别小目标,CPU 推理速度最高提升 43%,进一步巩固了其作为现代 AI 部署首选模型的地位。