Ultralytics YOLO27:
Get Started

RTDETRv2 与 YOLO26#

实时目标检测领域发展迅猛,研究人员不断突破速度、精度和部署效率的边界。目前引领这一趋势的两种知名架构是基于 Transformer 的 RTDETRv2,以及先进的卷积神经网络 (CNN) Ultralytics YOLO26。本指南将深入分析二者的架构、性能指标和理想应用场景,帮助你为下一个计算机视觉项目选择合适的模型。

RTDETRv2:实时检测 Transformer#

RTDETRv2 基于原始 RT-DETR 架构构建,旨在将视觉 Transformer 的全局上下文感知能力与实时应用所需的速度结合起来。

主要特点:

  • 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
  • 组织: 百度
  • 日期: 2024-07-24
  • 链接: Arxiv、GitHub、文档

架构与优势#

与传统的基于锚框的检测器不同,RTDETRv2 采用基于 Transformer 的方法,在后处理中原生免去了非极大值抑制 (NMS)的需求。借助灵活的注意力机制,该模型能够有效理解复杂场景和重叠目标。它通过“免费午餐”式改进,在保持高端 GPU 上可接受推理速度的同时,显著提升了在 COCO 数据集上的精度。

局限性#

RTDETRv2 虽然在学术研究中取得了出色成果,但在生产环境中往往面临挑战。与 CNN 相比,Transformer 架构在训练和推理期间通常都需要更多内存。这会给在资源受限的边缘 AI设备上部署带来困难。此外,训练 Transformer 通常需要更大的批次和更多 CUDA 内存,这可能会成为硬件资源有限的研究人员的瓶颈。

进一步了解 RTDETRv2

YOLO26:边缘优先视觉 AI 的巅峰#

Ultralytics YOLO26 于 2026 年初发布,重新定义了基于 CNN 的目标检测所能实现的水平。它集成了尖端优化,专为顺畅的生产部署和极高的硬件效率而设计。

主要特点:

  • 作者: Glenn Jocher 和 Jing Qiu
  • 组织: Ultralytics
  • 日期:2026 年 1 月 14 日
  • 链接:GitHub、文档

架构突破#

YOLO26 引入了多项革命性功能,解决模型部署中的常见痛点:

  • 端到端无 NMS 设计:YOLO26 基于 YOLOv10 首创的概念构建,原生支持端到端处理。借助可选的一对一检测头(nms=False),它无需进行 NMS 后处理,从而大幅降低延迟波动,确保生产环境中的推理时间高度可预测。
  • CPU 推理速度最高提升 43%:通过针对性的架构改进并移除分布焦点损失 (DFL),YOLO26 实现了前所未有的 CPU 速度,使其成为没有独立 GPU 时进行边缘计算的首选。
  • MuSGD 优化器:受 Moonshot AI 的 Kimi K2 等大语言模型 (LLM) 训练技术启发,YOLO26 使用 MuSGD 优化器(结合 SGD 和 Muon 的混合优化器),确保训练过程高度稳定并快速收敛。
  • ProgLoss + STAL:这些高级损失函数显著提升了小目标识别能力,对于涉及航空影像和无人机监控的应用至关重要。
YOLO26 的任务专项增强

除标准检测外,YOLO26 还针对特定任务进行了改进:语义分割损失和多尺度原型网络用于分割任务,残差对数似然估计 (RLE) 用于姿态估计,定制角度损失则用于解决有向边界框 (OBB)检测中的边界问题。

性能对比#

评估这些模型时,兼顾精度 (mAP) 和计算效率至关重要。下表展示了 YOLO26 在不同尺寸变体中始终优于 RTDETRv2。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

如上所示,YOLO26x 模型的 mAP 高达 57.5,显著超过 RTDETRv2-x,同时参数更少,TensorRT推理速度也更快。此外,YOLO26 的内存需求明显更低,因此是实时边缘部署的最佳选择。

生态系统与易用性#

原始性能固然重要,但模型周边的生态系统决定了模型从研究走向生产的速度。这正是 Ultralytics Platform 能够提供无可比拟优势的地方。

维护完善的统一生态系统#

RTDETRv2 主要作为研究级代码库运行,可能需要复杂的环境配置和针对自定义任务的手动脚本。相比之下,Ultralytics YOLO26 受益于成熟且经过充分测试的 Python 软件包。Ultralytics 生态系统提供了极其流畅的用户体验,并通过简洁的 API 支持训练、验证、预测和导出。

通过内置集成 Weights & Biases 和 Comet ML,实验跟踪变得轻松顺畅。此外,Ultralytics 模型用途广泛:RTDETRv2 专注于目标检测,而 YOLO26 则在同一框架中原生支持实例分割、姿态估计和图像分类。

代码示例:简洁直观的实践#

Ultralytics API 允许开发者只用几行代码即可加载模型、训练模型并运行推理。这大幅提升了训练效率,缩短了产品上市时间。

from ultralytics import RTDETR, YOLO

# 加载 RT-DETR 模型
model_rtdetr = RTDETR("rtdetr-l.pt")

# 加载先进的 YOLO26 模型
model_yolo = YOLO("yolo26n.pt")

# 轻松对图像运行推理
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# 显示 YOLO26 的结果
results_yolo[0].show()

# 一键将 YOLO26 导出为 ONNX 格式
model_yolo.export(format="onnx")

用例与建议#

选择 RT-DETR 还是 YOLO26,取决于你的具体项目需求、部署限制和生态偏好。

何时选择 RT-DETR#

以下场景适合选择 RT-DETR:

  • 基于 Transformer 的检测研究:探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测。
  • 对延迟要求灵活的高精度场景:检测准确率至关重要,且可以接受略高推理延迟的应用。
  • 大型目标检测:场景中的目标以中大型为主,此时 Transformer 的全局注意力机制能够发挥天然优势。

何时选择 YOLO26#

以下场景推荐使用 YOLO26:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

探索其他架构#

虽然 YOLO26 代表着当前性能的巅峰,开发者也可以从探索之前的版本中获益。大获成功的 YOLO11 仍是一款可靠且获得全面支持的模型,适用于各种旧版系统。阅读我们的 RT-DETR 与 YOLO11 对比,深入了解 YOLO11 的能力。此外,如果你正在分析较早期的架构,可以查看 EfficientDet 与 YOLO26 对比,了解发展历程,这有助于你认识到 目标检测架构 已取得的进步。

结语#

RTDETRv2 和 YOLO26 都为 AI 领域带来了令人瞩目的进步。不过,对于优先考虑顺利投入生产、最小内存占用和广泛任务适用性的团队,我们明确推荐 Ultralytics YOLO26。其无需 NMS 的架构、出色的 CPU 速度,以及强大的 Ultralytics 生态系统支持,可确保你的视觉 AI 项目具备可扩展性、高效率和面向未来的能力。无论是在云服务器上部署,还是在资源有限的 Raspberry Pi 上部署,YOLO26 开箱即能提供毫不妥协的性能。

评论