Ultralytics YOLO27:

RTDETRv2 与 YOLO26#

实时目标检测领域经历了巨大的发展,研究人员不断突破速度、准确率和部署效率的极限。目前引领这一发展的两种最具代表性的架构是基于 Transformer 的 RTDETRv2 和先进的卷积神经网络 (CNN) Ultralytics YOLO26。本指南将深入分析它们的架构、性能指标和理想应用场景,帮助你为下一个计算机视觉项目选择合适的模型。

RTDETRv2:实时检测 Transformer#

RTDETRv2 构建于原始 RT-DETR 架构之上,旨在将视觉 Transformer 对全局上下文的感知能力与实时应用所需的速度相结合。

主要特点:

  • 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
  • 组织: Baidu
  • 日期: 2024-07-24
  • 链接: ArxivGitHub文档

架构与优势#

与传统的基于锚框的检测器不同,RTDETRv2 采用基于 Transformer 的方法,在后处理阶段原生地省去了非极大值抑制 (NMS)的需求。通过利用灵活的注意力机制,该模型能够高效理解复杂场景和重叠目标。其“Bag-of-Freebies”改进显著提升了其在 COCO 数据集上的准确率,同时在高端 GPU 上保持了可接受的推理速度。

限制#

尽管 RTDETRv2 取得了令人印象深刻的学术成果,但它在生产环境中通常会带来一些挑战。与 CNN 相比,Transformer 架构在训练和推理期间都天然需要更多内存。这可能使其难以部署到资源受限的边缘 AI设备上。此外,训练 Transformer 通常需要更大的批量大小和更多 CUDA 内存,这对于硬件资源有限的研究人员来说可能成为瓶颈。

了解更多关于 RTDETRv2 的信息

YOLO26:边缘优先视觉 AI 的巅峰#

Ultralytics YOLO26 于 2026 年初发布,重新定义了基于 CNN 的目标检测能力边界。它融入了专门针对无缝生产部署和极致硬件效率的前沿优化。

主要特点:

  • 作者: Glenn Jocher 和 Jing Qiu
  • 组织: Ultralytics
  • 日期: 2026 年 1 月 14 日
  • 链接: GitHub文档

架构突破#

YOLO26 引入了多项革命性功能,解决了模型部署中的常见痛点:

  • 端到端无 NMS 设计: YOLO26 构建于 YOLOv10 首创的相关理念之上,原生支持端到端处理。通过移除 NMS 后处理,它大幅降低了延迟波动,确保生产环境中的推理时间高度可预测。
  • CPU 推理速度最高提升 43%: 通过针对性的架构优化并移除分布式焦点损失 (DFL),YOLO26 实现了前所未有的 CPU 速度,使其成为无需专用 GPU 的边缘计算首选。
  • MuSGD 优化器: YOLO26 借鉴了类似 Moonshot AI 的 Kimi K2 所采用的大语言模型 (LLM) 训练技术,使用 MuSGD 优化器(SGD 和 Muon 的混合体)。这确保了训练过程高度稳定,并实现了极快的收敛速度。
  • ProgLoss + STAL: 这些先进的损失函数显著提升了小目标识别能力,对于涉及航空影像和无人机监控的应用来说是一项必要升级。
YOLO26 中针对任务的增强

除了标准检测之外,YOLO26 还提供了专门的改进:用于分割任务的语义分割损失和多尺度 proto、用于姿态估计的残差对数似然估计 (RLE),以及用于解决有向边界框 (OBB)检测边界问题的定制角度损失。

性能对比#

评估这些模型时,在准确率 (mAP) 和计算效率之间取得良好的性能平衡至关重要。下表展示了 YOLO26 如何在各种尺寸变体中持续超越 RTDETRv2。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

如上所示,YOLO26x 模型实现了出色的 57.5 mAP,显著超过 RTDETRv2-x 模型,同时使用更少的参数,并保持更快的 TensorRT 推理速度。此外,YOLO26 的内存需求明显更低,使其成为实时边缘部署的最佳选择。

生态系统与易用性#

虽然原始性能至关重要,但周边生态系统决定了模型从研究走向生产的速度。这正是 Ultralytics 平台能够提供无与伦比优势的地方。

维护良好且统一的生态系统#

RTDETRv2 主要作为研究级代码仓库运行,可能需要复杂的环境配置以及针对自定义任务的手动脚本编写。相比之下,Ultralytics YOLO26 得益于成熟且经过充分测试的 Python 软件包。Ultralytics 生态系统提供了极其简化的用户体验,通过简单的 API 支持训练、验证、预测和导出。

借助与 Weights & BiasesComet ML 的内置集成,实验跟踪变得十分顺畅。此外,Ultralytics 模型具有很强的通用性;RTDETRv2 专注于目标检测,而 YOLO26 则在完全相同的框架内原生支持实例分割、姿态估计和图像分类。

代码示例:简洁实践#

Ultralytics API 允许开发者仅用几行代码即可加载、训练模型并运行推理。这显著提升了训练效率,缩短了产品上市时间。

from ultralytics import RTDETR, YOLO

# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the YOLO26 results
results_yolo[0].show()

# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")

使用场景与建议#

在 RT-DETR 和 YOLO26 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 RT-DETR#

RT-DETR 适合以下场景:

  • 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测的项目。
  • 高精度且延迟灵活的场景: 将检测精度置于首要位置,并且可以接受略高推理延迟的应用。
  • 大型目标检测: 主要包含中大型目标的场景,在这些场景中,Transformer 的全局注意力机制具有天然优势。

何时选择 YOLO26#

推荐使用 YOLO26 的场景:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

探索其他架构#

尽管 YOLO26 代表了当前的性能巅峰,但开发者可能也会发现探索先前版本具有一定价值。高度成功的 YOLO11 仍然是面向各种遗留系统的一个强大且得到完全支持的模型。你可以通过阅读 RT-DETR vs YOLO11 比较来深入了解 YOLO11 的功能。此外,如果你在分析较旧的架构,查看 EfficientDet vs YOLO26 比较将为你提供关于目标检测架构取得了多大进展的出色历史背景。

最终思考#

RTDETRv2 和 YOLO26 都为 AI 领域带来了令人惊叹的进步。然而,对于优先考虑无缝迁移到生产环境、最小内存占用和广泛任务通用性的团队来说,Ultralytics YOLO26 显然是推荐之选。其无 NMS 架构、快速的 CPU 速度以及强大的 Ultralytics 生态系统支持,确保你的视觉 AI 项目具备可扩展性、高效率和面向未来的能力。无论是部署在云服务器上,还是资源受限的 Raspberry Pi 上,YOLO26 都能开箱即用地提供不妥协的性能。

评论