Ultralytics YOLO27:

YOLOv10 与 RTDETRv2#

计算机视觉领域发展迅猛,新架构不断重新定义实时目标检测的技术水平。在这一演进过程中,YOLOv10 和 RTDETRv2 是两个重要里程碑。这两个模型都旨在通过消除非极大值抑制(NMS)后处理需求,解决传统检测流程中的一个根本瓶颈,但它们采用了截然不同的架构范式来应对这一挑战。

这篇技术对比将深入分析它们的架构、训练方法和理想部署场景,帮助开发者和研究人员为下一个视觉 AI项目选择合适的工具。

YOLOv10:NMS-free 先驱#

YOLOv10 由清华大学的研究人员开发,高度关注架构效率以及后处理瓶颈的消除。通过引入用于 NMS-free 训练的一致性双重分配,它在显著降低推理延迟的同时实现了具有竞争力的性能。

技术规格#

架构与方法#

YOLOv10 的主要突破在于其以效率和精度为核心的整体模型设计。它从这两个角度优化了各个组件,大幅降低了计算开销。一致性双重分配策略使模型无需依赖 NMS 即可训练,从而实现精简的端到端部署流程。在将模型导出为 ONNXTensorRT 等边缘设备格式时,这一点尤其有益,因为后处理操作可能会引入不可预期的延迟。

优势与劣势#

该模型在速度与精度之间实现了出色的权衡,尤其是在较小的变体(N 和 S)中。其极低的延迟使其非常适合高速边缘环境。不过,尽管 YOLOv10 在原始检测速度方面表现出色,但它仍然是一个专用于目标检测的模型。需要实例分割姿态估计的团队则需要考虑功能更全面的框架。

了解更多关于 YOLOv10 的信息

RTDETRv2:改进检测 Transformer#

RTDETRv2 在原始实时检测 Transformer 的基础上,引入了一系列“免费技巧”来改进基线性能,展示了 Transformer 在实时场景中与 CNN 竞争的能力。

技术规格#

架构与方法#

RTDETRv2 采用混合架构,将用于视觉特征提取的卷积神经网络(CNN)骨干网络与用于全面场景理解的 Transformer 编码器-解码器相结合。Transformer 的自注意力机制使模型能够从全局视角观察图像,因此在处理复杂场景、重叠目标和密集人群方面非常有效。

优势与劣势#

Transformer 架构能够提供出色的精度,尤其是在参数规模较大时,并且无需 NMS 即可原生输出最终检测结果。但这也带来了代价。与纯 CNN 架构相比,Transformer 模型通常在训练期间需要多得多的 CUDA 内存,并且收敛速度可能更慢。尽管 RTDETRv2 提升了推理速度,但其总体内存消耗通常高于轻量级 YOLO 变体。

了解更多关于 RTDETRv2 的信息

性能对比#

评估性能指标可以更清晰地展现每个模型的优势所在。下表突出展示了它们在 COCO 数据集上的能力:

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

分析数据可以发现,在相近规模下,YOLOv10 在参数效率和 TensorRT 推理速度方面始终占据明显优势。RTDETRv2-x 的精度可与庞大的 YOLOv10x 相匹敌,但需要多出近 2000 万个参数,并且 FLOPs 显著更高。

使用场景与建议#

在 YOLOv10 和 RT-DETR 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv10#

YOLOv10 适合:

  • 无 NMS 实时检测: 适用于能够从无需非极大值抑制的端到端检测中受益的应用,可降低部署复杂性。
  • 速度与准确率的平衡: 适用于需要在各种模型规模之间实现推理速度和检测准确率良好平衡的项目。
  • 延迟稳定的应用: 适用于推理时间可预测至关重要的部署场景,例如机器人技术或自主系统。

何时选择 RT-DETR#

推荐在以下情况下选择 RT-DETR:

  • 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测的项目。
  • 高精度且延迟灵活的场景: 将检测精度置于首要位置,并且可以接受略高推理延迟的应用。
  • 大型目标检测: 主要包含中大型目标的场景,在这些场景中,Transformer 的全局注意力机制具有天然优势。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26 在性能和开发者体验之间提供了最佳组合:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

Ultralytics 的优势:生态系统与创新#

虽然 YOLOv10 和 RTDETRv2 都提供了强大的检测能力,但模型选择往往还取决于周边的软件生态系统。Ultralytics 平台提供了无缝统一的界面,将深度学习的复杂性隐藏在后台。

新标准:Ultralytics YOLO26#

对于追求极致性能的开发者而言,Ultralytics YOLO26代表了近期架构创新的集大成之作。YOLO26 于 2026 年初发布,继承了由 YOLOv10 开创的 端到端 NMS-free 设计,完全消除 NMS 后处理,从而实现更快、更简单的部署。

为什么选择 YOLO26?

YOLO26 通过 MuSGD 优化器(SGD 与 Muon 的混合体)将 LLM 训练创新引入计算机视觉,从而实现更稳定的训练和更快的收敛。它还具备最高 快 43% 的 CPU 推理速度,使其成为边缘计算的首选。

此外,YOLO26 引入了 ProgLoss + STAL,显著提升小目标识别能力;不同于专用的 YOLOv10,它还具备极强的通用性。它原生支持目标检测、分割、姿态和定向边界框(OBB),并针对具体任务进行了改进,例如语义分割损失和用于姿态估计的残差对数似然估计(RLE)。此外,移除分布式焦点损失(DFL)还能简化导出,并提升对低功耗设备的兼容性。

易用性与训练效率#

无论你是在尝试Ultralytics YOLO11等较早一代模型,还是尖端的 YOLO26,精简的 Python API 都能确保训练期间更低的内存使用量和极快的工作流。

from ultralytics import RTDETR, YOLO

# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

维护完善的生态系统提供了便捷的超参数调优工具,并能与各种跟踪解决方案和模型部署选项无缝集成。

结论#

YOLOv10 和 RTDETRv2 都代表了实现 NMS-free 目标检测过程中具有重要意义的里程碑。RTDETRv2 证明了 Transformer 能够在满足实时延迟要求的同时实现出色的全局上下文理解,但需要更高的内存。YOLOv10 则提供了一种高效、快速的 CNN 替代方案,专为资源受限的检测任务而设计。

不过,对于追求均衡性能、多任务通用性和最成熟生态系统的开发者,我们强烈建议采用 Ultralytics YOLO26。它将前代模型的架构创新与强大、易用的工具相结合,让视觉 AI 的部署变得顺畅自然。

评论