YOLOv10 与 RTDETRv2 对比#
计算机视觉领域正以惊人的速度发展,新的架构不断重新定义实时目标检测的SOTA(行业最高水平)。这一演进过程中的两个重要里程碑是 YOLOv10 和 RTDETRv2。这两个模型都旨在通过消除对非极大值抑制(NMS)后处理的需求来解决传统检测流水线中的根本瓶颈,但它们从完全不同的架构范式来应对这一挑战。
本技术对比深入分析了它们的架构、训练方法和理想部署场景,以帮助开发者和研究人员为他们的下一个视觉 AI 项目选择合适的工具。
YOLOv10:无 NMS 先驱#
YOLOv10 由清华大学的研究人员开发,重点关注架构效率和消除后处理瓶颈。通过引入用于无 NMS 训练的一致性双重分配策略,它在显著降低推理延迟的同时实现了极具竞争力的性能。
技术规格#
- 作者:Ao Wang, Hui Chen, Lihao Liu 等。
- 机构:Tsinghua University
- 日期:2024-05-23
- ArXiv:YOLOv10 论文
- GitHub:THU-MIG/yolov10
- 文档:YOLOv10 文档
架构与方法#
YOLOv10 的主要突破在于其整体的效率与准确率驱动的模型设计。它从这两个角度优化了各个组件,大大减少了计算开销。一致的双重分配策略使模型能够在不依赖 NMS 的情况下进行训练,从而实现流线型的端到端部署流水线。在将模型导出到 ONNX 或 TensorRT 等边缘格式时,这一点尤其有利,因为后处理操作可能会引入意料之外的延迟。
优势与不足#
该模型拥有出色的速度与准确率权衡,特别是在较小的变体(N 和 S)中。其极低的延迟使其成为高速边缘环境的理想选择。然而,尽管 YOLOv10 在原始检测速度方面表现出色,但它仍然是一个专门的纯检测模型。需要实例分割或姿态估计的团队需要寻找更多功能的框架。
RTDETRv2:完善检测 Transformer#
RTDETRv2 基于最初的实时检测 Transformer 构建,融入了一系列“免费午餐”技巧(bag of freebies)来改进其基准,展示了 Transformer 可以在实时场景中与 CNN 竞争。
技术规格#
- 作者:Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang 以及 Yi Liu
- 组织:Baidu
- 日期:2024-07-24
- ArXiv:RTDETRv2 论文
- GitHub:lyuwenyu/RT-DETR
- 文档:RTDETRv2 文档
架构与方法#
RTDETRv2 采用了混合架构,结合了用于视觉特征提取的卷积神经网络(CNN)主干和用于全面场景理解的 Transformer 编码器-解码器。Transformer 的自注意力机制允许模型从全局视角观察图像,使其在处理复杂场景、重叠对象和密集人群时非常有效。
优势与不足#
Transformer 架构提供了出色的准确性,尤其是在较大的参数规模上,并且无需 NMS 即可原生输出最终检测结果。然而,这是有代价的。Transformer 模型在训练过程中通常需要更多的 CUDA 显存,并且与纯 CNN 架构相比收敛速度可能较慢。虽然 RTDETRv2 提高了推理速度,但它通常比轻量级的 YOLO 变体消耗更多的内存。
性能比较#
评估性能指标可以更清晰地了解每个模型的优势所在。下表重点介绍了它们在 COCO 数据集上的能力:
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
分析数据时,YOLOv10 在参数效率和 TensorRT 推理速度方面保持着显著优势(在相当规模下)。RTDETRv2-x 在精度上与庞大的 YOLOv10x 相当,但需要多出近 2000 万个参数,并且 FLOPs(浮点运算次数)也显著更高。
应用场景与建议#
在 YOLOv10 和 RT-DETR 之间进行选择,取决于你的具体项目需求、部署约束和生态系统偏好。
何时选择 YOLOv10#
YOLOv10 是以下情况的有力选择:
- 无需 NMS 的实时检测: 得益于无需非极大值抑制(Non-Maximum Suppression)的端到端检测,能够降低部署复杂性的应用。
- 平衡的速度与精度权衡: 需要在推理速度和检测精度之间取得良好平衡的各类项目,适用于多种模型规模。
- 一致延迟的应用: 预测推理时间至关重要的部署场景,例如机器人技术或自主系统。
何时选择 RT-DETR#
推荐使用 RT-DETR 的场景为:
- 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构以实现无 NMS 的端到端目标检测的项目。
- 高精度、延迟要求宽松的场景: 将检测精度置于首位,且可以容忍稍高推理延迟的应用。
- 大目标检测: 以中大型目标为主的场景,在这种场景下,Transformer 的全局注意力机制具有天然优势。
何时选择 Ultralytics (YOLO26)#
对于大多数新项目,Ultralytics YOLO26 提供了性能与开发者体验的最佳结合:
- 无 NMS 的边缘部署: 需要一致、低延迟推理且无需复杂非极大值抑制后处理的应用。
- 仅 CPU 环境: 没有专用 GPU 加速的设备,YOLO26 带来的高达 43% 的 CPU 推理提速可提供决定性优势。
- 小目标检测: 诸如航拍无人机图像或物联网传感器分析等具有挑战性的场景,其中 ProgLoss 和 STAL 显著提高了微小目标的准确率。
Ultralytics 的优势:生态系统与创新#
虽然 YOLOv10 和 RTDETRv2 提供了强健的检测能力,但选择模型往往取决于周围的软件生态系统。Ultralytics 平台提供了一个无缝、统一的接口,抽象掉了深度学习的复杂性。
新标准:Ultralytics YOLO26#
对于追求极致性能的开发者来说,Ultralytics YOLO26 代表了近期架构进步的结晶。YOLO26 发布于 2026 年初,继承了由 YOLOv10 开创的端到端免 NMS 设计,完全消除了 NMS 后处理,从而实现更快、更简单的部署。
YOLO26 通过 MuSGD 优化器(SGD 和 Muon 的混合体)将大语言模型(LLM)训练创新引入计算机视觉,从而实现更稳定的训练和更快的收敛。它还拥有高达 43% 的 CPU 推理速度提升,使其成为边缘计算的首选。
此外,YOLO26 引入了 ProgLoss + STAL,显着提升了小目标识别能力,并且与专用的 YOLOv10 不同,它提供了极高的多功能性。它原生支持目标检测、分割、姿态以及定向边界框 (OBB),并具有针对特定任务的改进,例如用于语义分割的损失函数以及用于姿态估计的残差对数似然估计 (RLE)。此外,去除了分布式焦点损失 (DFL) 确保了简化的导出和更好的低功耗设备兼容性。
易用性与训练效率#
无论你是在试验诸如 Ultralytics YOLO11 这样旧一代的模型还是前沿的 YOLO26,精简的 Python API 都能确保训练期间更低的内存占用以及极快的工序流程。
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")这个维护良好的生态系统提供了用于轻松进行超参数调优的工具,并与广泛的跟踪解决方案和模型部署选项进行了完美集成。
结论#
YOLOv10 和 RTDETRv2 都代表了追求无 NMS 目标检测过程中的巨大里程碑。RTDETRv2 证明了 Transformer 可以在具备出色的全局上下文理解能力的同时实现实时延迟,尽管对内存的要求更高。YOLOv10 提供了一种高效、快速的 CNN 替代方案,专为资源受限的检测任务量身定制。
然而,为了获得均衡的性能、多任务通用性和最成熟的生态系统,强烈建议开发者利用 Ultralytics YOLO26。它完美结合了其前身的架构创新与稳健、用户友好的工具,使部署视觉 AI 成为无缝的现实。