YOLO Vision 2026:

YOLO26 与 RTDETRv2#

计算机视觉领域在不断发展,这给从业者提出了一个关键选择:你应该利用高度优化的卷积神经网络(CNN),还是采用更新的基于 Transformer 的架构?这一领域中的两个杰出竞争者是尖端的 Ultralytics YOLO26 和百度的 RTDETRv2。这两种模型都突破了实时目标检测的界限,但它们依赖于根本不同的架构理念。

本指南深入探讨了这两种模型,通过对比它们的结构、性能指标和理想使用场景,帮助你为下一个计算机视觉项目选择最合适的基础模型。

Ultralytics YOLO26:边缘优先视觉 AI 的巅峰#

由 Ultralytics 开发的 YOLO26 代表了 YOLO 家族的一次巨大代际飞跃。它于 2026 年 1 月发布,专为云端和边缘环境下的速度、精度和无缝部署而设计。

架构创新与优势#

YOLO26 引入了几项突破性的功能,使其不仅与 Transformer 模型区分开来,而且与像 YOLO11 这样的早期版本也有所不同:

  • 端到端无 NMS 设计: YOLO26 在后处理过程中消除了传统的非极大值抑制(NMS)。这种原生的端到端方法在 YOLOv10 等模型中率先采用,减少了推理延迟方差并简化了部署逻辑,特别是在边缘硬件上。
  • CPU 推理速度提升高达 43%: 鉴于对去中心化 AI 的需求不断增长,YOLO26 针对缺乏专用 GPU 的设备(例如 Raspberry Pi)进行了高度优化。
  • 移除 DFL: 通过剔除分布焦点损失(DFL),YOLO26 提供了更简化的导出流程,并极大提升了与低功耗边缘设备和微控制器的兼容性。
  • MuSGD 优化器: 为了弥合大语言模型(LLM)训练与计算机视觉之间的差距,YOLO26 采用了 MuSGD 优化器。该优化器结合了 SGD 和 Muon——灵感来源于月之暗面(Moonshot AI)的 Kimi K2——确保了训练的稳健性及更快的收敛速度。
  • ProgLoss + STAL: 先进的损失函数为小目标识别带来了显著改进。这对于依赖航空影像分析和物联网(IoT)传感器的行业至关重要。

了解更多关于 YOLO26 的信息

跨视觉任务的通用性#

与仅限于边界框的模型不同,YOLO26 是一个多功能的强大工具。它融合了针对特定任务的改进,例如用于实例分割的语义分割损失和多尺度原语(proto)、用于姿态估计的残差对数似然估计(RLE),以及用于解决定向边界框(OBB)任务中边界问题的专用角度损失。

边缘部署策略

在部署到边缘设备时,请利用 YOLO26n(Nano)或 YOLO26s(Small)变体。由于消除了 DFL 并采用了无 NMS 架构,将这些模型导出到 CoreMLTFLite 变得轻而易举,从而保证了在 iOS 和 Android 上的流畅实时性能。

RTDETRv2:增强实时检测 Transformer#

RTDETRv2 由百度研究人员开发,基于原有的 RT-DETR 框架构建。它旨在证明在实时场景中,检测 Transformer(DETRs)能够与经过高度优化的 CNN 竞争,有时甚至在速度和精度上超越它们。

架构与功能#

RTDETRv2 采用基于 Transformer 的架构,通过利用自注意力机制理解全局上下文,其处理图像的方式与 CNN 本质上不同。

  • Bag-of-Freebies: v2 版本引入了一系列优化的训练技术(bag-of-freebies),在不增加推理成本的情况下提高了基线性能。
  • 全局上下文感知: 由于具备 Transformer 注意力层,RTDETRv2 天生擅长理解那些需要全局上下文来区分重叠或遮挡对象的复杂场景。

了解更多关于 RTDETR 的信息

Transformer 模型的局限性#

尽管功能强大,但像 RTDETRv2 这样的基于 Transformer 的检测模型在实际部署中往往面临挑战。与高效的 CNN 相比,它们通常在训练期间需要更高的 CUDA 内存。此外,由于注意力层需要复杂的操作,将其集成到多样化的边缘环境中可能会很麻烦,这使得 YOLO26 这样在资源受限的环境下部署的模型更具吸引力。

性能比较#

对这些模型进行直接对比揭示了最新 CNN 优化带来的实际优势。下表概述了它们在标准基准测试中的表现。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
参数量
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

事实证明,YOLO26 在所有尺寸版本中均持续优于 RTDETRv2。YOLO26x 实现了 57.5 的 mAP,同时具备更低的延迟(在 TensorRT 上为 11.8 ms)和远少于 RTDETRv2-x(54.3 mAP,15.03 ms,76M 参数)的参数量(55.7M)。

应用场景与建议#

在 YOLO26 和 RT-DETR 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLO26#

YOLO26 是以下场景的有力选择:

  • 无 NMS 的边缘部署: 需要一致、低延迟推理且无需复杂非极大值抑制后处理的应用。
  • 仅 CPU 环境: 没有专用 GPU 加速的设备,YOLO26 带来的高达 43% 的 CPU 推理提速可提供决定性优势。
  • 小目标检测: 诸如航拍无人机图像或物联网传感器分析等具有挑战性的场景,其中 ProgLoss 和 STAL 显著提高了微小目标的准确率。

何时选择 RT-DETR#

推荐使用 RT-DETR 的场景为:

  • 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构以实现无 NMS 的端到端目标检测的项目。
  • 高精度、延迟要求宽松的场景: 将检测精度置于首位,且可以容忍稍高推理延迟的应用。
  • 大目标检测: 以中大型目标为主的场景,在这种场景下,Transformer 的全局注意力机制具有天然优势。

Ultralytics 的优势#

选择正确的机器学习架构只是成功的一部分;周围的生态系统决定了团队从原型开发到生产环境推进的速度。

易用性与训练效率#

Ultralytics Python API 提供了非常简化的体验。训练复杂模型不再需要冗长的样板代码。此外,YOLO26 的训练效率要好得多,它比内存密集型的 RTDETRv2 注意力机制消耗少得多的 GPU 显存,从而甚至在消费级硬件上也能实现更大的批大小。

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

完善的生态系统#

通过利用 Ultralytics 模型,开发者可以访问一个积极维护的框架,该框架与现代跟踪工具(如 Weights & BiasesComet ML)原生集成。对于喜欢无代码方法的开发者,Ultralytics 平台可促进云端训练、数据集管理和一键部署。

性能平衡#

YOLO26 在推理速度和准确率之间取得了无与伦比的平衡。NMS 的移除与 MuSGD 优化的结合确保了你部署的模型既在小目标上具有极高的准确率(多亏了 ProgLoss + STAL),又在生产环境中速度极快,这使其成为几乎所有现代计算机视觉应用的绝佳选择。

生态系统中的其他模型#

虽然 YOLO26 和 RTDETRv2 涵盖了实时检测的最前沿,但维护传统管道或探索不同效率曲线的开发者也可以考虑为成熟的企业环境使用 YOLOv8,或者探索其他架构,如 EfficientDet。然而,对于任何新的计划,YOLO26 都是明确的推荐。

评论