Ultralytics YOLO27:

YOLO26 与 RTDETRv2#

计算机视觉领域在不断发展,为从业者带来了一个关键选择:你应该采用高度优化的卷积神经网络 (CNNs),还是采用更新的基于 Transformer 的架构?这一领域的两大代表是前沿的 Ultralytics YOLO26 和百度的 RTDETRv2。这两个模型都在突破实时目标检测的边界,但依赖着截然不同的架构理念。

本指南将深入探讨这两个模型,对比它们的结构、性能指标和理想应用场景,帮助你为下一个计算机视觉项目选择最佳基础模型。

Ultralytics YOLO26:边缘优先视觉 AI 的巅峰#

YOLO26 由 Ultralytics 开发,代表了 YOLO 系列的一次重大代际飞跃。该模型于 2026 年 1 月发布,专为速度、精度以及在云端和边缘环境中的无缝部署而设计。

架构创新与优势#

YOLO26 引入了多项突破性功能,使其不仅区别于 Transformer 模型,也区别于 YOLO11 等早期版本:

  • 端到端无 NMS 设计: YOLO26 在后处理过程中消除了传统的非极大值抑制 (NMS)。这种原生端到端方法最早应用于 YOLOv10 等模型,可减少推理延迟波动并简化部署逻辑,尤其适用于边缘硬件。
  • CPU 推理速度最高提升 43%: 鉴于去中心化 AI 的需求不断增长,YOLO26 针对缺少专用 GPU 的设备进行了高度优化,例如 Raspberry Pi
  • 移除 DFL: 通过移除分布式焦点损失 (DFL),YOLO26 简化了导出流程,并显著提升了与低功耗边缘设备和微控制器的兼容性。
  • MuSGD 优化器: YOLO26 弥合了大语言模型 (LLM) 训练与计算机视觉之间的差距,采用了 MuSGD 优化器。这种结合 SGD 和 Muon 的混合优化器受 Moonshot AI 的 Kimi K2 启发,可确保稳定的训练过程并加快收敛速度。
  • ProgLoss + STAL: 高级损失函数显著提升了小目标识别能力。这对于依赖 航空影像分析 和物联网 (IoT) 传感器的行业至关重要。

跨视觉任务的多功能性#

与严格局限于边界框的模型不同,YOLO26 是一个功能多样的强大模型。它针对具体任务进行了改进,例如用于 实例分割 的语义分割损失和多尺度 proto、用于 姿态估计 的残差对数似然估计 (RLE),以及用于解决 定向边界框 (OBB) 任务边界问题的专用角度损失。

边缘部署策略

部署到边缘设备时,请使用 YOLO26n(Nano)或 YOLO26s(Small)变体。得益于 DFL 的移除和无 NMS 架构,将这些模型导出为 CoreMLTFLite 十分顺畅,可确保在 iOS 和 Android 上实现流畅的实时性能。

RTDETRv2:增强实时检测 Transformer#

RTDETRv2 由百度研究人员开发,建立在原始 RT-DETR 框架之上。它旨在证明,检测 Transformer (DETRs) 在实时场景中能够与高度优化的 CNN 竞争,有时甚至超越后者的速度和精度。

架构与能力#

RTDETRv2 采用基于 Transformer 的架构,通过利用自注意力机制理解全局上下文,从根本上以不同于 CNN 的方式处理图像。

  • 免费增益组合: v2 版本引入了一系列优化训练技术(免费增益组合),在不增加推理成本的情况下提升了基线性能。
  • 全局上下文感知: 得益于 Transformer 注意力层,RTDETRv2 天然擅长理解复杂场景,在这些场景中,全局上下文对于区分重叠或遮挡目标十分必要。

了解更多关于 RT-DETR 的信息

Transformer 模型的局限性#

虽然功能强大,但 RTDETRv2 等基于 Transformer 的检测模型在实际部署中往往面临挑战。与高效的 CNN 相比,它们通常在训练期间需要更多 CUDA 内存。此外,由于注意力层所需的操作较为复杂,将其集成到多样化的边缘环境中可能十分繁琐,这使得 YOLO26 等模型对资源受限的部署场景更具吸引力。

性能对比#

通过正面对比评估这些模型,可以直观看到最新 CNN 优化带来的优势。下表概述了它们在标准基准上的性能。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

如图所示,YOLO26 在所有尺寸变体上都持续优于 RTDETRv2。YOLO26x 以更低的延迟(TensorRT 上为 11.8 ms)和显著更少的参数量(55.7M),实现了出色的 57.5 mAP;相比之下,RTDETRv2-x 为 54.3 mAP、15.03 ms,参数量为 76M。

使用场景与建议#

在 YOLO26 和 RT-DETR 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLO26#

以下情况适合选择 YOLO26:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

何时选择 RT-DETR#

推荐在以下情况下选择 RT-DETR:

  • 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测的项目。
  • 高精度且延迟灵活的场景: 将检测精度置于首要位置,并且可以接受略高推理延迟的应用。
  • 大型目标检测: 主要包含中大型目标的场景,在这些场景中,Transformer 的全局注意力机制具有天然优势。

Ultralytics 的优势#

选择合适的机器学习架构只是问题的一部分;周边生态系统决定了团队从原型开发推进到生产部署的速度。

易用性与训练效率#

Ultralytics Python API 提供了非常简洁流畅的使用体验。训练复杂模型不再需要冗长的样板代码。此外,YOLO26 的训练效率明显更高,比 RTDETRv2 占用大量内存的注意力机制使用更少的 GPU 显存,即使在消费级硬件上也能支持更大的批量大小。

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

完善维护的生态系统#

使用 Ultralytics 模型,开发者可以获得一个持续维护的框架,并原生集成 Weights & BiasesComet ML 等现代跟踪工具。对于偏好无代码方式的用户,Ultralytics Platform 支持云端训练、数据集管理和一键部署。

性能平衡#

YOLO26 在推理速度和精度之间实现了无与伦比的平衡。移除 NMS 并结合 MuSGD 优化器,确保你部署的模型不仅在小目标上具有很高的精度(得益于 ProgLoss + STAL),还能在生产环境中实现极快的速度,因此它几乎适用于所有现代 计算机视觉应用

生态系统中的其他模型#

YOLO26 和 RTDETRv2 覆盖了实时检测的前沿领域,但维护旧版流水线或探索不同效率曲线的开发者,也可以在成熟的企业环境中考虑 YOLOv8,或探索 EfficientDet 等其他架构。不过,对于任何新项目,YOLO26 都是明确推荐的选择。

评论