Ultralytics YOLO27:
Get Started

YOLO26 与 PP-YOLOE+ 对比#

实时目标检测模型领域发展迅速。对于希望部署高效视觉 AI 模型的 ML 工程师和研究人员来说,对比 Ultralytics YOLO26 和 PP-YOLOE+ 等架构至关重要。本指南将深入分析它们的架构、训练方法、性能指标以及理想的实际部署场景。

模型起源与元数据#

了解这些计算机视觉架构的背景,有助于理解其设计理念和目标环境。

YOLO26 概述

YOLO26 于 2026 年 1 月发布,代表了 Ultralytics 生态系统的巅峰。它旨在成为首选的边缘 AI 解决方案,具有更小的模型体积、原生端到端处理能力和无与伦比的速度。

PP-YOLOE+ 概述

PP-YOLOE+ 是 PP-YOLO 系列的迭代版本,是一款无锚框检测器,针对 PaddlePaddle 生态系统进行了深度优化。它采用 CSPRepResNet 主干网络和 ET-head,以提升标准检测指标。

进一步了解 PP-YOLOE+

架构创新#

这些模型处理视觉数据的方式各不相同,这会显著影响内存需求、训练稳定性和推理延迟。

YOLO26:迈向无 NMS 的新阶段#

YOLO26 引入了多项突破性的架构改进,旨在简化模型部署:

  • 端到端无 NMS 设计:在 YOLOv10 首次提出的理念基础上,YOLO26 支持原生端到端推理,通过可选的一对一检测头(nms=False)跳过非极大值抑制 (NMS)后处理。这能减少延迟波动,并大幅简化部署流程。
  • 移除 DFL:移除分布焦点损失 (DFL) 后,模型显著变轻,可轻松导出为 TensorRT 和 CoreML 等格式。
  • MuSGD 优化器:YOLO26 从 Moonshot AI 的 Kimi K2 中汲取灵感,将 LLM 训练创新引入计算机视觉。混合型 MuSGD 优化器 (SGD + Muon) 可确保训练动态高度稳定并快速收敛。
  • ProgLoss + STAL:这些先进的损失函数显著提升了小目标识别能力,使该架构非常适用于无人机影像和农业应用。

PP-YOLOE+:以 Paddle 为核心的方法#

PP-YOLOE+ 采用无锚框范式,重点是在标准服务器硬件上实现高精度。其 RepResNet 结构增强了特征提取能力。不过,由于它高度依赖百度深度学习技术栈中的特定算子,因此,与 Ultralytics 框架相比,修改网络或将其导出以用于资源受限的边缘设备要复杂得多。

性能与指标对比#

在多样化的实际部署场景中,速度与准确率之间保持良好平衡至关重要。PP-YOLOE+ 的准确率颇具竞争力,但 YOLO26 始终能实现更理想的权衡,尤其是在评估 CPU 推理速度和较低内存占用时。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

得益于针对边缘设备的优化和 DFL 移除,YOLO26 的 CPU 推理速度最高可比前代快 43%;部署在 Raspberry Pi 或标准边缘计算单元等设备上时,其性能远超 PP-YOLOE+。

内存效率

对比模型架构时请注意,Ultralytics YOLO 模型在训练期间的内存占用远低于复杂的 Transformer 模型,因此非常适合使用消费级 GPU 快速搭建原型。

Ultralytics 生态系统的优势#

PP-YOLOE+ 虽然能力不俗,但真正的差异化优势在于开发者体验。集成式的 Ultralytics 生态系统为视觉 AI 从业者提供了无与伦比的环境。

  1. 易用性:Ultralytics 提供了简洁流畅的用户体验。简单的 Python API 抽象了数据流水线和训练循环的复杂性,并由全面且持续维护的文档提供支持。
  2. 多功能性:与主要专注于目标检测的 PP-YOLOE+ 不同,YOLO26 使用相同的 API 结构,原生支持图像分类、实例分割、姿态估计和有向边界框 (OBB)。
  3. 训练效率:自动下载现成的预训练权重,再结合先进的数据增强技术,可实现高效训练;与传统框架相比,所需 CUDA 内存更少、训练时间更短。

代码示例:简洁直观的实践#

以下有效的 Python 代码展示了如何使用 Ultralytics API 轻松启动 AI 项目:

from ultralytics import YOLO

# 加载预训练的 YOLO26 nano 模型,以获得出色的边缘端性能
model = YOLO("yolo26n.pt")

# 使用 COCO8 数据集轻松训练模型
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# 对目标图像执行无 NMS 推理
inference_results = model.predict("https://ultralytics.com/images/bus.jpg", nms=False)

# 导出为 ONNX 格式以供部署
model.export(format="onnx")

理想的实际应用#

选择 YOLO26 还是 PP-YOLOE+,很大程度上取决于生产环境的限制。

适合部署 PP-YOLOE+ 的情况:

  • 集成百度生态系统:深度依赖 PaddlePaddle 基础设施的项目,或严格要求使用百度软硬件技术栈的特定亚洲制造环境。
  • 服务端批处理:运行在企业级硬件上的场景,此时 NMS 导致的延迟抖动不太重要。

适合部署 YOLO26 的情况:

  • 边缘设备和 IoT:YOLO26 的 CPU 速度最高可提升 43%,是智能摄像头、无人机和低功耗机器人的理想选择。
  • 时间敏感型部署:可选的无 NMS 推理模式(nms=False)能提供稳定且超低延迟的推理,这对自动驾驶研究和高速制造质量控制至关重要。
  • 多任务项目:当项目需要结合目标检测、通过分割实现精准掩码,或通过姿态估计跟踪关键点时,统一的 YOLO26 框架不可或缺。

用例与建议#

选择 YOLO26 还是 PP-YOLOE+,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLO26#

以下场景适合选择 YOLO26:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

何时选择 PP-YOLOE+#

以下情况推荐使用 PP-YOLOE+:

  • 集成 PaddlePaddle 生态系统:已有基于百度 PaddlePaddle框架和工具构建基础设施的组织。
  • Paddle Lite 边缘部署:部署到专门针对 Paddle Lite 或 Paddle 推理引擎进行了高度优化的推理内核的硬件上。
  • 高精度服务端检测:在强大的 GPU 服务器上优先追求最高检测准确率,且不受框架依赖限制的场景。

探索其他架构#

如果你想了解更多不同类型的模型,我们还建议查看 YOLO11。它是 Ultralytics 模型中高度可靠的上一代产品,至今仍广泛应用于数千个生产环境。此外,对于需要基于 Transformer 的机制的场景,RT-DETR架构提供了一个值得关注的替代方案,不过训练时需要更多内存。

最终,凭借 MuSGD 优化器、ProgLoss + STAL 能力以及可选的无 NMS 推理,YOLO26 巩固了自身作为现代化、可扩展且高效的视觉 AI 解决方案首选的地位。

评论