Ultralytics YOLO27:

YOLO26 与 PP-YOLOE+ 对比#

计算机视觉领域见证了实时目标检测模型的快速发展。对于希望部署最高效视觉 AI 模型的 ML 工程师和研究人员而言,对比 Ultralytics YOLO26 与 PP-YOLOE+ 等架构至关重要。本综合指南将深入分析它们的架构、训练方法、性能指标以及理想的实际部署场景。

模型起源与元数据#

了解这些计算机视觉架构的背景,有助于理解其设计理念和目标环境。

YOLO26 概述

YOLO26 于 2026 年 1 月发布,代表了 Ultralytics 生态系统的巅峰。它旨在成为终极边缘 AI 解决方案,具备更小的占用空间、原生端到端处理能力以及无与伦比的速度。

PP-YOLOE+ 概述

PP-YOLOE+ 作为 PP-YOLO 系列的演进版本开发,是一个针对 PaddlePaddle 生态系统深度优化的无锚框检测器。它依托 CSPRepResNet 主干网络和 ET-head 来改善标准检测指标。

了解有关 PP-YOLOE+ 的更多信息

架构创新#

这些模型处理视觉数据的方式存在差异,因而会显著影响内存需求、训练稳定性和推理延迟。

YOLO26:无 NMS 的前沿架构#

YOLO26 引入了多项突破性的架构改进,旨在简化模型部署

  • 端到端无 NMS 设计: YOLO26 基于最早在 YOLOv10 中引入的理念,在原生层面消除了非极大值抑制 (NMS)后处理。这降低了延迟波动,并大幅简化了部署流程。
  • 移除 DFL: 通过移除分布式焦点损失 (DFL),模型显著变得更轻量,从而能够无缝导出为 TensorRTCoreML 等格式。
  • **MuSGD 优化器:**受到 Moonshot AI 的 Kimi K2 启发,YOLO26 将大语言模型训练创新带入了计算机视觉领域。混合 MuSGD 优化器(SGD + Muon)可确保高度稳定的训练动态和快速收敛。
  • ProgLoss + STAL: 这些先进的损失函数显著提升了小目标识别能力,使该架构非常适合无人机图像农业应用

PP-YOLOE+:以 Paddle 为中心的方法#

PP-YOLOE+ 采用无锚框范式,专注于在标准服务器硬件上实现高精度。它采用 RepResNet 结构,提升了特征提取能力。然而,由于它高度依赖 Baidu 深度学习技术栈中的特定操作,因此,与 Ultralytics 框架相比,修改网络或将其导出到资源高度受限的边缘设备上可能会复杂得多。

性能与指标对比#

对于多样化的实际部署场景而言,在速度和精度之间取得良好平衡至关重要。虽然 PP-YOLOE+ 提供了具有竞争力的精度,但 YOLO26 始终能实现更有利的权衡,尤其是在评估 CPU 推理速度和更低的内存使用量时。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

得益于针对边缘设备的特定优化和 DFL 移除,YOLO26 的 CPU 推理速度比前代产品最高提升 43%,部署在 Raspberry Pi 或标准边缘计算单元等设备上时,性能远超 PP-YOLOE+。

内存效率

比较模型架构时请注意,Ultralytics YOLO 模型在训练期间的内存使用量远低于复杂的 Transformer 模型,因此非常适合使用消费级 GPU 进行快速原型开发。

Ultralytics 生态系统优势#

虽然 PP-YOLOE+ 是一款能力出色的模型,但真正的差异化优势在于开发者体验。集成式的 Ultralytics 生态系统为视觉 AI 从业者提供了无可比拟的环境。

  1. 易用性: Ultralytics 提供了流畅的用户体验。简单的 Python API 抽象了数据流水线和训练循环的复杂性,并由丰富且持续维护的文档提供支持。
  2. 通用性: 与主要专注于目标检测的 PP-YOLOE+ 不同,YOLO26 使用相同的 API 结构,原生支持图像分类实例分割姿态估计有向边界框 (OBB)
  3. 训练效率: 自动下载现成的预训练权重,再结合先进的数据增强,相比传统框架能够以更少的 CUDA 内存和时间实现高效训练。

代码示例:简洁实践#

以下有效的 Python 代码演示了如何使用 Ultralytics API 轻松启动 AI 项目:

from ultralytics import YOLO

# Load a pre-trained YOLO26 nano model for optimal edge performance
model = YOLO("yolo26n.pt")

# Train the model effortlessly on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Perform NMS-free inference on a target image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Export to ONNX format for deployment
model.export(format="onnx")

理想的实际应用#

在 YOLO26 和 PP-YOLOE+ 之间进行选择,很大程度上取决于生产环境的限制。

适合部署 PP-YOLOE+ 的情况:

  • Baidu 生态系统集成: 深度依赖 PaddlePaddle 基础设施的项目,或严格采用 Baidu 硬件和软件技术栈的特定亚洲制造环境。
  • 服务器端批处理: 在企业级硬件上运行的场景,其中 NMS 导致的延迟抖动不太值得关注。

适合部署 YOLO26 的情况:

  • 边缘设备和 IoT: YOLO26 最高提升 43% 的 CPU 速度,使其成为智能摄像头、无人机和低功耗机器人的理想选择。
  • 时间关键型部署: 原生无 NMS 架构可确保稳定且超低延迟的推理,这对于自动驾驶研究和高速制造质量控制至关重要。
  • 多任务项目: 当项目需要结合目标检测、通过分割实现的精确掩码,或通过姿态估计实现的关键点跟踪时,统一的 YOLO26 框架不可或缺。

使用场景与建议#

在 YOLO26 和 PP-YOLOE+ 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLO26#

以下情况适合选择 YOLO26:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

何时选择 PP-YOLOE+#

以下情况推荐使用 PP-YOLOE+:

  • PaddlePaddle 生态系统集成: 已有基于 Baidu 的 PaddlePaddle 框架和工具构建的基础设施的组织。
  • Paddle Lite 边缘部署: 将模型部署到使用专为 Paddle Lite 或 Paddle 推理引擎优化的推理内核的硬件上。
  • 高精度服务器端检测: 优先考虑在强大的 GPU 服务器上实现最高检测精度,且不受框架依赖影响的场景。

探索其他架构#

对于希望探索更广泛模型的用户,我们还建议查看 YOLO11。这是 Ultralytics 高度可靠的上一代模型,至今仍广泛应用于数千个生产环境。此外,对于需要基于 Transformer 的机制的场景,RT-DETR架构提供了一个颇具吸引力的替代方案,不过其训练期间的内存需求更高。

最终,凭借 MuSGD 优化器、ProgLoss + STAL 能力以及无 NMS 设计,YOLO26 巩固了其作为现代化、可扩展且高效的视觉 AI 解决方案首选的地位。

评论