Ultralytics YOLO27:
Get Started

PP-YOLOE+ 与 YOLO26 对比#

在对可扩展、高效且精度出色的目标检测模型的需求推动下,实时计算机视觉领域取得了长足发展。该领域的两种杰出架构是来自 PaddlePaddle 生态系统的强大检测器 PP-YOLOE+,以及重新定义边缘部署和训练效率的最新先进模型 Ultralytics YOLO26。

本指南将全面比较这两种模型,重点介绍它们的架构、性能指标、训练方法和理想使用场景,帮助你为下一个 AI 项目做出明智决策。

技术规格与作者信息#

了解这些模型的起源和设计理念,有助于深入理解它们在现实场景中的应用。

PP-YOLOE+ 详情:

详细了解 PP-YOLOE+

YOLO26 详情:

架构创新#

PP-YOLOE+ 架构#

PP-YOLOE+ 基于前代 PP-YOLOv2 构建,采用专为工业应用量身打造的稳健设计。它利用 CSPRepResNet 主干网络和 ET-head(高效任务对齐头),兼顾速度与精度。PP-YOLOE+ 使用动态标签分配 (TAL),并与百度的 PaddlePaddle 框架无缝集成,因此针对 T4 和 V100 等 NVIDIA GPU 进行了高度优化。不过,对于深度使用 PyTorch 工作流的开发者而言,它对 PaddlePaddle 生态系统的高度依赖可能带来不便。

YOLO26 架构:边缘优先的变革#

Ultralytics YOLO26 于 2026 年初发布,彻底重新构想了实时检测流程,尤其注重简化部署并提升边缘端效率。

YOLO26 的主要创新包括:

  • 端到端无 NMS 设计:YOLO26 支持原生端到端推理(nms=False),无需进行非极大值抑制 (NMS) 后处理。这项突破最初由 YOLOv10 首创,可确保推理延迟不受场景拥挤程度影响,让部署变得简单得多。
  • 移除 DFL:通过移除分布焦点损失 (DFL),YOLO26 大幅简化了输出头,从而显著提升了对边缘设备和微控制器的兼容性。
  • CPU 推理速度最高提升 43%:得益于移除 DFL 和结构优化,YOLO26 针对没有专用 GPU 的环境进行了深度优化;与 YOLO11 相比,其 CPU 推理速度最高提升 43%。
  • MuSGD 优化器:受 Moonshot AI 等机构先进 LLM 训练技术的启发,YOLO26 引入了 SGD 与 Muon 的混合方案,为计算机视觉任务带来出色的训练稳定性和更快的收敛速度。
  • ProgLoss + STAL:先进的损失函数专门针对并提升小目标识别能力,这对无人机作业和 IoT 边缘传感器至关重要。
YOLO26 在各类任务上的专项改进

除标准边界框外,YOLO26 还针对所有视觉任务进行了专项升级:通过语义分割损失和多尺度原型方法处理分割,通过残差对数似然估计 (RLE) 处理姿态估计,并通过专用角度损失解决有向边界框 (OBB)检测中的边界问题。

性能与指标#

下表全面展示了不同模型规模下 PP-YOLOE+ 与 YOLO26 的对比。YOLO26 模型在原始速度、参数效率和整体平均精度均值 (mAP)方面均明显占优。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

注:粗体数值表示同等规模模型对中表现更好的指标。

分析#

  • 内存需求与效率:YOLO26 只需更少的参数和 FLOPs,就能取得更高的 mAP 分数。例如,YOLO26n(Nano)模型仅有 2.4M 个参数,mAP 就达到 40.9,表现超过 PP-YOLOE+t,体积却约为其一半。这意味着训练和部署期间的内存占用都更低。
  • 推理速度:使用 TensorRT 导出后,YOLO26 在延迟指标上表现出色。无 NMS 的一对一输出头(nms=False,用于这些基准测试)确保 T4 GPU 上 1.7ms 的推理时间始终稳定,而 PP-YOLOE+ 的后处理耗时则可能有所波动。

Ultralytics 的优势:生态与易用性#

原始指标固然重要,但开发者体验往往决定项目成败。维护完善的 Ultralytics Platform 生态系统远胜于旧式框架。

  1. 易用性:Ultralytics 抽象掉了复杂的样板代码。只需几行 Python 代码即可训练 YOLO26,无需像 PP-YOLOE+ 那样编写繁杂的配置文件。
  2. 多功能性:PP-YOLOE+ 主要是一种目标检测架构。YOLO26 开箱即支持分割、分类、姿态估计和 OBB。
  3. 训练效率:与 RT-DETR 等大型 Transformer 模型或旧架构相比,Ultralytics YOLO 模型所需的 CUDA 内存要少得多,研究人员因此能够在消费级硬件上训练先进模型。
其他 Ultralytics 模型

YOLO26 代表了当前研究的巅峰,但 Ultralytics 生态系统也包含 YOLO11 和 YOLOv8。这两款模型依然实力强劲、社区支持广泛,非常适合从旧式遗留系统迁移过来的用户。

代码示例:训练 YOLO26#

Ultralytics 的上手过程非常简单。下面是一个可直接运行的示例,展示如何加载、训练和验证 YOLO26 模型:

from ultralytics import YOLO

# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset using the new MuSGD optimizer
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    batch=16,
    optimizer="MuSGD",  # hybrid SGD + Muon optimizer
)

# Export seamlessly to ONNX for CPU deployment
export_path = model.export(format="onnx")
print(f"Model successfully exported to: {export_path}")

理想应用场景#

何时选择 PP-YOLOE+#

  • 旧版 PaddlePaddle 基础设施:如果企业已经深度融入百度技术栈,并且使用为 Paddle Inference 预先配置的硬件,那么 PP-YOLOE+ 是一个安全、稳定的选择。
  • 亚洲制造业中心:亚洲许多工业视觉流程在自动化缺陷检测中,已经为 PP-YOLOE+ 建立了完善的现有支持。

何时选择 YOLO26#

  • 边缘计算与 IoT:CPU 推理速度提升 43% 且移除了 DFL,使 YOLO26 成为在 Raspberry Pi、手机和嵌入式设备上部署的最佳选择。
  • 拥挤场景与智慧城市: 端到端无 NMS 架构可确保密集环境中的延迟稳定,例如停车管理和交通监控场景,在这些场景中,传统 NMS 会造成瓶颈。
  • 多任务项目:如果你的流程需要跟踪目标、估计人体姿态或生成像素级精准的掩码,YOLO26 都能在一个统一的 Python 软件包中完成这些任务。

结论#

虽然 PP-YOLOE+ 在其特定生态系统中仍是一款实力强劲的检测器,但 YOLO26 的发布改变了行业格局。Ultralytics 将受 LLM 启发的训练优化(MuSGD)与持续优化的无 NMS 架构结合,打造出兼具高精度和易部署特性的模型。对于希望在速度、精度和开发者体验之间取得最佳平衡的现代开发者而言,YOLO26 是明确之选。

评论