Ultralytics YOLO27:

PP-YOLOE+ vs YOLO26#

实时计算机视觉领域近年来取得了巨大发展,这得益于对可扩展、高效且高精度目标检测模型的需求。该领域中有两种表现突出的架构:来自 PaddlePaddle 生态系统 的强大检测器 PP-YOLOE+,以及重新定义边缘部署和训练效率的最新最先进模型 Ultralytics YOLO26

本综合指南将比较这两个模型,重点介绍它们的架构、性能指标、训练方法和理想使用场景,帮助你为下一个 AI 项目做出明智决策。

技术规格与作者信息#

了解这些模型的起源和设计理念,有助于深入理解它们在实际应用中的表现。

PP-YOLOE+ 详情:

了解有关 PP-YOLOE+ 的更多信息

YOLO26 详情:

架构创新#

PP-YOLOE+ 架构#

PP-YOLOE+ 基于其前代模型 PP-YOLOv2 构建,引入了针对工业应用的稳健设计。它采用 CSPRepResNet 主干网络和 ET-head(高效任务对齐头),在速度与精度之间实现平衡。PP-YOLOE+ 使用动态标签分配(TAL),并与百度的 PaddlePaddle 框架无缝集成,因此针对 T4 和 V100 等 NVIDIA GPU 进行了高度优化。不过,对于深度使用 PyTorch 工作流的开发者来说,它对 PaddlePaddle 生态系统的高度依赖可能会带来适配障碍。

YOLO26 架构:边缘优先的变革#

Ultralytics YOLO26 于 2026 年初发布,彻底重新构想了实时检测流程,极大强调部署简便性和边缘效率。

YOLO26 的主要创新包括:

  • 端到端无 NMS 设计: YOLO26 原生支持端到端处理,完全消除了非极大值抑制(NMS)后处理的需求。这项突破最先由 YOLOv10 开创,无论场景拥挤程度如何,都能确保推理延迟稳定一致,从而显著简化部署。
  • 移除 DFL: 通过移除分布焦点损失(DFL),YOLO26 大幅简化了输出头。这使其与边缘设备和微控制器的兼容性显著提升。
  • CPU 推理速度最高提升 43%: 得益于移除 DFL 和结构优化,YOLO26 针对无专用 GPU 的环境进行了高度优化。与 YOLO11 相比,其在 CPU 上的推理速度最高提升 43%。
  • MuSGD 优化器: YOLO26 借鉴了 Moonshot AI 等机构采用的先进 LLM 训练技术,引入了 SGD 与 Muon 的混合优化器,为计算机视觉任务带来前所未有的训练稳定性和更快的收敛速度。
  • ProgLoss + STAL: 专门设计的先进损失函数针对小目标识别进行了优化和提升,这对于无人机作业和 IoT 边缘传感器至关重要。
YOLO26 中针对任务的改进

除了标准边界框之外,YOLO26 还针对所有视觉任务引入了专项升级。它在分割任务中采用语义分割损失和多尺度原型设计,在姿态估计任务中采用残差对数似然估计(RLE),并通过专用角度损失解决有向边界框(OBB)检测中的边界问题。

性能与指标#

下表全面展示了 PP-YOLOE+ 与 YOLO26 在各种模型尺寸下的对比。YOLO26 模型在原始速度、参数效率和整体平均精度均值(mAP)方面都明显占优。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

注:粗体数值表示所有模型中表现最佳的指标。

分析#

  • 内存需求和效率: YOLO26 只需更少的参数量和 FLOPs,便可获得更高的 mAP 分数。例如,YOLO26n(Nano)模型仅使用 2.4M 个参数就达到了 40.9 mAP,性能超过 PP-YOLOE+t,而模型大小约为后者的一半。这意味着在训练和部署期间都能降低内存使用量。
  • 推理速度: 使用 TensorRT 导出后,YOLO26 在延迟指标方面占据明显优势。移除 NMS 后,T4 GPU 上 1.7ms 的推理时间能够保持稳定,而 PP-YOLOE+ 依赖的后处理时间可能有所波动。

Ultralytics 的优势:生态系统与易用性#

虽然原始指标很重要,但开发者体验往往决定项目成败。Ultralytics 平台 提供了维护良好的生态系统,整体表现远超旧式框架。

  1. 易用性: Ultralytics 抽象掉了复杂的样板代码。使用 YOLO26 训练只需几行 Python 代码,无需像 PP-YOLOE+ 那样编写复杂的配置文件。
  2. 多样性: PP-YOLOE+ 主要是一种目标检测架构。YOLO26 开箱即用地支持分割、分类、姿态估计和 OBB。
  3. 训练效率:RT-DETR 等体量较大的 Transformer 模型或旧式架构相比,Ultralytics YOLO 模型所需的 CUDA 内存大幅减少,使研究人员能够在消费级硬件上训练最先进的模型。
其他 Ultralytics 模型

虽然 YOLO26 代表了当前研究的巅峰,但 Ultralytics 生态系统中还包含 YOLO11YOLOv8。这两个模型依然功能强大,拥有庞大的社区支持,非常适合从旧版遗留系统迁移的用户。

代码示例:训练 YOLO26#

开始使用 Ultralytics 非常简单。下面是一个完全可运行的示例,演示如何加载、训练和验证 YOLO26 模型:

from ultralytics import YOLO

# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset using the new MuSGD optimizer
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    batch=16,
    optimizer="auto",  # MuSGD is automatically engaged for YOLO26
)

# Export seamlessly to ONNX for CPU deployment
export_path = model.export(format="onnx")
print(f"Model successfully exported to: {export_path}")

理想应用场景#

何时选择 PP-YOLOE+#

  • 旧版 PaddlePaddle 基础设施: 如果企业已经深度嵌入百度技术栈,并使用了为 Paddle Inference 预配置的硬件,那么 PP-YOLOE+ 是一个安全且稳定的选择。
  • 亚洲制造业中心: 亚洲许多工业视觉流程在自动化缺陷检测中都已具备对 PP-YOLOE+ 的成熟、现成支持。

何时选择 YOLO26#

  • 边缘计算和 IoT: 快 43% 的 CPU 推理速度和 DFL 移除特性,使 YOLO26 成为部署在 Raspberry Pi、手机和嵌入式设备上的无可争议首选。
  • 拥挤场景和智慧城市: 端到端无 NMS 架构可确保在停车管理和交通监控等密集环境中保持稳定延迟,而传统 NMS 可能在这些场景中造成瓶颈。
  • 多任务项目: 如果你的流程需要跟踪目标、估计人体姿态或生成像素级精确的掩码,YOLO26 都能在一个统一的 Python 软件包中完成。

结论#

虽然 PP-YOLOE+ 在其特定生态系统中仍然是功能强大的检测器,但 YOLO26 的发布已经改变了这一范式。Ultralytics 将受 LLM 启发的训练优化(MuSGD)与持续优化的无 NMS 架构相结合,打造出兼具高精度与轻松部署能力的模型。对于希望在速度、精度和开发者体验之间取得最佳平衡的现代开发者而言,YOLO26 是明确之选。

评论