Ultralytics YOLO27:
Get Started

PP-YOLOE+ 与 YOLOX 对比#

计算机视觉领域的发展深受目标检测模型快速演进的影响。在这一进程中的重要里程碑包括 PP-YOLOE+ 和 YOLOX,这两种架构都拓展了实时性能和准确率的能力边界。对于构建新一代视觉识别系统的研究人员和开发者来说,了解它们的架构特点、性能权衡和理想部署场景至关重要。

模型渊源与详情#

在深入探讨技术架构之前,了解这两款模型的起源很有帮助。它们各自的开发都是为了应对目标检测中的特定瓶颈,并深受其背后组织的影响。

PP-YOLOE+ 详情:

进一步了解 PP-YOLOE+

YOLOX 详情:

详细了解 YOLOX

架构创新#

这两款检测器的核心区别在于特征提取和边界框预测方式。

YOLOX 于 2021 年取得突破,成功让 YOLO 系列采用了无锚框设计。通过移除锚框,YOLOX 大幅减少了设计参数和为自定义数据集进行启发式调优的需求。此外,它引入了一个解耦头,将分类和定位任务分为不同的神经网络路径。这种分离解决了物体分类与空间坐标回归之间固有的冲突,从而加快了训练收敛速度。

百度开发的 PP-YOLOE+ 针对 PaddlePaddle 生态系统进行了大量优化。它在 PP-YOLOE 和 PP-YOLOv2 的基础上,引入了动态标签分配策略(TAL)和名为 CSPRepResNet 的新型主干网络。该主干网络采用结构重参数化,让模型在训练时受益于复杂的多分支架构,同时在推理时可无缝折叠为快速的单路径网络。

结构重参数化

结构重参数化允许模型通过多个并行分支进行训练(改善梯度流动),然后在部署时通过数学变换将这些分支合并为单个卷积层,从而在不损失准确率的情况下提升推理速度。

性能与指标对比#

直接比较这两款模型后可以发现,它们针对的性能区间略有不同。PP-YOLOE+ 通常能达到更高的绝对准确率,而 YOLOX 擅长提供极轻量级变体,适合硬件资源非常受限的场景。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

注意:每个相关列区段中的最佳结果值以 粗体 标出。

YOLOX 提供的 nano 和 tiny 变体几乎不占用磁盘空间或 CUDA 内存;PP-YOLOE+ 则能很好地扩展到服务器级硬件,因此对于百度生态系统中的重型工业应用来说是一个稳健的选择。

实际应用#

在这两种框架之间做出选择,通常取决于集成需求和硬件目标。

YOLOX 的优势领域#

凭借无锚框特性和极小型边缘变体,YOLOX 在机器人技术和微控制器部署领域颇受欢迎。它的后处理流程简单,因此更容易移植到自定义 NPU 硬件格式,例如 TensorRT 和 NCNN。

PP-YOLOE+ 的优势领域#

对于深度融入百度技术栈的亚洲制造业组织来说,PP-YOLOE+ 提供了预先优化的部署路径。它适用于在高性能服务器集群上运行的高精度质量检测场景;这类场景对严格实时性的要求不高,因此可以接受稍大的模型权重。

用例与建议#

在 PP-YOLOE+ 和 YOLOX 之间做出选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 PP-YOLOE+#

PP-YOLOE+ 适用于:

  • 集成 PaddlePaddle 生态系统:已有基于百度 PaddlePaddle框架和工具构建基础设施的组织。
  • Paddle Lite 边缘部署:部署到专门针对 Paddle Lite 或 Paddle 推理引擎进行了高度优化的推理内核的硬件上。
  • 高精度服务端检测:在强大的 GPU 服务器上优先追求最高检测准确率,且不受框架依赖限制的场景。

何时选择 YOLOX#

以下情况推荐使用 YOLOX:

  • 无锚框检测研究:学术研究使用 YOLOX 简洁的无锚框架构作为基线,以试验新的检测头或损失函数。
  • 超轻量级边缘设备:部署到微控制器或旧款移动硬件时,YOLOX-Nano 变体极小的体积(0.91M 个参数)至关重要。
  • SimOTA 标签分配研究:研究项目用于探索基于最优传输的标签分配策略及其对训练收敛的影响。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

Ultralytics 的优势:YOLO26 登场#

虽然 PP-YOLOE+ 和 YOLOX 是优秀的研究里程碑,但现代部署环境需要更协调、更方便开发者使用且效率更高的体验。Ultralytics YOLO26 正是在此发挥作用,彻底重新定义了现代视觉 AI 的标准。

对于希望从孤立的研究代码库转向可用于生产环境系统的团队,Ultralytics 提供了强大且维护良好的生态系统。训练模型不再需要配置复杂的环境,只需使用统一的 Python API 即可轻松完成。

Ultralytics YOLO26 的主要优势包括:

  • 端到端无 NMS 设计:与需要使用非极大值抑制 (NMS) 过滤冗余边界框的 PP-YOLOE+ 和 YOLOX 不同,YOLO26 提供原生端到端检测头(nms=False)。这消除了延迟瓶颈,并大幅简化了部署逻辑。
  • CPU 推理速度最高提升 43%:通过有策略地移除分布焦点损失 (DFL),YOLO26 在 CPU 硬件上实现了无与伦比的推理速度,使其在边缘计算和低功耗设备上表现出色。
  • MuSGD 优化器:该混合优化器的灵感来自 Moonshot AI 的 Kimi K2,将 LLM 训练的稳定性带入计算机视觉,确保更快收敛,并最大限度地降低训练阶段的内存需求。
  • ProgLoss + STAL:这些先进的损失函数显著提升了小目标识别能力,这对于无人机作业和细节丰富的航空影像至关重要。
  • 多功能性:PP-YOLOE+ 和 YOLOX 纯粹专注于检测,而 YOLO26 则使用完全相同的直观语法,轻松处理实例分割、姿态估计和有向边界框 (OBB)。

使用 Ultralytics 简化训练流程#

Ultralytics 模型的内存效率和训练速度无可匹敌,全面超越了需要大量 CUDA 内存开销的基于 Transformer 的替代方案。只需几行代码,即可利用 YOLO26 的强大功能:

from ultralytics import YOLO

# 加载高效的端到端 YOLO26 nano 模型
model = YOLO("yolo26n.pt")

# 在 COCO8 示例数据集上训练
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 验证模型性能
metrics = model.val()

# 轻松导出为 ONNX 或 TensorRT 格式
model.export(format="engine")
探索 Ultralytics Platform

对于寻求无代码解决方案的团队,Ultralytics Platform 为所有 YOLO 模型提供云端训练、集成数据集标注和一键部署功能。

结论#

PP-YOLOE+ 和 YOLOX 都在计算机视觉发展史上占有一席之地,分别提供了高精度和轻量级无锚框设计。然而,对于正在构建农业 AI、智慧城市和零售未来的组织而言,Ultralytics YOLO26 持续维护、易于使用且采用原生无 NMS 架构,是当之无愧的首选。

如果你正在为特定基准测试探索替代架构,也可以通过全面的 Ultralytics 文档对比旧版 YOLO11 或基于 Transformer 的选项,例如 RT-DETR。迁移到统一的 Ultralytics 生态系统后,开发者可以节省宝贵的时间和资源,同时在任何边缘端或云端部署中实现最先进的效果。

评论