Ultralytics YOLO27:

PP-YOLOE+ 与 EfficientDet#

选择合适的架构是构建稳健计算机视觉应用的关键步骤。本技术指南将探讨两种知名目标检测模型 PP-YOLOE+EfficientDet 之间的权衡。我们将解析它们的架构,分析其性能指标,并探讨各自理想的部署场景。

尽管这两种模型都为该领域作出了重要贡献,我们还将讨论现代替代方案(如 Ultralytics YOLO26)如何在内存效率、推理速度和开发者体验方面实现大幅提升。

架构概览:PP-YOLOE+#

PP-YOLOE+ 是原始 PP-YOLO 的演进版本,专门用于在 PaddlePaddle 生态中优化服务器端 GPU 上的性能。它在基础架构上进行了多项改进,重点采用无锚框范式。

了解更多关于 PP-YOLOE+

PP-YOLOE+ 采用 CSPRepResNet 主干网络和高效任务对齐检测头 (ET-head),并高度依赖 varifocal loss 进行分类,同时使用 distribution focal loss 进行边界框回归。其转向无锚框检测器设计,有助于简化后处理流程,使其在发布时极具竞争力。

集成优势

已经深度投入百度 PaddlePaddle 框架的团队通常会发现,PP-YOLOE+ 更容易用于实例分割等任务,但与较新工具相比,它缺乏广泛的多框架支持。

架构概览:EfficientDet#

EfficientDet 采用了截然不同的目标检测方法,高度依赖神经架构搜索和复合缩放原则。

了解有关 EfficientDet 的更多信息

EfficientDet 的核心是双向特征金字塔网络 (BiFPN)。与传统 FPN 不同,BiFPN 通过引入可学习权重来学习不同输入特征的重要性,从而实现轻松且快速的多尺度特征融合。结合 EfficientNet主干网络后,EfficientDet 能够系统地同时扩展网络宽度、深度和分辨率。

尽管从理论上看,EfficientDet 在 FLOPs 方面效率很高,但由于复杂的内存访问模式,其模型有时难以将理论效率转化为边缘设备上的实际速度,这与 YOLO 类模型更低的内存需求形成鲜明对比。

性能分析与基准测试#

下表对比了标准数据集(如 COCO)上的关键指标。将平均精度 (mAP)与推理速度进行比较,可以清晰地了解帕累托前沿。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

如表所示,PP-YOLOE+ 通常能在高端 GPU 上实现更好的原始 mAP 扩展能力,而 EfficientDet 则试图将参数量降至最低。不过,二者都落后于尖端边缘 AI所需的现代实时能力。

使用场景与建议#

在 PP-YOLOE+ 和 EfficientDet 之间进行选择,取决于你的具体项目需求、部署限制和生态偏好。

何时选择 PP-YOLOE+#

PP-YOLOE+ 适合以下场景:

  • PaddlePaddle 生态系统集成: 已有基于 Baidu 的 PaddlePaddle 框架和工具构建的基础设施的组织。
  • Paddle Lite 边缘部署: 将模型部署到使用专为 Paddle Lite 或 Paddle 推理引擎优化的推理内核的硬件上。
  • 高精度服务器端检测: 优先考虑在强大的 GPU 服务器上实现最高检测精度,且不受框架依赖影响的场景。

何时选择 EfficientDet#

以下场景推荐使用 EfficientDet:

  • **Google Cloud 和 TPU 流水线:**与 Google Cloud Vision API 或 TPU 基础设施深度集成的系统,EfficientDet 在其中具有原生优化。
  • **复合缩放研究:**专注于研究网络深度、宽度和分辨率均衡缩放效果的学术基准测试。
  • **通过 TFLite 进行移动端部署:**明确要求导出为 TensorFlow Lite 以用于 Android 或嵌入式 Linux 设备的项目。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26 在性能和开发者体验之间提供了最佳组合:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

现代替代方案:Ultralytics YOLO26#

尽管 PP-YOLOE+ 和 EfficientDet 代表了重要的历史里程碑,但对于寻求业界领先精度、更低内存占用和流畅用户体验的开发者来说,应当考虑 Ultralytics YOLO26

YOLO26 在目标检测方面实现了巨大飞跃,引入了多项关键创新:

  • 端到端无 NMS 设计:YOLOv10 突破的基础上,YOLO26 在推理过程中原生消除了非极大值抑制 (NMS)。这显著降低了延迟,并消除了复杂的后处理瓶颈。
  • MuSGD 优化器: YOLO26 受到 LLM 训练创新的启发,采用 SGD 与 Muon 相结合的混合优化器。这大幅提升了训练稳定性并缩短了收敛时间。
  • 极致速度:YOLO11 等较早一代模型相比,YOLO26 的 CPU 推理速度最高提升 43%,使其成为电池供电或仅使用 CPU 的边缘设备的最佳选择。
  • 高级损失函数: 引入 ProgLoss 和 STAL 后,小目标识别能力得到显著提升,这对于无人机分析机器人技术等任务至关重要。
多任务灵活性

与专注于检测的 EfficientDet 不同,YOLO26 在同一套维护良好的生态中原生支持姿态估计图像分类定向边界框 (OBB)

易用性与生态集成#

EfficientDet 等传统模型的一大缺点,是其训练流程和自动化机器学习配置较为复杂。相比之下,Ultralytics Platform 提供了无可匹敌的开发者体验。

使用 Ultralytics 部署模型只需几行代码,与旧框架所需的冗长配置形成鲜明对比。

from ultralytics import YOLO

# Load a pretrained YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100)

# Run inference on a test image natively without NMS overhead
predictions = model("https://ultralytics.com/images/bus.jpg")

如果你正在探索其他替代方案,Ultralytics 生态中还提供 RT-DETR 或传统的 YOLOv8 等架构,方便你无缝切换和测试。

结论#

PP-YOLOE+ 仍然是 Paddle 生态中特定服务器部署场景的有力选择,而 EfficientDet 依旧是自动化架构设计领域颇具研究价值的方案。不过,对于需要实时推理、便捷部署和最低内存需求的现代应用,Ultralytics YOLO26 提供了最具吸引力的性能平衡。其原生无 NMS 设计和闪电般的 CPU 性能,使其成为面向未来构建 AI 基础设施的明确选择。

评论