Ultralytics YOLO27:

EfficientDet 与 YOLOv5 对比#

选择最优的神经网络架构是任何计算机视觉项目中的关键步骤。推理延迟、参数效率与检测精度之间的平衡,决定了模型在真实世界中的表现。本技术指南深入分析了两个极具影响力的目标检测框架:Google 的 EfficientDet 和 Ultralytics YOLOv5。

通过比较它们的架构创新、训练方法和部署能力,开发者可以针对具体部署环境做出明智决策,无论是扩展到云服务器,还是运行在资源受限的边缘设备上。

EfficientDet:采用 BiFPN 的可扩展架构#

EfficientDet 由 Google Research 推出,旨在系统地扩展骨干网络和特征网络,以更少的参数实现比以往最先进模型更高的精度。

模型详情#

架构创新#

EfficientDet 采用 EfficientNet 分类模型作为骨干网络,利用复合缩放方法统一调整网络宽度、深度和分辨率。它对目标检测最重要的贡献,是引入双向特征金字塔网络(BiFPN)。与仅从上到下聚合特征的标准特征金字塔网络不同,BiFPN 支持复杂的双向跨尺度连接,并引入可学习权重来确定不同输入特征的重要性。

EfficientDet 虽然精度很高,但高度依赖 TensorFlow 生态系统和特定的 AutoML 库。这种依赖有时会使其难以集成到自定义的轻量级部署流程,或偏好动态图计算的环境中。

了解更多关于 EfficientDet 的信息

Ultralytics YOLOv5:让实时 AI 惠及大众#

Ultralytics YOLOv5 在 EfficientDet 发布后不久推出,凭借极易使用的原生 PyTorch YOLO 架构实现彻底改变了行业。它为开发者体验、训练效率和实时部署灵活性树立了新的标准。

模型详情#

架构创新#

YOLOv5 在前代模型的基础上进行了重大升级,采用 CSPDarknet(跨阶段部分)骨干网络,在减少总体参数量的同时显著改善梯度流。此外,YOLOv5 还集成了自动学习锚框功能,可根据你的特定自定义训练数据自动计算最优边界框先验,从而无需手动调整超参数。

YOLOv5 还大量采用马赛克数据增强,将四张不同的图像融合为一个训练图块。这一方法显著提升了模型检测小目标的能力,并增强了上下文理解的泛化能力,使其能够稳健地应对各种环境。

性能与基准测试#

COCO 数据集等标准基准上评估模型,对于理解精度与速度之间的权衡至关重要。下表展示了不同尺寸的 EfficientDet 和 YOLOv5 在标准化条件下的表现。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

权衡分析#

EfficientDet-d7 的 mAP 峰值达到令人印象深刻的 53.7,但与 YOLO 架构相比,它在 GPU 硬件上的推理延迟明显更高。相反,YOLOv5 在硬件加速方面表现出色。YOLOv5n 通过 NVIDIA TensorRT 在 T4 GPU 上实现了惊人的 1.12 ms 推理时间,使其在自动驾驶或高速生产线等实时应用中具有显著优势。

此外,与复杂的复合缩放网络或大型 Transformer 模型相比,YOLOv5 模型在训练期间所需的 CUDA 内存要少得多。这种精简的内存占用降低了先进 AI 技术的使用门槛,使研究人员能够在标准消费级硬件上训练稳健的模型。

最大化硬件效率

要在边缘设备上从你的 YOLOv5 模型中获得最大的每秒帧数(FPS),请将 PyTorch 权重导出为适用于 NVIDIA GPU 的 TensorRT,或适用于 Intel CPU 的 OpenVINO。这一步通常可以将推理速度提升一倍。

训练生态系统与开发者体验#

Ultralytics 生态系统的真正优势在于简洁流畅的用户体验。EfficientDet 需要深入了解 TensorFlow 目标检测 API,而 YOLOv5 提供了一致且简单的 Python API。

维护良好的 Ultralytics 生态系统确保开发者能够获得频繁更新、活跃的社区支持,以及与 Weights & Biases 和 ClearML 等实验跟踪工具的无缝集成。

代码示例:开始使用 YOLOv5#

通过 PyTorch Hub 使用预训练 YOLOv5 模型运行推理,只需几行代码:

from ultralytics import YOLO

# Load the highly efficient YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display the detected bounding boxes
results[0].show()

多样性与实际应用#

EfficientDet 严格来说是一个目标检测框架,这限制了它在复杂视觉流程中的实用性。另一方面,YOLOv5 已发展为支持多种计算机视觉任务。该模型的现代版本支持高精度的实例分割图像分类,使开发者能够整合机器学习技术栈。

理想应用场景#

  • EfficientDet: 最适合离线处理、学术研究和基于云的分析,这些场景优先考虑最高精度而非延迟,并且具备服务器级 TPU 或大容量 GPU。
  • YOLOv5: 边缘 AI 部署的首选方案。它兼具低延迟、极小的参数规模和高精度,非常适合无人机分析、实时零售自动化,以及通过 CoreML 或 TFLite 实现的移动应用。

新一代模型:升级到 YOLO26#

YOLOv5 仍然是一个稳健且广泛部署的模型,但 AI 领域发展迅速。对于启动新项目或追求现代性能极限的团队,Ultralytics 推出了于 2026 年 1 月发布的 YOLO26

YOLO26 重新定义了速度与精度的帕累托前沿,引入突破性的架构变革,让部署更简单、推理更快速。

YOLO26 的关键进展#

  • 端到端无 NMS 设计: YOLO26 原生消除了非极大值抑制后处理。这大幅简化了部署逻辑并降低了延迟波动,是从 YOLOv10 早期实验中进一步完善而来的突破性方法。
  • CPU 推理速度最高提升 43%: 专为边缘计算和不配备专用 GPU 的低功耗 IoT 设备而设计。
  • MuSGD 优化器: 受到大语言模型训练技术(如 Moonshot AI 的 Kimi K2)的启发,这种 SGD 与 Muon 的混合方案将 LLM 创新引入计算机视觉,实现更快的收敛速度和高度稳定的训练动态。
  • **ProgLoss + STAL:**这些高级损失函数显著提升了小目标识别能力,这对于航空影像和机器人技术至关重要。
  • 移除 DFL: 通过移除分布焦点损失,模型头得到了大幅简化,在导出到旧版或资源高度受限的边缘硬件时具有更好的兼容性。

对于部署多任务流程的团队,YOLO26 还引入了特定任务的升级,例如用于分割的多尺度 proto,以及用于定向边界框(OBB)的专用角度损失。要探索生态系统中的其他现代替代方案,你还可以查看 YOLO11 或 YOLOv8 架构。

结论#

在 EfficientDet 和 YOLOv5 之间进行选择,很大程度上取决于你的部署目标。EfficientDet 提供了数学上优雅的缩放方法,适合以云端推理为主的场景。然而,YOLOv5 出色的开发者体验、极快的 PyTorch 训练循环以及高度优化的边缘部署能力,使其成为绝大多数现实世界实时应用的首选。借助 Ultralytics 提供的完整工具,团队可以缩短产品上市时间,构建响应迅速的 AI 系统。

评论