Ultralytics YOLO27:
Get Started

EfficientDet 与 YOLO11#

选择合适的神经网络架构,是任何成功的计算机视觉应用的基础。本指南深入对比 Google 的 EfficientDet 和 Ultralytics YOLO11,分析两者的架构差异、性能指标和理想部署场景。

无论你是在边缘 AI 设备上追求毫秒级延迟,还是需要云端推理具备可扩展的准确率,了解这些模型的细微差异都至关重要。

模型概况与技术细节#

了解每种架构的发展脉络和底层设计理念,有助于理解其在现实目标检测任务中的表现。

EfficientDet#

EfficientDet 由 Google Brain 的研究人员开发,通过引入新颖的 BiFPN(双向特征金字塔网络),为扩展目标检测网络提供了系统化的方法。

了解 EfficientDet 的更多信息

YOLO11#

YOLO11 是 Ultralytics 生态系统的一次重大演进,在实时性能、参数效率和多任务学习方面不断突破。

架构对比#

这两种模型的架构差异,凸显了多年来设计策略的分化。

EfficientDet 使用 EfficientNet 主干网络,并引入 BiFPN,实现自顶向下和自底向上的多尺度特征融合。它采用复合缩放方法,同时按统一比例缩放分辨率、深度和宽度,适用于主干网络、特征网络以及边界框/类别预测网络。虽然这种方法能有效提升平均精度均值(mAP),但 BiFPN 中复杂的数据路由有时会在推理期间造成内存带宽瓶颈。

相比之下,YOLO11 使用经过优化的 C3k2 模块和先进的无锚检测头。这种精简的方法最大限度地降低了特征提取开销。Ultralytics 对 YOLO11 的设计旨在最大限度地利用 GPU 硬件,与较早的架构或大型 Transformer 模型相比,训练和推理期间的内存需求显著降低。

多任务灵活性

EfficientDet 只是一个目标检测器,而 YOLO11 则具备极强的通用性。单个 YOLO11 架构原生支持实例分割、图像分类、姿态估计和有向边界框(OBB)。

性能基准测试#

下表对比了两个模型系列在不同规模下基于 COCO 数据集的性能。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

综合分析:优势与不足#

GPU 加速:YOLO11 在 GPU 环境中表现出色。例如,YOLO11m 在 T4 GPU 上使用 TensorRT,以惊人的 4.7ms 达到 51.5% 的 mAP。若要达到相近的准确率,EfficientDet-d5 需要 67.86ms,速度慢了 14 倍以上。这体现了 Ultralytics 模型在实时应用中的卓越性能平衡。

CPU 环境:使用 ONNX 时,EfficientDet 的较小变体(如 d0 和 d1)在 CPU 推理速度方面经过了高度优化。但在 d7 等较大的变体中,如果不承受巨大的 GPU 延迟代价,其准确率就难以提升。

训练方法与生态系统#

开发者体验往往与模型的理论能力同等重要,而这正是 Ultralytics 生态系统的优势所在。

EfficientDet 高度依赖旧版 TensorFlow 生态系统和复杂的 AutoML 库。设置自定义训练流水线需要克服陡峭的学习曲线、处理繁杂的依赖关系,并手动配置锚框和损失函数。

相比之下,Ultralytics 极其易用。依托完善的 PyTorch 生态系统,训练 YOLO 模型只需几行代码。该框架开箱即用,可自动管理高级数据增强和学习率调度,并内置超参数调优功能。

代码示例:开始使用 Ultralytics#

这个稳健、可用于生产环境的代码片段,展示了通过 Python API 进行训练和推理有多简单。

from ultralytics import YOLO

# 加载预训练的 YOLO11 小型模型
model = YOLO("yolo11s.pt")

# 在你的自定义数据集上训练模型
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# 对图像快速执行推理
results = model.predict("https://ultralytics.com/images/bus.jpg")
results[0].show()

理想应用场景#

适合使用 EfficientDet 的情况: 如果你的研究环境深度依赖 TensorFlow 流水线,或受到特定的 CPU 算力限制,且 d0 等早期架构能够满足需求,那么 EfficientDet 仍是可行的选择。

适合使用 YOLO11 的情况: YOLO11 是现代企业部署的理想选择。其出色的速度使其适用于自动驾驶汽车、实时体育分析和高吞吐量制造缺陷检测。此外,较低的内存占用使其能够灵活部署在资源受限的硬件上,例如 NVIDIA Jetson。

展望未来:升级到 YOLO26#

YOLO11 能力出众,但开始新项目的开发者应评估其他 Ultralytics 架构,例如成熟的 YOLOv8 或新近发布的 YOLO26。YOLO26 于 2026 年初发布,它以 YOLO11 为基础,并带来了多项突破性创新:

  • 端到端无 NMS 设计:YOLO26 在 YOLOv10 的基础上进一步发展,可通过可选的一对一检测头(nms=False)完全跳过非极大值抑制(NMS)后处理,从而大幅降低延迟并简化部署流水线。
  • MuSGD 优化器:这是一种混合优化器,融合了标准 SGD 和 Muon(灵感来自大型语言模型训练),大幅提升了训练稳定性。
  • CPU 推理速度提升多达 43%:特定优化让 YOLO26 在缺少独立 GPU 的边缘设备上表现极为出色。
  • ProgLoss + STAL:先进的损失函数显著提升了小目标检测能力,这对航空影像和机器人技术至关重要。

在我们的综合 Ultralytics 文档中,了解更广泛的视觉架构,包括 RT-DETR 等基于 Transformer 的检测器。

评论