Ultralytics YOLO27:

EfficientDet vs YOLO11#

选择最佳神经网络架构是任何成功的计算机视觉应用的基础。本综合指南对 Google 的 EfficientDet 和 Ultralytics YOLO11进行了深入的技术比较,分析了它们的架构差异、性能指标和理想部署场景。

无论你的目标是在边缘 AI设备上实现毫秒级延迟,还是需要适用于云端推理的可扩展精度,了解这些模型的细微差异都至关重要。

模型概览与技术细节#

了解每种架构的发展脉络和底层设计理念,有助于理解它们在现实世界目标检测任务中的性能表现。

EfficientDet#

EfficientDet 由 Google Brain 的研究人员开发,引入了与新颖的 BiFPN(双向特征金字塔网络)相结合的、系统化的目标检测网络扩展方法。

了解更多关于 EfficientDet 的信息

YOLO11#

YOLO11 代表了 Ultralytics 生态系统的一次重大演进,在实时性能、参数效率和多任务学习方面实现了突破。

架构对比#

这两种模型之间的架构差异凸显了多年来设计策略的分化。

EfficientDet 采用 EfficientNet 主干网络并引入 BiFPN,从而支持自顶向下和自底向上的多尺度特征融合。它使用复合缩放方法,同时统一缩放主干网络、特征网络以及边界框/类别预测网络的分辨率、深度和宽度。虽然这种方法对于最大化平均精度(mAP)非常有效,但 BiFPN 中复杂的路由有时会在推理期间造成内存带宽瓶颈。

另一方面,YOLO11 使用经过优化的 C3k2 模块和先进的无锚框检测头。这种精简的方法最大限度地减少了特征提取期间的开销。Ultralytics 对 YOLO11 进行了专门设计,以最大化 GPU 硬件利用率,与较旧的架构或大型 Transformer模型相比,在训练和推理期间都显著降低了内存需求。

多任务灵活性

虽然 EfficientDet 严格来说是目标检测器,但 YOLO11 具有极强的通用性。单个 YOLO11 架构原生支持实例分割图像分类姿态估计定向边界框(OBB)

性能基准测试#

下表比较了两个模型系列在COCO 数据集不同规模下的性能。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

均衡分析:优势与劣势#

**GPU 加速:**YOLO11 在 GPU 环境中占据优势。例如,YOLO11m 在使用 TensorRT的 T4 GPU 上以惊人的 4.7ms 达到 51.5% 的 mAP。要达到相当的精度,EfficientDet-d5 需要 67.86ms,速度慢了超过 14 倍。这凸显了 Ultralytics 模型在实时应用中的卓越性能平衡。

**CPU 环境:**使用 ONNX时,EfficientDet 在较小的变体(如 d0 和 d1)中展现出高度优化的 CPU 推理速度。然而,在 d7 等较大变体中,如果不付出巨大的 GPU 延迟代价,其精度扩展性较差。

训练方法与生态系统#

开发者体验通常与模型的理论能力同样重要。这正是 Ultralytics 生态系统的优势所在。

EfficientDet 严重依赖传统的 TensorFlow生态系统和复杂的 AutoML 库。设置自定义训练流程需要经历陡峭的学习曲线、处理复杂的依赖关系,并手动配置锚框和损失函数

相比之下,Ultralytics 提供了无与伦比的易用性。在维护良好的 PyTorch 生态系统支持下,训练 YOLO 模型只需几行代码。该框架会自动管理超参数调优、高级数据增强和最佳学习率调度,无需额外配置即可使用。

代码示例:开始使用 Ultralytics#

这段稳健且可用于生产的代码片段展示了在 Python API中进行训练和推理是多么简单。

from ultralytics import YOLO

# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")

# Train the model on your custom dataset with automated hyperparameter tuning
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Perform fast inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
results[0].show()

理想应用场景#

何时使用 EfficientDet: 对于深度依赖 TensorFlow 流程的研究环境,或存在特定 CPU 计算限制且 d0 等早期架构能够满足要求的场景,EfficientDet 仍然是可行的选择。

何时使用 YOLO11: YOLO11 是现代企业部署的明确选择。其出色的速度使其非常适合自动驾驶车辆、实时体育分析和高吞吐量制造缺陷检测。此外,其较低的内存使用量还支持将其灵活部署在资源受限的硬件上,例如 NVIDIA Jetson

展望未来:YOLO26 升级#

虽然 YOLO11 功能极其强大,但开始新项目的开发者应评估其他 Ultralytics 架构,例如久经验证的 YOLOv8或最新发布的 YOLO26。YOLO26 于 2026 年初发布,以 YOLO11 为基础并引入了多项突破性创新:

  • **端到端无 NMS 设计:**YOLO26 延续了 YOLOv10的传统,在后处理期间完全消除了非极大值抑制(NMS),大幅降低了延迟并简化了部署流程。
  • **MuSGD 优化器:**一种将标准 SGD 与 Muon 相结合的混合优化器(灵感来自大型语言模型训练),可显著提升训练稳定性。
  • **CPU 推理速度最高提升 43%:**针对性的优化使 YOLO26 在缺少独立 GPU 的边缘设备上也具有极强的性能。
  • **ProgLoss + STAL:**先进的损失函数可显著改善小目标检测,这对于航空影像和机器人技术至关重要。

在我们的综合 Ultralytics Docs中,探索更广泛的视觉架构领域,其中包括基于 Transformer 的检测器,如 RT-DETR

评论