Ultralytics YOLO27:

YOLO26 与 EfficientDet#

选择合适的神经网络架构对于任何计算机视觉应用的成功都至关重要。本技术指南探讨了两个知名模型之间的权衡、性能指标和架构创新:尖端的 Ultralytics YOLO26 和久经验证的 Google EfficientDet。

无论你的部署目标是高吞吐量云服务器,还是对延迟有严格要求的边缘 AI设备,了解这些架构之间的差异,都能确保在速度、精度和效率之间实现最佳平衡。

架构概览:YOLO26#

YOLO26 于 2026 年初发布,代表了 YOLO 系列的最新演进,专为提供无与伦比的用户体验和顶级平均精度 (mAP)而设计。它从零开始针对现代硬件进行设计,在目标检测实例分割图像分类姿态估计等任务中都展现出出色的灵活性。

YOLO26 引入了多项突破性功能,大幅提升了训练稳定性和推理速度:

  • 端到端无 NMS 设计: YOLO26 基于 YOLOv10 开创的理念构建,原生支持端到端处理,完全无需进行非极大值抑制 (NMS) 后处理。这带来了更简单的部署逻辑和显著更低的延迟波动。
  • CPU 推理速度最高提升 43%: 通过深度架构优化,该模型在标准 CPU 上实现了前所未有的推理速度,非常适合 IoT 和嵌入式环境。
  • 移除 DFL: 移除了 Distribution Focal Loss,从而简化了导出流程,并增强了与使用 ONNX 等工具的低功耗边缘设备的兼容性。
  • MuSGD 优化器: 该优化器受到 Moonshot AI 的 Kimi K2 的 LLM 训练流程启发,将 SGD 与 Muon 融合,直接把大语言模型训练创新引入计算机视觉,从而确保更快的收敛速度和更稳定的训练过程。
  • ProgLoss + STAL: 这些先进的损失函数显著提升了小目标识别能力,这对于涉及航空无人机图像和机器人技术的应用至关重要。
简化导出

得益于移除 DFL 和采用无 NMS 架构,将 YOLO26 模型导出为 NVIDIA TensorRTIntel OpenVINO 等适合边缘设备的格式时,几乎不需要开发自定义插件。

架构概览:EfficientDet#

EfficientDet 由 Google 推出,深度利用 TensorFlow 生态系统,并围绕复合缩放理念设计。其架构会根据资源限制,同时扩展骨干网络、特征网络以及边界框/类别预测网络。

EfficientDet 的主要创新包括:

  • 双向特征金字塔网络 (BiFPN): 一种支持轻松、快速进行多尺度特征融合的机制,使网络能够更好地理解不同大小的目标。
  • 复合缩放: 一种统一缩放分辨率、深度和宽度的启发式方法,由此构建出从 d0(最小)到 d7(最大)的一系列模型。

虽然 EfficientDet 仍然是严格边界框检测的可靠选择,但它通常缺乏现代的多任务灵活性(例如原生支持 OBB 任务),也缺乏现代开发者所期望的精简统一的 Python 生态系统。

了解更多关于 EfficientDet 的信息

性能与指标对比#

为了确定速度和精度的帕累托前沿,我们使用 COCO 数据集在标准环境中对这两种架构进行了基准测试。下表突出显示了在 AWS EC2 P4d 实例上测得的模型大小、精度和延迟差异。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

如上所示,YOLO26 实现了更优的性能平衡。YOLO26x 模型达到了最高精度(57.5 mAP),显著超过了规模最大的 EfficientDet-d7。此外,YOLO26 系列模型所需内存明显更少,GPU 推理速度也快得多(在 TensorRT 上最低可达 1.7 ms),进一步凸显了无 NMS 设计的优势。

训练效率与生态系统优势#

这两种架构之间的一个主要区别在于其开发环境。EfficientDet 深度集成于 Google AutoML 和 TensorFlow 生态系统中,尽管功能强大,但对于 DOTAv1 等自定义数据集而言,可能带来较高的学习门槛和僵化的配置。

相比之下,Ultralytics 提供了一个基于 PyTorch 构建且维护良好的生态系统。训练期间的内存使用经过严格优化,使工程师无需像基于 Transformer 的网络那样分配过多 VRAM,也能训练出可靠的模型。

统一平台集成

通过 Ultralytics Platform,开发者可以使用端到端的 MLOps 工作流。这包括无缝数据标注、自动超参数调优和一键式云训练,大幅加快从原型开发到投入生产的进程。

实现示例#

Ultralytics API 提供了简单易用的体验,这意味着你只需几行代码,就能训练和验证最先进的 YOLO26 模型。

from ultralytics import YOLO

# Initialize the End-to-End NMS-Free YOLO26 model
model = YOLO("yolo26n.pt")

# Train using the innovative MuSGD optimizer on a custom dataset
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Train on GPU
)

# Export natively to TensorRT for ultra-low latency deployment
model.export(format="engine")

理想应用场景#

何时使用 YOLO26:

  • 边缘计算与移动端: 凭借最高提升 43% 的 CPU 推理速度以及无需 NMS 开销的优势,YOLO26 在 Raspberry Pi 或移动电话等计算预算严格受限的设备上表现出色。
  • 多任务处理: 当单个流水线需要边界框、分割掩码和跟踪功能时,YOLO26 的灵活性无可匹敌。
  • 无人机与航空图像: ProgLoss 与 STAL 的结合显著增强了从高空检测极小目标的能力。

何时使用 EfficientDet:

  • 传统 TensorFlow 流水线: 如果你的基础设施经过大量硬编码,仅支持 TensorFlow SavedModel,或需要特定的 TensorFlow Serving 流水线,EfficientDet 可提供原生兼容性。
  • 资源受限的 TPU: EfficientDet 针对 Google 的定制张量处理单元(TPU)进行了大量优化。

探索其他替代方案#

虽然本指南重点讨论 YOLO26 与 EfficientDet 的范式,但更广泛的 Ultralytics 生态系统还包含其他出色的架构。如果你的应用高度依赖 Transformer,RT-DETR 可提供基于 Transformer 的实时检测。另一方面,如果你需要支持传统系统,YOLO11 仍然得到完整支持,并且效果出色。如需更广泛的概览,请访问 Ultralytics 模型比较中心

归根结底,对于如今构建的任何现代计算机视觉流水线而言,YOLO26 卓越的速度、易用性和最先进的精度,使其成为研究人员和开发者一致认可的首选方案。

评论