YOLO Vision 2026:

YOLO26 与 EfficientDet#

选择合适的神经网络架构对于任何计算机视觉应用成功都至关重要。本技术指南探讨了两个杰出模型的权衡、性能指标和架构创新:尖端的Ultralytics YOLO26与谷歌老牌的 EfficientDet。

无论你的部署目标是高吞吐量云服务器还是延迟受限的边缘 AI设备,理解这些架构之间的差异都能确保在速度、准确率和效率之间取得最佳平衡。

架构概述:YOLO26#

作者: Glenn Jocher 和 Jing Qiu
组织: Ultralytics
日期: 2026-01-14
GitHub: Ultralytics GitHub
文档: YOLO26 官方文档

于 2026 年初发布,YOLO26 代表了 YOLO 系列的最新演进,专为提供无与伦比的用户体验和顶级平均精度均值 (mAP)而设计。它从头开始为现代硬件设计,在目标检测实例分割图像分类姿态估计方面提供了非凡的通用性。

YOLO26 引入了多项突破性功能,极大地提高了训练稳定性和推理速度:

  • 端到端无 NMS 设计: 基于 YOLOv10 开创的概念,YOLO26 原生支持端到端,完全消除了对非极大值抑制 (NMS) 后处理的需求。这带来了更简单的部署逻辑和显著降低的延迟波动。
  • CPU 推理速度提升高达 43%: 通过深度的架构优化,该模型在标准 CPU 上实现了空前的推理速度,非常适合物联网和嵌入式环境。
  • 移除 DFL: 移除了分布焦点损失(Distribution Focal Loss),从而带来了更简洁的导出过程,并增强了对使用 ONNX 等工具的低功耗边缘设备的兼容性。
  • MuSGD 优化器:月之暗面 Kimi K2 大模型训练例程的启发,这种 SGD 与 Muon 的混合体将大语言模型训练的创新直接引入了计算机视觉,确保了更快的收敛速度和更稳定的训练方案。
  • ProgLoss + STAL: 这些先进的损失函数在小目标识别方面表现显著,这对于涉及无人机航拍影像和机器人的应用至关重要。
简化的导出

得益于 DFL 的移除和无 NMS 架构,将 YOLO26 模型导出到诸如 NVIDIA TensorRTIntel OpenVINO 等边缘友好格式时,几乎不需要开发任何自定义插件。

了解更多关于 YOLO26 的信息

架构概览:EfficientDet#

作者: Mingxing Tan, Ruoming Pang, and Quoc V. Le
组织: Google Research
日期: 2019-11-20
Arxiv: EfficientDet 论文
GitHub: Google AutoML 仓库

由谷歌推出的 EfficientDet 大量利用了 TensorFlow 生态系统,并围绕复合缩放(compound scaling)的概念进行设计。其架构根据资源限制,同时对主干网络、特征网络以及边界框/类别预测网络进行缩放。

EfficientDet 的关键创新包括:

  • BiFPN(双向特征金字塔网络): 一种允许简单快速的多尺度特征融合的机制,使网络能够更好地理解不同尺寸的目标。
  • 复合缩放: 一种统一缩放分辨率、深度和宽度的启发式方法,创建了从 d0(最小)到 d7(最大)的模型家族。

尽管 EfficientDet 仍然是严格边界框检测的稳健选择,但它通常缺乏现代开发者所期望的现代多任务通用性(例如原生 OBB 任务)以及精简统一的 Python 生态系统。

了解更多关于 EfficientDet 的信息

性能与指标对比#

为了找出速度与准确率的帕累托前沿,我们在使用 COCO 数据集的标准环境中对这两种架构进行了基准测试。下表重点介绍了在 AWS EC2 P4d 实例上测得的模型大小、精度和延迟方面的差异。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
参数量
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

如上所示,YOLO26 建立了优越的性能平衡。YOLO26x 模型实现了最高精度 (57.5 mAP),显著优于最重的 EfficientDet-d7。此外,YOLO26 模型表现出显著更低的内存需求和更快的 GPU 推理速度(在 TensorRT 上低至 1.7 ms),凸显了无 NMS 设计的优势。

训练效率与生态系统优势#

这两种架构之间的一个主要区别在于它们的开发环境。EfficientDet 深度嵌入在 Google AutoML 和 TensorFlow 生态系统中,虽然功能强大,但对于像 DOTAv1 这样的自定义数据集,可能会带来陡峭的学习曲线和死板的配置。

相反,Ultralytics 提供了基于 PyTorch 构建的维护极其出色的生态系统。训练期间的内存使用经过了严格优化,使工程师能够在无需分配过高显存(这在基于 Transformer 的网络中很常见)的情况下训练出稳健的模型。

统一平台集成

通过 Ultralytics 平台,开发者可以获得端到端的 MLOps 工作流。这包括无缝的数据标注、自动超参数调优和一键式云端训练,从而显著加快从原型到生产的进程。

实现示例#

Ultralytics API 提供的易用性意味着你只需几行代码即可训练和验证最先进的 YOLO26 模型。

from ultralytics import YOLO

# Initialize the End-to-End NMS-Free YOLO26 model
model = YOLO("yolo26n.pt")

# Train using the innovative MuSGD optimizer on a custom dataset
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Train on GPU
)

# Export natively to TensorRT for ultra-low latency deployment
model.export(format="engine")

理想使用场景#

何时使用 YOLO26:

  • 边缘计算与移动端: 由于 CPU 推理速度提升高达 43% 且没有 NMS 开销,YOLO26 在计算预算极其受限的设备(如 Raspberry Pi 或手机)上表现出色。
  • 多任务处理: 当单个管道需要边界框、分割掩码和跟踪时,YOLO26 的多功能性是无与伦比的。
  • 无人机与航拍影像: ProgLoss 和 STAL 的结合极大地增强了从高空检测极小目标的能力。

何时使用 EfficientDet:

  • 遗留 TensorFlow 流水线: 如果你的基础设施被严重硬编码为仅支持 TensorFlow SavedModel,或者需要特定的 TensorFlow Serving 流水线,EfficientDet 提供了原生兼容性。
  • 资源受限的 TPU: EfficientDet 针对谷歌的自定义张量处理单元(TPU)进行了深度优化。

探索其他替代方案#

虽然本指南主要聚焦于 YOLO26 与 EfficientDet 的范式,但更广阔的 Ultralytics 生态系统还容纳了其他令人惊叹的架构。如果你的应用严重依赖 Transformer,RT-DETR 提供了基于 Transformer 的实时检测。或者,如果你正在维护旧系统,YOLO11 仍然得到全力支持且非常高效。如需更广泛的概览,请访问 Ultralytics 模型比较中心

总之,对于当今构建的任何现代计算机视觉流水线,YOLO26 凭借其出色的速度、易用性和最先进的精度,成为研究人员和开发者的不二之选。

评论