Ultralytics YOLO27:

YOLOv10 与 YOLO26#

近年来,计算机视觉领域取得了显著进展,从复杂且高度依赖后处理的架构,逐步转向精简的端到端模型。本技术对比深入探讨了这一发展历程中的两个重要里程碑:学术界的突破 YOLOv10,以及尖端的企业级 YOLO26。通过考察它们的架构、训练方法和实际部署能力,开发者可以在构建下一个视觉 AI 应用时做出明智决策。

YOLOv10:开创端到端目标检测#

YOLOv10 于 2024 年年中发布,通过解决实时目标检测中最持久的瓶颈之一——非极大值抑制 (NMS),代表了学术计算机视觉研究的一大飞跃。传统目标检测器严重依赖 NMS 来过滤冗余边界框,这会在推理过程中引入可变延迟,并增加边缘部署的复杂性。

清华大学团队提出了一种用于无 NMS 训练的一致双重分配策略。这使模型能够准确预测边界框,而无需后处理过滤步骤,从而直接降低推理延迟,并降低在硬件加速器上部署的门槛。虽然该模型对于标准检测任务非常高效,但其主要专注于边界框预测,并不原生支持实例分割或姿态估计等更复杂的任务。

了解更多关于 YOLOv10 的信息

YOLO26:边缘与云端视觉 AI 的新标准#

YOLO26 在早期无 NMS 概念的基础上进一步发展,新发布的 YOLO26 代表了性能与通用性的巅峰。该模型专为学术研究和企业级部署而设计,原生采用端到端无 NMS 设计,完全消除了 NMS 后处理,从而在所有受支持的硬件上实现更快速、更简单的部署。

YOLO26 引入了多项突破性的架构改进。移除分布式焦点损失 (DFL) 大幅简化了模型导出流程,并增强了与低功耗边缘设备的兼容性。结合这些结构性变化,YOLO26 可实现高达 43% 更快的 CPU 推理,因此在可能无法使用 GPU 加速的物联网和机器人应用中表现出色。

此外,通过采用 MuSGD 优化器,训练稳定性和收敛速度也得到了革新。MuSGD 是 SGD 与 Muon 的混合优化器,灵感来源于 LLM 训练技术。结合 ProgLoss + STAL 等先进损失函数,YOLO26 在小目标识别方面取得了显著改进。它还引入了特定于任务的增强功能,包括用于分割的多尺度原型设计、用于姿态估计的残差对数似然估计 (RLE),以及用于解决定向边界框 (OBB) 检测边界问题的专用角度损失。

企业级部署

对于希望扩展计算机视觉工作流的团队,Ultralytics 平台提供了与 YOLO26 的无缝集成,支持直观的数据标注、自动化云端训练和一键部署选项,无需构建复杂的 MLOps 基础设施。

技术性能对比#

评估这些模型时,准确率、模型大小和推理速度之间的平衡至关重要。下表展示了两个模型系列在不同规模下的性能,评估基于标准的 COCO 数据集

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

数据清楚地展示了新架构的演进优势。YOLO26 在所有尺寸级别上都实现了更高的 mAP(平均精度均值),同时保持了极具竞争力的推理速度。YOLO26 移除 DFL 后,CPU ONNX 性能得到显著提升;这一指标往往是前代模型的薄弱环节。

训练方法与生态系统#

模型的实用性取决于支持它的生态系统。YOLOv10 基于出色的 PyTorch 学术实现,但在执行基础检测之外的任务时,通常需要手动配置。

相比之下,YOLO26 已完全集成到维护完善的 Ultralytics 生态系统中。与基于 Transformer 的模型(如 RT-DETR)相比,这使其在训练期间所需的内存大幅降低,让研究人员能够在消费级硬件上训练最先进的网络。其易用性无可匹敌,提供统一的 API,可自动处理数据增强、超参数调优和日志记录。

代码示例:训练 YOLO26#

只需几行 Python 代码,即可训练一个通用且高精度的模型:

from ultralytics import YOLO

# Load the highly optimized YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model efficiently with automatic memory management
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
)

# Export natively to TensorRT without NMS complexities
model.export(format="engine")

实际应用与使用场景#

选择合适的架构完全取决于部署限制。

高速边缘计算#

对于需要在微控制器、机器人或旧款移动设备上快速部署的应用,YOLO26 快 43% 的 CPU 推理速度使其成为明确的首选。其无 NMS、无 DFL 的架构可无缝转换为 OpenVINOTensorRT 等格式,非常适合智慧城市基础设施中的实时视频分析。

高级多任务视觉#

YOLOv10 在纯边界框检测方面表现出色,而需要丰富视觉理解能力的项目则必须依赖 YOLO26。从医学影像中的实例分割,到体育分析中的精准姿态估计,YOLO26 都提供了特定于任务的损失函数,可确保在多种领域中实现更高的准确率。

替代选项

如果你的项目需要稳健的开放词汇检测,可以考虑探索 YOLO-World。对于维护旧版流水线的用户,YOLO11 仍然是 Ultralytics 框架中完全受支持且功能强大的替代方案。

使用场景与建议#

在 YOLOv10 和 YOLO26 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv10#

YOLOv10 适合:

  • 无 NMS 实时检测: 适用于能够从无需非极大值抑制的端到端检测中受益的应用,可降低部署复杂性。
  • 速度与准确率的平衡: 适用于需要在各种模型规模之间实现推理速度和检测准确率良好平衡的项目。
  • 延迟稳定的应用: 适用于推理时间可预测至关重要的部署场景,例如机器人技术或自主系统。

何时选择 YOLO26#

推荐使用 YOLO26 的场景:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

结论#

从 YOLOv10 到 YOLO26 的转变,凸显了从学术概念验证到可投入生产的企业级解决方案这一关键转变。YOLO26 采用开创性的无 NMS 设计,并通过 MuSGD 优化器、ProgLoss 和精简的边缘兼容性进一步增强,为实时计算机视觉的可能性树立了新的基准。对于希望在速度、准确率和易用性之间实现最佳平衡的开发者而言,YOLO26 是最终推荐之选。

评论