Ultralytics YOLO27:
Get Started

YOLOv10 与 YOLO26 对比#

近年来,计算机视觉领域取得了显著进展,从复杂且严重依赖后处理的架构,转向精简的端到端模型。本技术比较将深入探讨这一发展历程中的两个重要里程碑:学术领域的突破 YOLOv10,以及面向企业应用的前沿模型 YOLO26。通过考察它们的架构、训练方法和实际部署能力,开发者可以在构建下一款视觉 AI 应用时做出明智的选择。

YOLOv10:开创端到端目标检测#

YOLOv10 于 2024 年年中发布,通过解决实时目标检测中最顽固的瓶颈之一——非极大值抑制(NMS),推动学术计算机视觉研究取得重大进展。传统目标检测器严重依赖 NMS 来过滤冗余边界框,这会在推理时带来可变延迟,并增加边缘部署的复杂性。

清华大学团队提出了一种用于无 NMS 训练的一致性双重标签分配策略。这让模型无需后处理过滤步骤即可准确预测边界框,直接降低推理延迟,并降低在硬件加速器上部署的门槛。该模型在标准检测任务中效率很高,但主要专注于边界框预测,原生不支持实例分割或姿态估计等更复杂的任务。

进一步了解 YOLOv10

YOLO26:边缘与云端视觉 AI 的新标准#

在早期无 NMS 理念的基础上,新发布的 YOLO26 代表了性能与灵活性的巅峰。它专为学术研究和企业级部署打造,通过可选的一对一检测头(nms=False)实现端到端无 NMS 设计,跳过 NMS 后处理,从而在所有受支持的硬件上实现更快、更简单的部署。

YOLO26 引入了多项突破性的架构改进。移除分布焦点损失(DFL)大幅简化了模型导出流程,并增强了对低功耗边缘设备的兼容性。结合这些结构性改进,YOLO26 的 CPU 推理速度最高提升 43%,因此非常适合 GPU 加速不可用的 IoT 和机器人应用。

通过采用MuSGD 优化器,YOLO26 的训练稳定性和收敛速度也实现了革新。该优化器融合了 SGD 和 Muon,灵感来自 LLM 训练技术。再结合 ProgLoss + STAL 等先进损失函数,YOLO26 的小目标识别能力显著提升。它还引入了针对特定任务的改进,包括用于分割的多尺度原型、用于姿态估计的残差对数似然估计(RLE),以及用于解决有向边界框(OBB)检测边界问题的专用角度损失。

企业部署

对于希望扩展计算机视觉工作流的团队,Ultralytics 平台可与 YOLO26 无缝集成,提供直观的数据标注、自动化云训练和一键部署选项,无需构建庞大的 MLOps 基础设施。

技术性能对比#

评估这些模型时,精度、模型大小和推理速度之间的平衡至关重要。下表展示了这两类模型在不同规模下的性能,评估使用的是标准 COCO 数据集。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

数据清楚地展现了新架构的演进优势。YOLO26 在所有尺寸级别上的 mAP(平均精度均值)都更高,同时保持了极具竞争力的推理速度。YOLO26 移除 DFL,尤其提升了其 CPU 上的 ONNX 性能;这一指标一直是前几代模型的弱项。

训练方法与生态系统#

模型的实用性取决于支持它的生态系统。YOLOv10 提供了出色的学术实现,并基于 PyTorch 构建,但要执行基础检测以外的任务,通常需要手动配置。

相比之下,YOLO26 已全面集成到维护良好的 Ultralytics 生态系统中。与 RT-DETR 等基于 Transformer 的模型相比,这大幅降低了训练期间的内存需求,使研究人员能够在消费级硬件上训练先进的网络。其易用性无与伦比,统一的 API 可自动处理数据增强、超参数调优和日志记录。

代码示例:训练 YOLO26#

只需几行 Python 代码,即可训练出灵活且精度极高的模型:

from ultralytics import YOLO

# 加载经过高度优化的 YOLO26 small 模型
model = YOLO("yolo26s.pt")

# 通过自动内存管理高效训练模型
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
)

# 将无 NMS 的一对一检测头导出为 TensorRT
model.export(format="engine", nms=False)

实际应用与使用场景#

选择合适的架构完全取决于部署限制。

高速边缘计算#

对于需要在微控制器、机器人或旧款移动设备上快速部署的应用,YOLO26 的 CPU 推理速度最高可提升 43%,因此是明确之选。其免 NMS、免 DFL 架构可无缝转换为 OpenVINO 和 TensorRT 等格式,非常适合智能城市基础设施中的实时视频分析。

高级多任务视觉#

YOLOv10 擅长纯边界框检测,而需要丰富视觉理解能力的项目则应采用 YOLO26。从医学影像中的实例分割,到体育分析中的精准姿势估计,YOLO26 都提供了针对特定任务的损失函数,可确保在不同领域实现更高精度。

其他选项

如果你的项目需要强大的开放词汇检测能力,可以考虑 YOLO-World。对于维护旧版流水线的用户,YOLO11 仍是 Ultralytics 框架中获得全面支持且功能强大的替代方案。

用例与建议#

选择 YOLOv10 还是 YOLO26,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv10#

以下场景适合使用 YOLOv10:

  • 无 NMS 的实时检测:适用于需要从端到端检测中获益、无需使用非极大值抑制并能降低部署复杂度的应用。
  • 均衡权衡速度与准确率:适用于需要在不同模型规模下兼顾推理速度和检测准确率的项目。
  • 延迟稳定的应用:适用于推理时间可预测性至关重要的部署场景,例如机器人或自主系统。

何时选择 YOLO26#

以下场景推荐使用 YOLO26:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

结论#

从 YOLOv10 过渡到 YOLO26,体现了一个关键转变:从学术概念验证走向可用于生产的企业级解决方案。YOLO26 采用开创性的免 NMS 设计,并通过 MuSGD 优化器、ProgLoss 和精简的边缘设备兼容性进一步增强能力,为实时计算机视觉树立了新的标杆。对于希望在速度、精度和易用性之间实现最佳平衡的开发者,YOLO26 是首选。

评论