YOLOv10 与 YOLO26 对比#
近年来,计算机视觉领域取得了显著进展,从复杂且严重依赖后处理的架构,转向精简的端到端模型。本技术比较将深入探讨这一发展历程中的两个重要里程碑:学术领域的突破 YOLOv10,以及面向企业应用的前沿模型 YOLO26。通过考察它们的架构、训练方法和实际部署能力,开发者可以在构建下一款视觉 AI 应用时做出明智的选择。
YOLOv10:开创端到端目标检测#
YOLOv10 于 2024 年年中发布,通过解决实时目标检测中最顽固的瓶颈之一——非极大值抑制(NMS),推动学术计算机视觉研究取得重大进展。传统目标检测器严重依赖 NMS 来过滤冗余边界框,这会在推理时带来可变延迟,并增加边缘部署的复杂性。
清华大学团队提出了一种用于无 NMS 训练的一致性双重标签分配策略。这让模型无需后处理过滤步骤即可准确预测边界框,直接降低推理延迟,并降低在硬件加速器上部署的门槛。该模型在标准检测任务中效率很高,但主要专注于边界框预测,原生不支持实例分割或姿态估计等更复杂的任务。
YOLO26:边缘与云端视觉 AI 的新标准#
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2026-01-14
- 链接:GitHub 仓库 | Ultralytics 平台
在早期无 NMS 理念的基础上,新发布的 YOLO26 代表了性能与灵活性的巅峰。它专为学术研究和企业级部署打造,通过可选的一对一检测头(nms=False)实现端到端无 NMS 设计,跳过 NMS 后处理,从而在所有受支持的硬件上实现更快、更简单的部署。
YOLO26 引入了多项突破性的架构改进。移除分布焦点损失(DFL)大幅简化了模型导出流程,并增强了对低功耗边缘设备的兼容性。结合这些结构性改进,YOLO26 的 CPU 推理速度最高提升 43%,因此非常适合 GPU 加速不可用的 IoT 和机器人应用。
通过采用MuSGD 优化器,YOLO26 的训练稳定性和收敛速度也实现了革新。该优化器融合了 SGD 和 Muon,灵感来自 LLM 训练技术。再结合 ProgLoss + STAL 等先进损失函数,YOLO26 的小目标识别能力显著提升。它还引入了针对特定任务的改进,包括用于分割的多尺度原型、用于姿态估计的残差对数似然估计(RLE),以及用于解决有向边界框(OBB)检测边界问题的专用角度损失。
对于希望扩展计算机视觉工作流的团队,Ultralytics 平台可与 YOLO26 无缝集成,提供直观的数据标注、自动化云训练和一键部署选项,无需构建庞大的 MLOps 基础设施。
技术性能对比#
评估这些模型时,精度、模型大小和推理速度之间的平衡至关重要。下表展示了这两类模型在不同规模下的性能,评估使用的是标准 COCO 数据集。
| 模型 | 尺寸 (像素) | mAP验证集 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
数据清楚地展现了新架构的演进优势。YOLO26 在所有尺寸级别上的 mAP(平均精度均值)都更高,同时保持了极具竞争力的推理速度。YOLO26 移除 DFL,尤其提升了其 CPU 上的 ONNX 性能;这一指标一直是前几代模型的弱项。
训练方法与生态系统#
模型的实用性取决于支持它的生态系统。YOLOv10 提供了出色的学术实现,并基于 PyTorch 构建,但要执行基础检测以外的任务,通常需要手动配置。
相比之下,YOLO26 已全面集成到维护良好的 Ultralytics 生态系统中。与 RT-DETR 等基于 Transformer 的模型相比,这大幅降低了训练期间的内存需求,使研究人员能够在消费级硬件上训练先进的网络。其易用性无与伦比,统一的 API 可自动处理数据增强、超参数调优和日志记录。
代码示例:训练 YOLO26#
只需几行 Python 代码,即可训练出灵活且精度极高的模型:
from ultralytics import YOLO
# 加载经过高度优化的 YOLO26 small 模型
model = YOLO("yolo26s.pt")
# 通过自动内存管理高效训练模型
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
)
# 将无 NMS 的一对一检测头导出为 TensorRT
model.export(format="engine", nms=False)实际应用与使用场景#
选择合适的架构完全取决于部署限制。
高速边缘计算#
对于需要在微控制器、机器人或旧款移动设备上快速部署的应用,YOLO26 的 CPU 推理速度最高可提升 43%,因此是明确之选。其免 NMS、免 DFL 架构可无缝转换为 OpenVINO 和 TensorRT 等格式,非常适合智能城市基础设施中的实时视频分析。
高级多任务视觉#
YOLOv10 擅长纯边界框检测,而需要丰富视觉理解能力的项目则应采用 YOLO26。从医学影像中的实例分割,到体育分析中的精准姿势估计,YOLO26 都提供了针对特定任务的损失函数,可确保在不同领域实现更高精度。
如果你的项目需要强大的开放词汇检测能力,可以考虑 YOLO-World。对于维护旧版流水线的用户,YOLO11 仍是 Ultralytics 框架中获得全面支持且功能强大的替代方案。
用例与建议#
选择 YOLOv10 还是 YOLO26,取决于你的具体项目需求、部署限制和生态系统偏好。
何时选择 YOLOv10#
以下场景适合使用 YOLOv10:
- 无 NMS 的实时检测:适用于需要从端到端检测中获益、无需使用非极大值抑制并能降低部署复杂度的应用。
- 均衡权衡速度与准确率:适用于需要在不同模型规模下兼顾推理速度和检测准确率的项目。
- 延迟稳定的应用:适用于推理时间可预测性至关重要的部署场景,例如机器人或自主系统。
何时选择 YOLO26#
以下场景推荐使用 YOLO26:
- 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
- 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
- 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。
结论#
从 YOLOv10 过渡到 YOLO26,体现了一个关键转变:从学术概念验证走向可用于生产的企业级解决方案。YOLO26 采用开创性的免 NMS 设计,并通过 MuSGD 优化器、ProgLoss 和精简的边缘设备兼容性进一步增强能力,为实时计算机视觉树立了新的标杆。对于希望在速度、精度和易用性之间实现最佳平衡的开发者,YOLO26 是首选。