YOLOv8 与 YOLO26#
过去几年,计算机视觉领域取得了显著进展。在实时应用中最受欢迎的架构中,有不少由 Ultralytics 开发。本指南将详细比较开创性的 Ultralytics YOLOv8 和最新的先进模型 Ultralytics YOLO26。我们将分析两者的架构、性能指标和理想应用场景,帮助你为部署选择合适的模型。
模型概述#
YOLOv8 和 YOLO26 都是YOLO 模型家族的重要里程碑。它们秉承 Ultralytics 的核心理念:通过统一的 Python 环境和 API,提供快速、准确且极易使用的模型。
YOLOv8:多用途标准模型#
YOLOv8 于 2023 年初发布,对 YOLO 框架进行了重大革新,引入了无锚框设计,并为多种计算机视觉任务提供了强大的支持。
- 作者: Glenn Jocher、Ayush Chaurasia 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2023-01-10
- GitHub: Ultralytics 代码库
- 文档: YOLOv8 文档
YOLOv8 凭借出色的性能平衡以及与 Ultralytics 生态系统的深度集成,迅速成为行业标准。它原生支持目标检测、实例分割、姿态估计和图像分类。不过,它依赖标准的非极大值抑制(NMS)进行后处理,这可能会在资源高度受限的边缘环境中造成延迟瓶颈。
YOLO26:新一代边缘计算利器#
YOLO26 于 2026 年 1 月发布,在前代模型奠定的基础上进行了激进优化,以适应现代部署场景,尤其是边缘 AI 和低功耗设备。
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2026-01-14
- GitHub: Ultralytics 代码库
- 文档:YOLO26 文档
YOLO26 引入了多项颠覆性技术改进。最值得关注的是,它采用了端到端无 NMS 设计。这一架构最初由 YOLOv10 开创,无需 NMS 后处理,大幅简化了导出流程,并降低了延迟波动。此外,移除分布焦点损失(DFL)让检测头更加精简,也使模型更适合部署在边缘 AI 硬件上。
架构与训练方面的创新#
YOLO26 带来了多项底层改进,大幅提升了 YOLOv8 基线模型的表现。
使用 MuSGD 优化器提升训练效率#
训练效率是 Ultralytics 模型的一大特点,与 RT-DETR 等庞大的 Transformer 架构相比,这些模型通常对内存的需求低得多。YOLO26 通过引入 MuSGD 优化器进一步提升了训练效率。该混合优化器融合了随机梯度下降(SGD)和 Muon,灵感来自大型语言模型(LLM)的训练技术,尤其是 Moonshot AI 的 Kimi K2,可在复杂数据集上实现更快的收敛和更稳定的训练动态。
高级损失函数#
对于无人机影像或 IoT 传感器等要求高精度的任务,YOLO26 引入了 ProgLoss + STAL。这些改进后的损失函数显著提升了小目标识别能力。此外,YOLO26 还全面增强了各类任务:分割任务采用多尺度原型以生成更优的掩码,姿态估计采用残差对数似然估计(RLE)以获得更精细的结果,并使用专用角度损失解决旋转边界框(OBB)检测中的边界问题。
性能分析与对比#
下表使用 COCO 数据集展示了这两种模型的性能差异。每种尺寸类别中表现最佳的数值以粗体标出。
| 模型 | 尺寸 (像素) | mAP验证集 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
分析指标#
数据展现了代际飞跃。YOLO26 在几乎所有指标上都优于 YOLOv8。YOLO26 Nano(YOLO26n)模型的 mAP 达到 40.9,显著高于 YOLOv8n 的 37.3,同时使用的参数和 FLOPs 更少。
CPU 推理速度的提升尤为显著。得益于优化后的架构和 DFL 的移除,YOLO26 通过 ONNX 实现了最高快 43% 的 CPU 推理速度。因此,YOLO26 在 Raspberry Pi 和其他资源有限的边缘设备上表现出众。两种模型通过 TensorRT 实现的 GPU 速度都很有竞争力,但 YOLO26 整体上更高的参数效率意味着训练和推理时的内存占用更低。
易用性与生态系统#
两种模型都能从维护良好的 Ultralytics 生态系统中获益良多。开发者称赞统一 API 易于使用,只需更改模型名称字符串,就能在 YOLOv8 和 YOLO26 之间切换。
无论你是在进行超参数调优、开展实验跟踪,还是探索新的数据集,Ultralytics 文档都提供了丰富的资源。此外,Ultralytics Platform 提供了简便流畅的方式,让你为这些模型添加标注、进行训练,并无缝部署到云端或本地。
代码示例#
开始训练和推理非常简单。下面是一个完整、可直接运行的示例,使用 Ultralytics Python API:
from ultralytics import YOLO
# 加载最新的先进 YOLO26 Nano 模型
model = YOLO("yolo26n.pt")
# 使用 COCO8 数据集训练模型 50 个周期
# optimizer="auto" 会在较长的训练(>10k iterations)中选择 MuSGD,在像本例这样的短训练中选择 AdamW
train_results = model.train(
data="coco8.yaml",
epochs=50,
imgsz=640,
device="cpu", # 使用 '0' 进行 GPU 训练
)
# 对示例图像运行推理
# 无 NMS 设计可提供简洁、快速的预测结果
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# 显示预测结果
results[0].show()
# 轻松导出为 ONNX,以便在 CPU 上部署
export_path = model.export(format="onnx")理想应用场景#
选择合适的模型决定了项目能否成功。
何时选择 YOLO26:
- 边缘计算与机器人:凭借快 43% 的 CPU 速度和无 NMS 设计,它是嵌入式系统、移动设备和自主机器人的绝佳选择。
- 航空与卫星影像:ProgLoss + STAL 的实现让 YOLO26 在复杂高分辨率场景中检测微小目标时具有明显优势。
- 新项目:作为最新的稳定版本,YOLO26 是所有新机器学习流程的推荐模型,可在各类任务中提供更强的通用性。
何时继续使用 YOLOv8:
- 旧版基础设施:如果你当前的生产流程与 YOLOv8 特定的输出张量和 NMS 后处理紧密耦合,迁移时可能需要进行少量适配。
- 学术基线:YOLOv8 仍是学术计算机视觉研究中引用广泛且稳定的基线模型,适用于与较早架构进行比较。
总而言之,YOLOv8 为实时视觉任务树立了卓越的标准,而 YOLO26 则重新定义了可能性。YOLO26 将 CPU 效率的大幅提升与受 LLM 启发的创新训练优化器相结合,让开发者能够在几乎任何硬件环境中部署高精度 AI。