Ultralytics YOLO27:
Get Started

YOLOv8 与 YOLO26#

过去几年,计算机视觉领域取得了显著进展。在实时应用中最受欢迎的架构中,有不少由 Ultralytics 开发。本指南将详细比较开创性的 Ultralytics YOLOv8 和最新的先进模型 Ultralytics YOLO26。我们将分析两者的架构、性能指标和理想应用场景,帮助你为部署选择合适的模型。

模型概述#

YOLOv8 和 YOLO26 都是YOLO 模型家族的重要里程碑。它们秉承 Ultralytics 的核心理念:通过统一的 Python 环境和 API,提供快速、准确且极易使用的模型。

YOLOv8:多用途标准模型#

YOLOv8 于 2023 年初发布,对 YOLO 框架进行了重大革新,引入了无锚框设计,并为多种计算机视觉任务提供了强大的支持。

YOLOv8 凭借出色的性能平衡以及与 Ultralytics 生态系统的深度集成,迅速成为行业标准。它原生支持目标检测、实例分割、姿态估计和图像分类。不过,它依赖标准的非极大值抑制(NMS)进行后处理,这可能会在资源高度受限的边缘环境中造成延迟瓶颈。

YOLO26:新一代边缘计算利器#

YOLO26 于 2026 年 1 月发布,在前代模型奠定的基础上进行了激进优化,以适应现代部署场景,尤其是边缘 AI 和低功耗设备。

YOLO26 引入了多项颠覆性技术改进。最值得关注的是,它采用了端到端无 NMS 设计。这一架构最初由 YOLOv10 开创,无需 NMS 后处理,大幅简化了导出流程,并降低了延迟波动。此外,移除分布焦点损失(DFL)让检测头更加精简,也使模型更适合部署在边缘 AI 硬件上。

其他 Ultralytics 模型

YOLOv8 和 YOLO26 虽然功能强大,你也可以考虑 YOLO11,它通过改进架构衔接了这两代模型;如果需要适配特定的旧版系统,也可以选择 YOLOv5。

架构与训练方面的创新#

YOLO26 带来了多项底层改进,大幅提升了 YOLOv8 基线模型的表现。

使用 MuSGD 优化器提升训练效率#

训练效率是 Ultralytics 模型的一大特点,与 RT-DETR 等庞大的 Transformer 架构相比,这些模型通常对内存的需求低得多。YOLO26 通过引入 MuSGD 优化器进一步提升了训练效率。该混合优化器融合了随机梯度下降(SGD)和 Muon,灵感来自大型语言模型(LLM)的训练技术,尤其是 Moonshot AI 的 Kimi K2,可在复杂数据集上实现更快的收敛和更稳定的训练动态。

高级损失函数#

对于无人机影像或 IoT 传感器等要求高精度的任务,YOLO26 引入了 ProgLoss + STAL。这些改进后的损失函数显著提升了小目标识别能力。此外,YOLO26 还全面增强了各类任务:分割任务采用多尺度原型以生成更优的掩码,姿态估计采用残差对数似然估计(RLE)以获得更精细的结果,并使用专用角度损失解决旋转边界框(OBB)检测中的边界问题。

性能分析与对比#

下表使用 COCO 数据集展示了这两种模型的性能差异。每种尺寸类别中表现最佳的数值以粗体标出。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLO26n64040.938.91.72.45.5
YOLOv8s64044.9128.42.6611.228.6
YOLO26s64048.687.22.59.520.9
YOLOv8m64050.2234.75.8625.978.9
YOLO26m64053.1220.04.720.468.4
YOLOv8l64052.9375.29.0643.7165.1
YOLO26l64055.0286.26.224.886.8
YOLOv8x64053.9479.114.3768.2257.8
YOLO26x64057.5525.811.855.7194.4

分析指标#

数据展现了代际飞跃。YOLO26 在几乎所有指标上都优于 YOLOv8。YOLO26 Nano(YOLO26n)模型的 mAP 达到 40.9,显著高于 YOLOv8n 的 37.3,同时使用的参数和 FLOPs 更少。

CPU 推理速度的提升尤为显著。得益于优化后的架构和 DFL 的移除,YOLO26 通过 ONNX 实现了最高快 43% 的 CPU 推理速度。因此,YOLO26 在 Raspberry Pi 和其他资源有限的边缘设备上表现出众。两种模型通过 TensorRT 实现的 GPU 速度都很有竞争力,但 YOLO26 整体上更高的参数效率意味着训练和推理时的内存占用更低。

易用性与生态系统#

两种模型都能从维护良好的 Ultralytics 生态系统中获益良多。开发者称赞统一 API 易于使用,只需更改模型名称字符串,就能在 YOLOv8 和 YOLO26 之间切换。

无论你是在进行超参数调优、开展实验跟踪,还是探索新的数据集,Ultralytics 文档都提供了丰富的资源。此外,Ultralytics Platform 提供了简便流畅的方式,让你为这些模型添加标注、进行训练,并无缝部署到云端或本地。

代码示例#

开始训练和推理非常简单。下面是一个完整、可直接运行的示例,使用 Ultralytics Python API:

from ultralytics import YOLO

# 加载最新的先进 YOLO26 Nano 模型
model = YOLO("yolo26n.pt")

# 使用 COCO8 数据集训练模型 50 个周期
# optimizer="auto" 会在较长的训练(>10k iterations)中选择 MuSGD,在像本例这样的短训练中选择 AdamW
train_results = model.train(
    data="coco8.yaml",
    epochs=50,
    imgsz=640,
    device="cpu",  # 使用 '0' 进行 GPU 训练
)

# 对示例图像运行推理
# 无 NMS 设计可提供简洁、快速的预测结果
results = model("https://ultralytics.com/images/bus.jpg", nms=False)

# 显示预测结果
results[0].show()

# 轻松导出为 ONNX,以便在 CPU 上部署
export_path = model.export(format="onnx")
部署简便

由于采用无 NMS 架构,YOLO26 导出到 CoreML 或 OpenVINO 等格式的过程比旧版模型顺畅得多,因为该架构从导出的计算图中移除了复杂的自定义操作。

理想应用场景#

选择合适的模型决定了项目能否成功。

何时选择 YOLO26:

  • 边缘计算与机器人:凭借快 43% 的 CPU 速度和无 NMS 设计,它是嵌入式系统、移动设备和自主机器人的绝佳选择。
  • 航空与卫星影像:ProgLoss + STAL 的实现让 YOLO26 在复杂高分辨率场景中检测微小目标时具有明显优势。
  • 新项目:作为最新的稳定版本,YOLO26 是所有新机器学习流程的推荐模型,可在各类任务中提供更强的通用性。

何时继续使用 YOLOv8:

  • 旧版基础设施:如果你当前的生产流程与 YOLOv8 特定的输出张量和 NMS 后处理紧密耦合,迁移时可能需要进行少量适配。
  • 学术基线:YOLOv8 仍是学术计算机视觉研究中引用广泛且稳定的基线模型,适用于与较早架构进行比较。

总而言之,YOLOv8 为实时视觉任务树立了卓越的标准,而 YOLO26 则重新定义了可能性。YOLO26 将 CPU 效率的大幅提升与受 LLM 启发的创新训练优化器相结合,让开发者能够在几乎任何硬件环境中部署高精度 AI。

评论