Ultralytics YOLO27:

YOLO26 与 YOLOv8#

计算机视觉的发展一直由一个目标定义:在不牺牲准确性的情况下实现实时性能。随着开发者和研究人员探索现代机器学习领域,选择合适的模型架构至关重要。这篇全面的技术对比将探讨从 Ultralytics YOLOv8 到尖端的 Ultralytics YOLO26 这一代际跃迁。YOLOv8 是一种在 2023 年重新定义行业标准、广受欢迎的架构,而 YOLO26 于 2026 年 1 月发布。

通过深入研究二者的架构、性能指标和训练方法,我们将说明,升级到最新创新技术为何能为目标检测、分割及更多任务带来显著优势。

模型背景与元数据#

了解这些架构的起源,有助于理解它们各自取得突破的背景。这两个模型都由 Ultralytics 开发。Ultralytics 以让先进的 AI 变得易于使用和部署而闻名。

YOLO26 详情:

YOLOv8 详情:

架构创新#

从 YOLOv8 到 YOLO26 的转变,引入了神经网络处理视觉数据和计算损失方式的重大范式转变。

YOLO26:边缘效率的巅峰#

YOLO26 从零开始设计,旨在消除部署瓶颈,并最大限度地提升受限硬件上的推理速度。

  • 端到端的无 NMS 设计: YOLO26 延续了 YOLOv10 首创的理念,原生采用端到端架构。通过完全消除对非极大值抑制(NMS)后处理的需求,延迟波动几乎被彻底消除。这简化了需要严格实时保证的应用的部署逻辑。
  • 移除 DFL: 移除分布式焦点损失(DFL)大幅简化了输出头。这一架构选择显著提升了与低功耗边缘设备的兼容性,并简化了导出为 ONNXCoreML 等格式的过程。
  • MuSGD 优化器: YOLO26 借鉴了 Moonshot AI 的 Kimi K2 等大型语言模型(LLMs)展现出的训练稳定性,采用 MuSGD 优化器——随机梯度下降与 Muon 的混合优化器。这将 LLM 规模的训练创新引入计算机视觉,实现更快的收敛和高度稳定的训练过程。
  • ProgLoss + STAL: 为了解决识别微小目标这一出了名的高难度问题,YOLO26 实现了渐进式损失(ProgLoss)与小目标感知标签分配(STAL)相结合的方案。这为小目标检测提供了关键改进,使其非常适合无人机应用。
针对任务的改进

YOLO26 还针对多个计算机视觉领域进行了升级。它采用语义分割损失和多尺度原型,以改进实例分割;采用残差对数似然估计(RLE),以实现高精度的姿态估计;并采用专门的角度损失算法,解决有向边界框(OBB)中的边界问题。

YOLOv8:高度通用的主力模型#

YOLOv8 于 2023 年发布时,通过全面转向无锚框设计树立了新的基准,并能更好地适应不同数据集的宽高比。

  • C2f 模块: 它用 C2f 模块取代了较早的 C3 模块,从而改善了网络主干中的梯度流。
  • 解耦头: YOLOv8 采用解耦头,分类和边界框回归分别计算,从而显著提升平均精度均值(mAP)。
  • 任务通用性: 它是首批开箱即用地为图像分类、检测、分割和姿态任务提供真正统一 API 的模型之一。

性能指标与资源需求#

在生产环境中评估模型时,准确率、推理速度和模型大小之间的平衡至关重要。YOLO26 在所有尺寸变体中都展现出明显的代际优势。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8

注意:突出显示的数值体现了 YOLO26 架构相较其前代产品在性能平衡和效率方面的提升。

分析#

与类似的 YOLOv8 模型相比,YOLO26 的 CPU 推理速度最高提升 43%。例如,YOLO26n 使用 ONNX 在 CPU 上的耗时为 38.9 毫秒,而 YOLOv8n 的耗时为 80.4 毫秒,同时 mAP 从 37.3 提升至 40.9。CPU 效率的大幅提升直接得益于移除 DFL 和采用无 NMS 设计,使 YOLO26 成为缺少专用 GPU 的环境中的强大方案。

此外,YOLO26 模型在各自尺寸级别上的参数量和 FLOPs 更低,因此与传统的基于 Transformer 的架构相比,它们在推理和训练期间所需的GPU 内存大幅减少。

Ultralytics 生态系统优势#

选择 AI 模型时,一个重要考量是其周边基础设施。YOLO26 和 YOLOv8 都受益于统一的 Ultralytics Platform,为开发者提供了无与伦比的使用体验。

  1. 易用性: “从零到精通”的理念确保开发者只需少量代码即可加载、训练和导出模型。Python API 在不同模型代际之间保持一致。
  2. 训练效率: 与基于 Transformer 的模型(如 RT-DETR)相比,Ultralytics YOLO 模型在训练过程中所需的 CUDA 内存显著更少。这让你可以在消费级硬件上使用更大的批量大小,推动 AI 研究普及化。
  3. 维护完善的生态系统: 在持续更新、严格的 CI/CD 流程以及与 Weights & BiasesTensorRT 等工具的深度集成支持下,Ultralytics 代码库稳健且适合生产环境。
  4. 无与伦比的通用性: Ultralytics 模型并非只能完成单一任务;一次导入即可处理多样化数据集,为需要同时进行跟踪、分类和分割的复杂系统优化工作流。
简化升级

由于 Ultralytics API 高度标准化,将生产系统从 YOLOv8 升级到 YOLO26 非常简单,只需在脚本中将字符串 "yolov8n.pt" 改为 "yolo26n.pt" 即可。

实际应用#

在这两个模型之间进行选择通常取决于你的部署限制,不过对于新项目,普遍推荐使用 YOLO26。

边缘计算与 IoT 网络#

对于边缘环境,例如 Raspberry Pi 部署或本地化工厂车间传感器,YOLO26 是当之无愧的首选。其原生优化的 CPU 速度和无 NMS 结构意味着智能摄像头可以处理高帧率视频,用于停车管理,而不会因后处理瓶颈而丢帧。

高空与航空影像#

农业监测或通过无人机进行基础设施巡检时,小目标检测至关重要。YOLO26 中的 ProgLoss + STAL 实现能够持续检测旧架构(如 YOLOv8)可能遗漏的微小害虫或管道微裂纹,并在 VisDrone 等数据集上提供更高的召回率和精确率。

旧款 GPU 系统#

对于与特定边界框回归输出深度耦合的系统,或已锁定在漫长验证周期中、无法轻易迁移架构的企业部署,YOLOv8 仍然具有实用价值。

使用场景与建议#

在 YOLO26 和 YOLOv8 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLO26#

以下情况适合选择 YOLO26:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

何时选择 YOLOv8#

以下情况推荐使用 YOLOv8:

  • 通用多任务部署: 需要在 Ultralytics 生态系统中使用成熟模型执行检测分割分类姿态估计的项目。
  • 成熟的生产系统: 已经基于 YOLOv8 架构构建,并拥有稳定且经过充分测试的部署流程的现有生产环境。
  • 广泛的社区和生态系统支持: 能够受益于 YOLOv8 丰富教程、第三方集成和活跃社区资源的应用。

代码示例:快速入门#

借助最新的 Ultralytics 模型,你可以非常轻松地开展工作。下面的 Python 代码演示了如何在自定义数据集上训练 YOLO26 模型,并观察 MuSGD 优化器自动推动快速收敛。

from ultralytics import YOLO

# Load the highly efficient YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the standard COCO8 dataset
# The ecosystem handles hyperparameter tuning and augmentations natively
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Automatically utilizes CUDA if available
)

# Run end-to-end, NMS-free inference on a source image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Visualize the resulting detections
predictions[0].show()

其他值得考虑的模型#

虽然 YOLO26 代表了当前的先进水平,但构建多样化应用的开发者也可以考虑:

  • YOLO11:YOLO26 的直接前代产品,在 YOLOv8 的基础上进行了出色改进,目前仍广泛用于尖端生产系统。
  • RT-DETR:百度的实时检测 Transformer。对于探索视觉任务中注意力机制的研究人员来说,这是一个非常出色的选择,但与标准 Ultralytics YOLO 模型相比,它训练时需要明显更多的 CUDA 内存。

如需全面的云端训练、数据集标注和即时部署方案,立即探索 Ultralytics Platform

评论