Ultralytics YOLO27:

YOLO11 与 YOLO26#

计算机视觉的快速演进不断突破速度、准确率和部署效率的边界。在实时目标检测领域,Ultralytics始终树立着行业标准。本技术对比将探讨从广受认可的 YOLO11 到前沿的 YOLO26 的演进,分析它们的架构、性能指标和理想部署场景。

无论你是在构建无人机配送系统,还是在优化全球化的智能制造流程,了解这两个模型之间的细微差异,都能帮助你构建稳健且面向未来的 AI 解决方案。

模型沿革与生态系统#

两款模型都受益于完善的 Ultralytics 生态系统,该生态系统以简洁易用的 API、持续维护和活跃的社区为特色。它们提供了无与伦比的灵活性,开箱即用地支持目标检测实例分割图像分类姿态估计定向边界框(OBB)任务。

YOLO11:成熟的行业标准#

YOLO11 于 2024 年末发布,在完善前几代产品创新成果的基础上,巩固了其作为生产环境可靠主力模型的地位。

YOLO26:全新前沿#

YOLO26 于 2026 年初推出,代表了边缘计算和端到端架构的范式转变,在处理速度和集成便捷性方面带来了显著提升。

数据与部署管理

YOLO11 和 YOLO26 都与 Ultralytics 平台完全集成,为数据集标注、云端训练和设备群监控提供无缝的无代码工作流。

架构创新#

YOLO11 依赖多年来推动计算机视觉发展的传统后处理方法,而 YOLO26 则引入了多项旨在消除瓶颈的结构性突破。

端到端无 NMS 设计#

YOLO26 最重要的升级之一是其原生端到端架构。它消除了非极大值抑制(NMS)后处理,这一理念最早由 YOLOv10 首次提出。绕过 NMS 大幅简化了部署流程,并确保延迟稳定一致,这对于自动驾驶算法等实时应用至关重要。

面向边缘优化的 DFL 移除#

YOLO26 移除了分布焦点损失(DFL)。DFL 在 YOLO11 中有助于实现精细定位,但移除它可以简化网络的导出图。这项修改确保了与低功耗硬件的更好兼容性,使 YOLO26 成为运行在 Raspberry PiNVIDIA Jetson 等边缘设备上的强大模型。

MuSGD 优化器#

YOLO26 从大型语言模型(LLM)的训练机制中汲取灵感,尤其是 Moonshot AI 的 Kimi K2,并采用了革命性的 MuSGD 优化器。这种随机梯度下降(SGD)与 Muon 的混合优化器能够带来极其稳定的训练过程,收敛速度远快于旧架构使用的标准 AdamW 优化器。

高级损失函数#

YOLO26 结合了 ProgLoss + STAL(渐进式损失与小目标感知标签分配)。这种组合大幅提升了对小型和密集排列的检测能力。此外,YOLO26 引入了特定任务的增强功能:用于语义分割的专用多尺度原型、用于复杂人体姿态估计的残差对数似然估计(RLE),以及用于缓解 OBB 检测任务中边界问题的专用角度损失。

性能对比#

评估这些模型时,参数量、计算复杂度(FLOPs)和速度之间的平衡决定了硬件选择。YOLO26 专门针对 CPU 推理速度进行了优化,与其前代产品相比,CPU 推理速度最高提升 43%

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

如图所示,YOLO26 Nano(YOLO26n)的准确率显著提升,同时借助 ONNX Runtime,将 CPU 推理时间从 56.1ms 缩短至 38.9ms。

导出以实现最高速度

要充分释放这些模型的性能,请在 NVIDIA 硬件上使用 TensorRT 导出,或针对 Intel CPU 使用 OpenVINO 导出。YOLO26 的无 NMS 设计让这一导出过程比以往更加顺畅。

用例与实际应用#

在 YOLO11 和 YOLO26 之间进行选择,主要取决于你的具体基础设施和项目目标。

边缘计算与物联网#

对于受功耗和硬件限制的应用,例如通过无人机进行智能农业监测或本地安全警报系统YOLO26 是无可争议的首选。移除 DFL 并将 CPU 速度提升 43%,意味着你可以在没有专用 GPU 的设备上运行复杂的视觉模型,同时保持较高的帧率。

云端与企业级规模#

YOLO11 依然是企业级解决方案的杰出选择,因为庞大的服务器集群已经为其张量结构进行了优化。它非常适用于已经与其特定输出格式深度集成的基于云的视频分析和大规模型媒体处理管道。

复杂多任务处理#

如果你的项目要求对微小目标进行精准识别,例如检测电路板缺陷或跟踪航拍图像中的远距离车辆,那么 YOLO26 中的 ProgLoss + STAL 实现可以显著提升这些困难边缘案例的召回率和精确率。

训练效率与内存需求#

Ultralytics 框架的一个主要优势在于其在训练过程中极低的内存占用。与像 RT-DETR 这样可能会消耗大量 CUDA 内存的大型视觉 Transformer 不同,YOLO11 和 YOLO26 都经过了优化,能够在消费级硬件上高效训练。

YOLO26 中集成 MuSGD 优化器进一步增强了这一点,确保模型更快地找到最优权重,从而减少整体的 GPU 计算时间和云计算成本。

下面是一个简单示例,展示如何使用原生 Python API 轻松训练最新的 YOLO26 模型:

from ultralytics import YOLO

# Initialize the YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset
# The MuSGD optimizer and efficient memory management are handled automatically
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Run a quick validation to verify the mAP metrics
metrics = model.val()

# Export the trained model to ONNX for fast CPU inference
model.export(format="onnx")

探索替代架构#

虽然 YOLO26 代表了实时检测的巅峰,但探索 Ultralytics 文档中的其他模型也会有所帮助。对于受遗留环境限制的用户,较早的架构(如 YOLOv5)仍能提供稳健的性能。对于无法预先定义类别的零样本场景,YOLO-World 可以通过文本提示实现开放词汇检测。

结论#

从 YOLO11 到 YOLO26 的跃迁并不仅仅是渐进式更新,而是对实时目标检测模型在生产环境中运行方式的结构性重构。通过舍弃复杂的后处理步骤并针对边缘优先执行进行优化,YOLO26 成为了现代开发者的首选。依托稳健的 Ultralytics 生态系统和完善的文档,升级到 YOLO26 可确保更快的部署、稳定的训练,以及几乎适用于任何计算机视觉任务的 SOTA 准确率。

评论