YOLO11 与 YOLO26#
计算机视觉的快速发展不断突破速度、准确率和部署效率的极限。在实时目标检测领域,Ultralytics 始终树立着行业标准。本技术对比探讨了从高度成功的 YOLO11 到前沿的 YOLO26 的演进,分析了它们的架构、性能指标和理想部署场景。
无论你是在构建无人机配送系统还是在优化全球智能制造流水线,理解这两个模型之间的细微差别都将帮助你构建强大且具备未来适应力的 AI 解决方案。
模型传承与生态系统#
这两个模型都受益于全面的 Ultralytics ecosystem,其特点是直观的 API、持续的维护以及充满活力的社区。它们开箱即用地提供了无与伦比的多功能性,自然支持目标检测、实例分割、图像分类、姿态估计和旋转边界框 (OBB) 任务。
YOLO11:久经考验的标准#
YOLO11 发布于 2024 年末,完善了早期版本的先进成果,巩固了其作为生产环境中可靠主力的地位。
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2024-09-27
- GitHub:https://github.com/ultralytics/ultralytics
- 文档: YOLO11 文档
YOLO26:全新前沿#
YOLO26 于 2026 年初推出,代表了边缘计算和端到端架构的范式转移,在处理速度和集成便捷性方面带来了显著提升。
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2026-01-14
- GitHub:https://github.com/ultralytics/ultralytics
- 文档: YOLO26 Documentation
YOLO11 和 YOLO26 都与 Ultralytics Platform 完全集成,为数据集标注、云端训练和集群监控提供无缝的无代码工作流。
架构创新#
虽然 YOLO11 依赖于多年来驱动计算机视觉的传统后处理方法,但 YOLO26 引入了多项旨在消除瓶颈的结构性突破。
端到端无 NMS 设计#
YOLO26 最显著的升级之一是其原生端到端架构。它消除了非极大值抑制 (NMS) 后处理,这一概念最早在 YOLOv10 中开创。绕过 NMS 极大地简化了部署流水线并确保了稳定的延迟,这对于诸如自动驾驶算法等实时应用至关重要。
移除 DFL 以优化边缘端#
YOLO26 移除了分布式焦点损失 (DFL)。虽然 DFL 在 YOLO11 中对于细粒度定位非常有用,但移除它简化了网络的导出图形。这一修改确保了与低功耗硬件的更强兼容性,使 YOLO26 成为 Raspberry Pi 或 NVIDIA Jetson 等边缘设备上的绝对强者。
MuSGD 优化器#
从大语言模型 (LLM) 训练机制(具体为 Moonshot AI's Kimi K2)中汲取灵感,YOLO26 使用了革命性的 MuSGD Optimizer。这种随机梯度下降 (SGD) 与 Muon 的混合体提供了非常稳定的训练运行,其收敛速度比老式架构中使用的标准 AdamW 优化器快得多。
高级损失函数#
YOLO26 集成了 ProgLoss + STAL(渐进式损失与尺度感知任务对齐学习)。这种组合极大地提高了对微小和密集物体的检测能力。此外,YOLO26 引入了任务特定的增强功能:用于语义分割的专用多尺度原型、用于复杂人体姿态估计的残差对数似然估计 (RLE),以及用于缓解 OBB 检测任务中边界问题的专门角度损失。
性能比较#
在评估这些模型时,参数量、计算复杂度(FLOPs)和速度之间的平衡决定了硬件的选择。YOLO26 专门针对 CPU 推理速度进行了优化,与上一代模型相比,CPU 推理速度提升了高达 43%。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
正如所展示的那样,YOLO26 Nano (YOLO26n) 在准确率上实现了显著飞跃,同时使用 ONNX Runtime 将 CPU 推理时间从 56.1ms 缩短至 38.9ms。
使用案例与实际应用#
在 YOLO11 和 YOLO26 之间进行选择,很大程度上取决于你的特定基础设施和项目目标。
边缘计算与物联网#
对于受功率和硬件限制的应用,例如通过无人机进行的智慧农业监测或本地安全报警系统,YOLO26 是无可争议的冠军。DFL 的移除以及 CPU 速度 43% 的提升意味着你可以在没有专用 GPU 的设备上运行复杂的视觉模型,同时保持高帧率。
云端与企业规模#
YOLO11 仍然是企业解决方案的绝佳选择,在这些方案中,庞大的服务器机群已经针对其张量结构进行了优化。它非常适合已经与其特定输出格式深度集成的云端视频分析和大规模媒体处理流水线。
复杂的多任务处理#
如果你的项目需要对微小物体进行精准定位——例如检测电路板上的缺陷或追踪航拍图像中的远处车辆——YOLO26 中的 ProgLoss + STAL 实现为这些困难的边缘情况提供了明显的召回率和精确度提升。
训练效率和内存需求#
Ultralytics 框架的一个主要优势是其在训练期间极低的内存占用。与像 RT-DETR 或较旧的 YOLOv8 这样可能消耗大量 CUDA 内存的庞大视觉 Transformer 不同,YOLO11 和 YOLO26 都经过优化,能够在消费级硬件上高效训练。
YOLO26 中集成 MuSGD 优化器进一步增强了这一点,确保模型更快地找到最优权重,从而减少整体 GPU 计算时数和云计算成本。
这是一个简单的示例,展示了使用原生 Python API 训练最新的 YOLO26 模型有多么轻松:
from ultralytics import YOLO
# Initialize the YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset
# The MuSGD optimizer and efficient memory management are handled automatically
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Run a quick validation to verify the mAP metrics
metrics = model.val()
# Export the trained model to ONNX for fast CPU inference
model.export(format="onnx")探索替代架构#
虽然 YOLO26 代表了实时检测的巅峰,但探索 Ultralytics 文档中的其他模型也大有裨益。对于绑定于传统环境的用户,像 YOLOv5 这样的早期架构仍然提供强劲的性能。对于无法预先定义类别的零样本能力,YOLO-World 提供了由文本提示驱动的开放词汇检测。
结论#
从 YOLO11 到 YOLO26 的跨越不仅仅是一次渐进式更新;它是对实时目标检测模型如何在生产中运行的结构性重塑。通过放弃复杂的后处理步骤并针对边缘优先执行进行优化,YOLO26 成为现代开发者的首选。在强大的 Ultralytics ecosystem 和全面文档的支持下,升级到 YOLO26 确保了几乎所有计算机视觉任务都能实现更快的部署、稳定的训练和 SOTA 准确率。