Ultralytics YOLO27:
Get Started

YOLOv5 и YOLO11#

При выборе архитектуры компьютерного зрения для нового проекта важно понимать, как развивались передовые модели. Переход от ранних архитектур к современным универсальным платформам демонстрирует значительный прогресс как в эффективности алгоритмов, так и в удобстве работы разработчиков. В этом руководстве подробно сравниваются две знаковые модели от Ultralytics: новаторская YOLOv5 и значительно усовершенствованная YOLO11.

Знакомство с моделями#

Обе архитектуры стали важными вехами в области обнаружения объектов в реальном времени. У каждой есть свои преимущества, которые зависят от среды развертывания и требований к совместимости с унаследованными системами.

YOLOv5: рабочая лошадка индустрии#

Выпущенная летом 2020 года, YOLOv5 быстро стала отраслевым стандартом благодаря собственной реализации на PyTorch, значительно снизившей порог входа для обучения и развертывания. Вместо сложных фреймворков Darknet на C, использовавшихся в предшественниках, модель предложила подход к созданию моделей в духе Python.

YOLOv5 задала высокий стандарт простоты использования и внедрила эффективные методики обучения, включая продвинутую мозаичную аугментацию данных и автоматический подбор якорей. Модель по-прежнему очень популярна среди исследователей, которым нужна хорошо документированная и тщательно протестированная кодовая база.

YOLO11: универсальная платформа для компьютерного зрения#

YOLO11 появилась благодаря многолетней обратной связи и исследованиям архитектур. Она стала частью универсальной платформы, изначально способной решать множество задач компьютерного зрения. Выходя за рамки одних лишь ограничивающих рамок, модель создавалась с нуля ради максимальной универсальности и эффективности.

YOLO11 обеспечивает удобную работу с Python-пакетом ultralytics и простой API, объединяющим обнаружение объектов, сегментацию экземпляров, классификацию, оценку позы и ориентированные ограничивающие рамки (OBB). Модель обеспечивает удачный баланс скорости и точности, поэтому подходит для самых разных сценариев развертывания в реальных условиях.

Интегрированная платформа

Обе модели используют хорошо поддерживаемую экосистему, доступную на платформе Ultralytics. Эта интегрированная среда упрощает разметку наборов данных, облачное обучение и экспорт моделей для различных целевых аппаратных платформ.

Сравнение производительности и метрик#

Прямое сравнение моделей показывает, как усовершенствования архитектуры приводят к заметному росту производительности. В таблице ниже приведены значения средней точности (mAP) на наборе данных COCO, а также скорость инференса на CPU и GPU и количество параметров.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Анализ результатов#

Метрики наглядно показывают, что YOLO11 обеспечивает более сбалансированную производительность. Например, модель YOLO11n (nano) достигает 39.5% mAP против 28.0% у YOLOv5n — прирост на 11.5 пункта при увеличении числа параметров всего на 0.7M. Кроме того, при обучении YOLO11 требуется заметно меньше памяти, чем тяжёлым моделям на основе Transformer, поэтому её проще запускать на потребительском оборудовании и периферийных устройствах.

Архитектурные различия#

Рост производительности YOLO11 обусловлен несколькими важными изменениями архитектуры. В YOLOv5 использовалась стандартная основа CSPNet с модулями C3, а в более новых моделях Ultralytics появились эффективные блоки извлечения признаков, такие как C2f (YOLOv8) и C3k2 (YOLO11). Они оптимизируют поток градиентов и сокращают вычислительные затраты.

В YOLO11 также значительно усовершенствована голова модели. В новых архитектурах Ultralytics вместо якорного подхода, применявшегося в старых моделях, используется безъякорная схема. Она сокращает количество предсказаний рамок, упрощает конвейер постобработки и улучшает способность модели обобщать данные при разных масштабах и соотношениях сторон. Кроме того, эти модели обеспечивают более высокую эффективность обучения, а готовые предобученные веса ускоряют сходимость при дообучении на новых наборах данных.

Реализация и примеры кода#

Одно из главных преимуществ экосистемы Ultralytics — простота. YOLOv5 сделала популярным пакет torch.hub для быстрого инференса, а YOLO11 развивает этот подход благодаря универсальному пакету Python ultralytics.

Обучение с YOLO11#

Для загрузки, обучения и валидации модели требуется совсем немного шаблонного кода. API легко справляется с подбором гиперпараметров и управлением моделями.

from ultralytics import YOLO

# Загрузи предварительно обученную модель YOLO11
model = YOLO("yolo11s.pt")

# # Обучи модель на пользовательском наборе данных в течение 50 эпох
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# # Запусти быстрый инференс и отобрази результаты
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# # Легко экспортируй модель в TensorRT для аппаратного ускорения
model.export(format="engine")

Инференс на устаревших системах с YOLOv5#

Если ты поддерживаешь старый конвейер, YOLOv5 напрямую использует встроенный механизм загрузки PyTorch, поэтому её легко подключить к существующим скриптам инференса.

import torch

# # Загрузи пользовательскую или предварительно обученную модель YOLOv5 из PyTorch Hub
model = torch.hub.load("ultralytics/yolov5", "yolov5s")

# # Выполни инференс по URL изображения
results = model("https://ultralytics.com/images/zidane.jpg")

# # Выведи сведения о предсказаниях в консоль
results.print()
Гибкость развертывания

Обе модели поддерживают множество форматов экспорта. Независимо от того, разворачиваешь ли ты модель на NVIDIA Jetson с помощью TensorRT или создаёшь приложение для iOS с использованием CoreML, процесс развертывания подробно документирован и поддерживается сообществом.

Оптимальные сценарии применения#

Выбор модели во многом зависит от этапа жизненного цикла проекта и конкретных требований.

Когда стоит выбрать YOLOv5#

  • Поддержка устаревших кодовых баз: если производственная среда сильно завязана на структуру репозитория YOLOv5 или конкретные методы подбора гиперпараметров.
  • Академические базовые модели: если для публикации исследования требуется прямое сравнение с признанными стандартами компьютерного зрения 2020–2022 годов.

Когда выбирать YOLO11#

  • Проекты с несколькими задачами: если приложению нужно решать несколько задач, например оценивать позу и выполнять сегментацию экземпляров, через единый универсальный API.
  • Развертывание на периферийных устройствах: для сценариев периферийных вычислений, где критически важно добиться максимального mAP при заданном вычислительном бюджете (FLOPs).
  • Коммерческие решения на базе ИИ: идеально подходит для корпоративных приложений в розничной торговле и сфере безопасности благодаря надёжной поддержке платформы Ultralytics.

Следующее поколение: Ultralytics YOLO26#

YOLO11 обеспечивает отличный баланс скорости и точности, но область искусственного интеллекта развивается стремительно. Разработчикам, которые начинают новые проекты сегодня, мы настоятельно рекомендуем изучить новейший стандарт визуального ИИ: Ultralytics YOLO26.

Выпущенная в январе 2026 года, YOLO26 предлагает революционные усовершенствования, специально разработанные для современных требований к развертыванию:

  • Сквозная архитектура без NMS: опираясь на идеи, впервые реализованные в YOLOv10, YOLO26 изначально построена как сквозная модель. Дополнительная голова один-к-одному (nms=False) позволяет отказаться от постобработки с подавлением немаксимумов (NMS), существенно упрощая конвейеры развертывания и снижая задержку.
  • Оптимизатор MuSGD: этот гибрид SGD и Muon, вдохновлённый новшествами в обучении больших языковых моделей, например Kimi K2 от Moonshot AI, обеспечивает исключительно стабильное обучение и значительно ускоряет сходимость.
  • Непревзойдённая скорость на CPU: отказ от Distribution Focal Loss (DFL) позволяет YOLO26 выполнять инференс на CPU до 43% быстрее, поэтому она оптимально подходит для периферийных устройств и сред без выделенных GPU.
  • Продвинутые функции потерь: благодаря ProgLoss и STAL заметно улучшается распознавание мелких объектов, что особенно важно для анализа данных с дронов, IoT и робототехники.
  • Усовершенствования для конкретных задач: модель включает специализированные оптимизации, например оценку остаточного логарифмического правдоподобия (RLE) для оценки позы и специальную функцию потерь по углу для ориентированных ограничивающих рамок, что обеспечивает высокую производительность во всех задачах компьютерного зрения.

Если тебя интересуют специализированные архитектуры для задач, выходящих за рамки стандартного обнаружения объектов, присмотрись к RT-DETR для обнаружения на основе Transformer или к YOLO-World для обнаружения и отслеживания объектов с открытым словарём. Эти хорошо поддерживаемые и тщательно оптимизированные инструменты помогут сделать конвейеры компьютерного зрения эффективными, масштабируемыми и современными.

Комментарии