PP-YOLOE+ и YOLOv5#
При выборе подходящего фреймворка глубокого обучения для компьютерного зрения разработчики часто сравнивают возможности разных архитектур, чтобы найти оптимальный баланс скорости, точности и простоты развёртывания. В этом подробном обзоре мы рассмотрим технические особенности PP-YOLOE+ и YOLOv5. Анализ архитектур, показателей производительности и подходящих сценариев развёртывания поможет тебе принять обоснованное решение для следующего проекта — будь то робототехника реального времени, развёртывание на периферийных устройствах или облачная видеоаналитика.
Происхождение моделей и метаданные#
Обе модели созданы сильными инженерными командами, но ориентированы на несколько разные экосистемы. Знание их происхождения помогает лучше понять особенности архитектурных решений.
Подробности о PP-YOLOE+:
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Документация: README PaddleDetection
Сведения о YOLOv5:
- Авторы: Glenn Jocher
- Организация: Ultralytics
- Дата: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Документация: https://docs.ultralytics.com/models/yolov5
Сравнение архитектур#
Архитектура PP-YOLOE+#
PP-YOLOE+ — развитие моделей экосистемы Baidu, построенное на основе предыдущих решений, таких как PP-YOLOv2. В ней используется тщательно оптимизированный бэкбон CSPRepResNet, улучшающий извлечение признаков за счёт сочетания принципов сетей с частичными связями между этапами (CSP) и методов перепараметризации. Благодаря этому модель сохраняет высокую точность при обучении, а затем преобразуется в более компактную архитектуру для ускорения инференса.
Кроме того, в PP-YOLOE+ применяются обучение с выравниванием задач (TAL) и эффективная голова с выравниванием задач (ET-head). Их сочетание помогает устранить несогласованность между классификацией и локализацией — типичное узкое место плотных детекторов объектов. Несмотря на впечатляющую структуру, архитектура тесно связана с фреймворком PaddlePaddle, что может затруднить интеграцию для команд, использующих другие распространённые библиотеки машинного обучения.
Архитектура YOLOv5#
В отличие от неё, YOLOv5 изначально создана на PyTorch — отраслевом стандарте для академических исследований и корпоративного производства. В модели используется модифицированный бэкбон CSPDarknet53, известный эффективной передачей градиента и экономным использованием параметров.
Отличительная особенность YOLOv5 — алгоритм AutoAnchor, который перед обучением автоматически проверяет и настраивает размеры анкерных рамок с учётом твоего пользовательского набора данных. Это избавляет от ручной настройки гиперпараметров ограничивающих рамок. Шейк сети агрегации путей (PANet) обеспечивает надёжное слияние признаков разных масштабов, позволяя эффективно обнаруживать объекты разных размеров.
Поскольку YOLOv5 создана непосредственно на PyTorch, для экспорта в оптимизированные форматы, такие как ONNX и TensorRT, требуется значительно меньше настройки промежуточного ПО, чем для моделей, привязанных к локальным фреймворкам.
Анализ производительности#
При оценке этих моделей нужно учитывать компромисс между средней точностью (mAP) и задержкой. В таблице ниже представлены показатели для моделей разных размеров.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
PP-YOLOE+ демонстрирует весьма конкурентоспособные показатели mAP для крупных моделей, например варианта X, а YOLOv5 быстрее и использует меньше параметров в нижней части спектра. Для YOLOv5 Nano (YOLOv5n) требуется всего 1,9 миллиона параметров, поэтому модель хорошо подходит для периферийных устройств с жёсткими ограничениями по памяти. Кроме того, для обучения моделей YOLO обычно требуется меньше памяти CUDA, чем для крупных архитектур на основе Transformer, таких как RT-DETR.
Преимущества Ultralytics#
При выборе архитектуры одних только численных показателей недостаточно. Успех проекта в реальных условиях часто зависит от удобства разработки, поддержки экосистемы и конвейеров развёртывания. Именно здесь модели Ultralytics особенно хороши.
Непревзойдённое удобство использования#
Python API Ultralytics избавляет разработчиков от необходимости писать сложный шаблонный код. С его помощью можно легко запускать обучение, проверять производительность и развёртывать модели. Подробная документация постоянно обновляется, а её поддерживает большое международное сообщество разработчиков открытого ПО.
Универсальность для разных задач#
PP-YOLOE+ — специализированный детектор объектов, а экосистема Ultralytics позволяет решать множество задач компьютерного зрения с помощью единого API. С YOLOv5 и последующими моделями можно без труда перейти от обычных ограничивающих рамок к рабочим процессам сегментации изображений и классификации.
Пример кода: обучение YOLOv5#
Для начала работы достаточно нескольких строк кода. Благодаря такой простоте циклы исследований и разработок значительно ускоряются.
from ultralytics import YOLO
# Загрузить предварительно обученную малую модель YOLOv5
model = YOLO("yolov5su.pt") # YOLOv5u: веса YOLOv5 без якорей для пакета ultralytics
# Обучи модель на датасете COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Выполнить быстрый инференс изображения
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()Примеры применения в реальных условиях#
Когда стоит выбрать PP-YOLOE+: Если твоя организация глубоко интегрирована в программный стек Baidu или активно использует специализированное оборудование, для которого необходим фреймворк PaddlePaddle, PP-YOLOE+ станет надёжным решением. Модель часто используется в специализированных производственных конвейерах Азии, где уже есть интеграция с Paddle.
Когда стоит выбрать YOLOv5: Для подавляющего большинства международных разработчиков, исследователей и предприятий YOLOv5 остаётся мощным решением. Благодаря PyTorch в основе модель сразу совместима с инструментами отслеживания, такими как Weights & Biases, и без проблем экспортируется в TensorRT для ускорения на GPU NVIDIA или в CoreML для устройств Apple. Модель эффективна в самых разных областях — от мониторинга сельскохозяйственных культур до скоростной навигации дронов.
Будущее обнаружения объектов: Ultralytics YOLO26#
YOLOv5 — знаковая модель, но передовые разработки в компьютерном зрении ушли вперёд. Для всех новых проектов мы настоятельно рекомендуем перейти на YOLO26, выпущенную в январе 2026 года. YOLO26 доступна на платформе Ultralytics и полностью переосмысливает эффективность.
Ключевые инновации YOLO26:
- Сквозная архитектура без NMS: дополнительная голова YOLO26 с соответствием один к одному (
nms=False) полностью пропускает постобработку с подавлением немаксимумов. Это значительно уменьшает колебания задержки и упрощает конвейер развёртывания. - Инференс на CPU до 43% быстрее: благодаря целенаправленному удалению Distribution Focal Loss (DFL) YOLO26 значительно ускоряет работу периферийных устройств без GPU.
- Оптимизатор MuSGD: вдохновлённый ведущими большими языковыми моделями гибридный оптимизатор стабилизирует динамику обучения и значительно ускоряет сходимость на пользовательских наборах данных.
- Улучшения для конкретных задач: передовые функции потерь, такие как ProgLoss и STAL, обеспечивают беспрецедентную точность при обнаружении крошечных объектов. Модель изначально поддерживает обнаружение ориентированных ограничивающих рамок (OBB) на аэрофотоснимках.
Если ты изучаешь передовые модели компьютерного зрения, тебе также может быть интересно сравнить предыдущее поколение YOLO11 или подходы на основе Transformer, такие как RT-DETR. Благодаря надёжной экосистеме и передовым архитектурным решениям Ultralytics остаётся лучшим выбором для современных задач компьютерного зрения.