PP-YOLOE+ и YOLOv10#
Область компьютерного зрения постоянно развивается: новые модели расширяют границы возможностей обнаружения объектов в реальном времени. В этом подробном техническом сравнении мы рассмотрим PP-YOLOE+ и YOLOv10 — две высокопроизводительные архитектуры, разработанные для разных экосистем. Мы также изучим, как общая ситуация меняется в сторону более унифицированных и простых в использовании платформ, таких как Ultralytics Platform, и передовой модели YOLO26.
Введение в модели#
Чтобы выбрать подходящую основу для своих проектов в области компьютерного зрения, тебе нужно хорошо понимать архитектурные компромиссы каждой модели, ограничения развертывания и поддержку экосистемы.
Обзор PP-YOLOE+#
Разработанная авторами PaddlePaddle из Baidu, PP-YOLOE+ представляет собой эволюционный шаг по сравнению с предыдущими версиями в экосистеме PaddleDetection.
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: Репозиторий PaddleDetection
- Документация: Официальная документация PP-YOLOE+
Преимущества: PP-YOLOE+ отлично подходит для сред, тесно интегрированных с фреймворком PaddlePaddle. В модели используется усовершенствованный бэкбон CSPRepResNet и мощная стратегия назначения меток (TAL), обеспечивающая впечатляющее значение средней точности (mAP). Модель хорошо оптимизирована для развертывания на серверных GPU, распространенных в промышленных приложениях по всей Азии.
Недостатки: Главный недостаток PP-YOLOE+ — сильная зависимость от экосистемы PaddlePaddle, которая может быть менее интуитивной для разработчиков, привыкших к PyTorch. Кроме того, для постобработки требуется традиционное подавление немаксимумов (NMS), что увеличивает задержку и усложняет развертывание.
Обзор YOLOv10#
Выпущенная исследователями из Университета Цинхуа, YOLOv10 внесла существенный архитектурный сдвиг, устранив NMS из конвейера инференса.
- Авторы: Ao Wang, Hui Chen, Lihao Liu и др.
- Организация: Университет Цинхуа
- Дата: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: Репозиторий YOLOv10
- Документация: Документация YOLOv10
Преимущества: Ключевая особенность YOLOv10 — согласованное двойное назначение для обучения без NMS. Это означает, что модель изначально предсказывает ограничивающие рамки без дополнительного этапа фильтрации, благодаря чему развертывание модели на периферийных устройствах становится значительно проще и быстрее. Модель обеспечивает отличный баланс между небольшим количеством параметров и высокой точностью.
Недостатки: Хотя YOLOv10 высокоэффективна для стандартного 2D-обнаружения объектов, модель не поддерживает изначально другие важные задачи компьютерного зрения, такие как сегментация экземпляров и оценка позы, что ограничивает ее универсальность в сложных многоцелевых конвейерах.
Сравнение производительности и метрик#
Для выбора подходящей архитектуры важно понимать, как эти модели показывают себя на стандартизированных тестах. Ниже приведено подробное сравнение их размера, точности и задержки.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
Технический анализ#
При анализе данных становятся заметны несколько ключевых тенденций. Нано- и малые модели YOLOv10 активно ориентированы на эффективность на периферийных устройствах: YOLOv10n имеет всего 2,3 миллиона параметров и 6,7B FLOPs. Такая легковесная архитектура в сочетании с отсутствием NMS значительно снижает задержку на платформах, использующих TensorRT и OpenVINO.
В свою очередь, PP-YOLOE+ демонстрирует высокие возможности в более крупных вариантах: версия X-large незначительно опережает YOLOv10x по mAP (54,7% против 54,4%). Однако это достигается ценой почти вдвое большего количества параметров (98,42M против 56,9M), поэтому YOLOv10x оказывается значительно эффективнее в средах с ограниченным объемом памяти.
Преимущества экосистемы Ultralytics#
Хотя PP-YOLOE+ и YOLOv10 обладают впечатляющими техническими характеристиками, современная разработка ML требует большего, чем просто готовая архитектура: необходима экосистема с качественной поддержкой.
Ultralytics предоставляет ведущий в отрасли Python SDK, который значительно упрощает сбор и аннотирование данных, обучение и развертывание. По сравнению с громоздкими исследовательскими фреймворками или устаревшими моделями на базе Transformer, архитектуры Ultralytics требуют лишь малую долю памяти CUDA во время обучения, что позволяет использовать большие размеры пакетов и ускоряет итерации. Кроме того, набор инструментов Ultralytics отличается огромной универсальностью: он из коробки поддерживает классификацию изображений, OBB (ориентированные ограничивающие рамки) и надежное отслеживание объектов.
Представляем YOLO26: следующее поколение#
Выпущенная в январе 2026 года, Ultralytics YOLO26 представляет собой вершину развития компьютерного зрения, объединяя лучшие решения таких моделей, как YOLOv10, и устраняя их ограничения.
Ключевые инновации YOLO26:
- Сквозная архитектура без NMS: Развивая концепцию, впервые представленную в YOLOv10, YOLO26 изначально является сквозной моделью и полностью устраняет постобработку NMS, обеспечивая более быстрое и простое развертывание на различном оборудовании.
- Удаление DFL: Благодаря удалению Distribution Focal Loss (DFL) архитектура модели значительно упрощается для экспорта, обеспечивая безупречную совместимость с маломощными периферийными AI-устройствами.
- Оптимизатор MuSGD: Вдохновленный методами обучения больших языковых моделей, такими как Kimi K2 от Moonshot AI, YOLO26 использует комбинацию SGD и Muon. Это обеспечивает беспрецедентную стабильность обучения и значительно ускоряет сходимость.
- До 43% более быстрый инференс на CPU: YOLO26 глубоко оптимизирована для реальных сценариев и значительно ускоряет приложения, использующие вычисления на CPU, что делает ее идеальной для интеллектуального видеонаблюдения и мобильных развертываний.
- ProgLoss + STAL: Эти улучшенные функции потерь значительно повышают производительность при распознавании небольших объектов — это критически важно для аэрофотосъемки и робототехники.
- Улучшения для конкретных задач: В отличие от YOLOv10, YOLO26 изначально поддерживает multi-scale proto для сегментации и Residual Log-Likelihood Estimation (RLE) для оценки позы.
Практическая реализация#
Начало работы с моделями Ultralytics сделано максимально простым. Всего несколько строк кода позволяют запустить обучение с автоматической настройкой гиперпараметров и современными конвейерами аугментации данных.
from ultralytics import YOLO
# Load the highly recommended YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset
# Memory usage is highly optimized compared to transformer architectures
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Run an end-to-end NMS-free inference
inference_results = model("https://ultralytics.com/images/bus.jpg")
# Export directly to ONNX or TensorRT for deployment
model.export(format="onnx", simplify=True)Варианты применения и рекомендации#
Выбор между PP-YOLOE+ и YOLOv10 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда выбирать PP-YOLOE+#
PP-YOLOE+ — хороший выбор для:
- Интеграция с экосистемой PaddlePaddle: Организации с существующей инфраструктурой, построенной на фреймворке и инструментах PaddlePaddle от Baidu.
- Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании с высокооптимизированными ядрами инференса, специально предназначенными для Paddle Lite или механизма инференса Paddle.
- Высокоточное обнаружение на сервере: Сценарии, в которых приоритетом является максимальная точность обнаружения на мощных GPU-серверах, а зависимость от фреймворка не имеет значения.
Когда выбирать YOLOv10#
YOLOv10 рекомендуется для:
- Обнаружения объектов в реальном времени без NMS: приложений, которым полезно сквозное обнаружение без подавления немаксимумов, что снижает сложность развертывания.
- Сбалансированного соотношения скорости и точности: проектов, требующих удачного баланса между скоростью инференса и точностью обнаружения для моделей разных размеров.
- Приложений со стабильной задержкой: сценариев развертывания, где критически важны предсказуемые времена инференса, например в робототехнике или автономных системах.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Заключение#
PP-YOLOE+ остается надежным вариантом для команд, привязанных к экосистеме Baidu и промышленным серверным средам. YOLOv10 стала выдающимся академическим достижением, доказавшим жизнеспособность обнаружения объектов в реальном времени без NMS.
Однако для разработчиков, которым нужно оптимальное сочетание точности, невероятной скорости инференса и бесшовных возможностей для нескольких задач, Ultralytics YOLO26 — однозначный выбор. Инновации в эффективности обучения и архитектуре развертывания с приоритетом периферийных устройств делают ее наиболее надежным и универсальным решением для производственного компьютерного зрения в 2026 году и далее.