PP-YOLOE+ против DAMO-YOLO#
Непрерывная эволюция компьютерного зрения породила множество узкоспециализированных архитектур для обнаружения объектов в реальном времени. При оценке моделей для промышленных и исследовательских задач часто возникают дискуссии вокруг двух известных фреймворков 2022 года: PP-YOLOE+ от Baidu и DAMO-YOLO от Alibaba Group. Обе модели расширили границы детектирования без использования анкоров, представив новые бэкбоны, продвинутые стратегии назначения меток и специализированные методы слияния признаков.
Это руководство представляет собой подробный технический анализ PP-YOLOE+ и DAMO-YOLO, исследуя их архитектуры, методологии обучения и преимущества при развертывании. Мы также рассмотрим, как эти фреймворки соотносятся с современными решениями, такими как Ultralytics YOLO26, чтобы помочь тебе выбрать подходящий инструмент для твоих конкретных ограничений развертывания.
PP-YOLOE+: Улучшенное промышленное детектирование объектов#
Разработанный в рамках экосистемы Baidu, PP-YOLOE+ представляет собой итеративное улучшение оригинального PP-YOLOE, глубоко оптимизированное для фреймворка глубокого обучения PaddlePaddle. Он был разработан для максимизации точности и скорости инференса на оборудовании серверного класса, что делает его сильным кандидатом для систем промышленного контроля и приложений умного ритейла.
Архитектурные инновации#
PP-YOLOE+ внедряет несколько архитектурных улучшений по сравнению с предыдущими детекторами без анкоров:
- Бэкбон CSPRepResNet: В этом бэкбоне используется архитектура в стиле RepVGG в сочетании с соединениями Cross Stage Partial (CSP), что обеспечивает отличный баланс между способностью к извлечению признаков и задержкой вывода.
- Task Alignment Learning (TAL): PP-YOLOE+ использует продвинутую стратегию динамического назначения меток, которая выравнивает задачи классификации и регрессии в процессе обучения, сокращая разрыв между результатами обучения и вывода.
- Эффективная голова с согласованием задач (ET-head): Упрощенная детектирующая голова, разработанная для быстрой обработки признаков без ущерба для пространственного разрешения, что весьма полезно для поддержания высоких метрик mAP.
Подробности PP-YOLOE+:
- Авторы: Авторы PaddlePaddle
- Организация: Baidu
- Дата: 02.04.2022
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
- Документация: Документация PP-YOLOE+
DAMO-YOLO: Поиск нейронных архитектур для Edge-устройств#
Созданный Академией DAMO Alibaba, DAMO-YOLO использует совершенно иной подход. Вместо ручного проектирования бэкбона исследовательская группа использовала поиск архитектуры нейросетей (NAS) для обнаружения высокоэффективных топологий сетей, адаптированных под строгие ограничения по задержке.
Основные особенности и пайплайн обучения#
DAMO-YOLO делает упор на низкую задержку и высокую точность с помощью автоматизированной методологии, насыщенной дистилляцией:
- Бэкбоны MAE-NAS: Используя метод автоматизации эффективного поиска архитектуры нейросетей, DAMO-YOLO строит бэкбоны, оптимизированные специально для баланса между количеством параметров и точностью.
- Efficient RepGFPN: Репараметризованная обобщенная пирамида признаков (Generalized Feature Pyramid Network) обеспечивает надежное многомасштабное слияние признаков, что помогает модели обнаруживать объекты сильно различающихся размеров в одном кадре.
- Дизайн ZeroHead: Максимально упрощенная детектирующая «голова», которая значительно снижает вычислительные затраты на этапе вывода.
- Улучшение через дистилляцию: Для повышения производительности более компактных вариантов DAMO-YOLO сильно полагается на сложный процесс дистилляции знаний, в котором более крупная модель-учитель направляет модель-ученика.
Подробности DAMO-YOLO:
- Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Документация: Документация DAMO-YOLO
Хотя PP-YOLOE+ и DAMO-YOLO предлагают серьезные теоретические инновации, они жестко привязаны к своим фреймворкам (PaddlePaddle и специфические среды Alibaba). Это может создавать трудности при попытке портировать данные модели для стандартизированного облачного или Edge-развертывания.
Анализ производительности#
При оценке этих моделей баланс между задержкой, вычислительной сложностью (FLOPs) и средним показателем точности (mAP) определяет их идеальную среду развертывания.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
DAMO-YOLO обычно обеспечивает более низкие задержки TensorRT в масштабах nano и tiny, что делает его крайне конкурентоспособным для видеопотоков с высокой пропускной способностью. Тем не менее, PP-YOLOE+ невероятно хорошо масштабируется до своего варианта extra-large (x), достигая первоклассной точности для сложных изображений, где время инференса имеет второстепенное значение.
Преимущество Ultralytics: выход за рамки архитектур 2022 года#
Хотя PP-YOLOE+ и DAMO-YOLO представляли собой значительные вехи, современная разработка требует большей универсальности, более простых конвейеров обучения и меньших требований к памяти. Платформа Ultralytics удовлетворяет эти потребности, предлагая бесшовный опыт, который радикально превосходит сложную дистилляцию и специфичные для фреймворков настройки, требуемые старыми моделями.
Для разработчиков, стремящихся достичь наилучшего баланса производительности сегодня, Ultralytics YOLO26 обеспечивает революционный скачок вперед в эффективности развертывания в реальных условиях.
Почему YOLO26 — лидер индустрии#
Выпущенный в начале 2026 года, YOLO26 развивает наследие YOLO11, внедряя прорывные технологии, адаптированные под производство:
- Сквозной дизайн без NMS: YOLO26 исключает постобработку через подавление немаксимумов (NMS). Это упрощает логику развертывания и обеспечивает стабильные, высокопредсказуемые задержки вывода.
- Оптимизатор MuSGD: Вдохновленный методами обучения больших языковых моделей, YOLO26 использует гибридный оптимизатор MuSGD. Это гарантирует невероятно стабильное обучение и быструю сходимость, экономя ценные часы работы GPU.
- Превосходный инференс на CPU: За счет удаления функции потерь Distribution Focal Loss (DFL) и оптимизации сетевого графа YOLO26 достигает до 43% более быстрого инференса на CPU, что делает его главным выбором для периферийных AI-устройств.
- ProgLoss + STAL: Эти продвинутые функции потерь дают замечательные улучшения в распознавании мелких объектов, что критически важно для управления дронами и дистанционного зондирования.
- Непревзойденная универсальность: В отличие от PP-YOLOE+, который сосредоточен исключительно на детекции, YOLO26 нативно и бесшовно поддерживает оценку позы, сегментацию экземпляров, классификацию изображений и ориентированные ограничивающие рамки (OBB).
Простота использования и эффективность обучения#
Обучение модели DAMO-YOLO требует управления тяжелым пайплайном дистилляции «учитель-ученик». Напротив, обучение модели Ultralytics требует лишь нескольких строк кода на Python, с минимальным использованием памяти CUDA по сравнению с конкурирующими архитектурами.
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model with native MuSGD optimization
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run an end-to-end NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")Идеальные сценарии использования и рекомендации#
Выбор оптимальной архитектуры компьютерного зрения сильно зависит от интеграции в экосистему твоей команды и целей развертывания.
- Выбирай PP-YOLOE+, если твой пайплайн глубоко встроен в экосистему Baidu PaddlePaddle. Это остается отличным выбором для анализа статических изображений на мощных серверах, где главной целью является максимизация точности.
- Выбирай DAMO-YOLO, если ты проводишь специфические исследования алгоритмов поиска нейронных архитектур или если у тебя есть инженерные ресурсы для поддержки сложных пайплайнов дистилляции ради достижения агрессивных целей по задержке в TensorRT.
- Выбирай Ultralytics YOLO26 почти для всех современных производственных сценариев. Экосистема Ultralytics предоставляет непревзойденную документацию, пониженные требования к памяти и оптимизированный API. Независимо от того, создаешь ли ты системы автоматизированного контроля качества или запускаешь трекинг в реальном времени на Raspberry Pi, архитектура YOLO26 без NMS гарантирует быстрые, стабильные и высокоточные результаты «из коробки».
Для разработчиков, изучающих другие передовые решения, документация Ultralytics также предоставляет обширные ресурсы по широко применяемому YOLOv8 и надежному YOLO11, гарантируя наличие подходящей модели для любой задачи компьютерного зрения.