PP-YOLOE+ и DAMO-YOLO#
Непрерывная эволюция компьютерного зрения привела к появлению множества узкоспециализированных архитектур для обнаружения объектов в реальном времени. При оценке моделей для промышленных и исследовательских задач часто рассматривают два заметных фреймворка 2022 года: PP-YOLOE+ от Baidu и DAMO-YOLO от Alibaba Group. Обе модели расширили возможности безанкорного обнаружения, представив новые backbone-архитектуры, продвинутые стратегии назначения меток и специализированные методы слияния признаков.
В этом руководстве приведён подробный технический анализ PP-YOLOE+ и DAMO-YOLO с рассмотрением их архитектур, методик обучения и преимуществ при развёртывании. Мы также сравним эти фреймворки с современными решениями, такими как Ultralytics YOLO26, чтобы помочь тебе выбрать подходящий инструмент с учётом конкретных ограничений развёртывания.
PP-YOLOE+: улучшенное обнаружение объектов в промышленности#
Разработанный в рамках экосистемы Baidu, PP-YOLOE+ представляет собой итеративное улучшение оригинального PP-YOLOE, значительно оптимизированное для фреймворка глубокого обучения PaddlePaddle. Модель создана для максимальной точности и скорости инференса на серверном оборудовании, что делает её сильным кандидатом для промышленного контроля и задач умной розничной торговли.
Архитектурные инновации#
PP-YOLOE+ включает несколько архитектурных улучшений по сравнению с предыдущими безанкорными детекторами:
- Backbone CSPRepResNet: эта backbone-архитектура использует архитектуру в стиле RepVGG в сочетании со связями частичного разделения этапов (CSP), обеспечивая оптимальный баланс между возможностями извлечения признаков и задержкой инференса.
- Обучение с выравниванием задач (TAL): PP-YOLOE+ использует продвинутую стратегию динамического назначения меток, которая согласует задачи классификации и регрессии во время обучения, сокращая разрыв между производительностью на обучении и при инференсе.
- Эффективная голова с выравниванием задач (ET-head): оптимизированная голова детектора, предназначенная для быстрой обработки признаков без потери пространственного разрешения, что особенно полезно для сохранения высоких значений метрик mAP.
Сведения о PP-YOLOE+:
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
- Документация: документация PP-YOLOE+
DAMO-YOLO: поиск нейронной архитектуры на периферийных устройствах#
Созданная академией DAMO Alibaba, модель DAMO-YOLO использует принципиально другой подход. Вместо ручного проектирования backbone исследовательская команда применила поиск нейронной архитектуры (NAS), чтобы найти высокоэффективные топологии сетей, адаптированные к строгим ограничениям по задержке.
Ключевые особенности и конвейер обучения#
DAMO-YOLO делает акцент на низкой задержке и высокой точности благодаря автоматизированной методологии с активным использованием дистилляции:
- Магистральные сети MAE-NAS: Используя поиск архитектур нейронных сетей на основе максимальной энтропии, DAMO-YOLO строит магистральные сети, оптимизированные специально под баланс между количеством параметров и точностью.
- Efficient RepGFPN: переупараметризованная обобщённая сеть пирамиды признаков обеспечивает надёжное многошкальное слияние признаков, помогая модели обнаруживать объекты сильно различающихся размеров в одном кадре.
- Архитектура ZeroHead: значительно упрощённая голова детектора, резко сокращающая вычислительные накладные расходы на этапе инференса.
- Улучшение с помощью дистилляции: для повышения производительности небольших вариантов DAMO-YOLO активно использует сложный процесс дистилляции знаний, в котором большая модель-учитель направляет обучение модели-ученика.
Сведения о DAMO-YOLO:
- Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Документация: Документация DAMO-YOLO
Хотя PP-YOLOE+ и DAMO-YOLO предлагают значимые теоретические инновации, они тесно связаны со своими фреймворками (PaddlePaddle и специфическими средами Alibaba соответственно). Это может усложнить перенос этих моделей в стандартизированные облачные или периферийные среды развёртывания.
Анализ производительности#
При оценке этих моделей компромисс между задержкой, вычислительной сложностью (FLOPs) и средней точностью (mAP) определяет оптимальную среду их развёртывания.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
DAMO-YOLO обычно обеспечивает меньшую задержку TensorRT в вариантах nano и tiny, что делает модель весьма конкурентоспособной для видеопотоков с высокой пропускной способностью. Однако PP-YOLOE+ отлично масштабируется до варианта extra-large (x), обеспечивая точность высшего уровня для сложных изображений, где время инференса имеет второстепенное значение.
Преимущество Ultralytics: развитие архитектур за пределами 2022 года#
Хотя PP-YOLOE+ и DAMO-YOLO стали важными этапами развития, современная разработка требует большей универсальности, более простых конвейеров обучения и меньших требований к памяти. Платформа Ultralytics отвечает этим требованиям, предлагая бесшовный процесс, который значительно превосходит сложные настройки с дистилляцией и зависимостью от конкретного фреймворка, необходимые для более старых моделей.
Для разработчиков, стремящихся сегодня достичь наилучшего баланса производительности, Ultralytics YOLO26 обеспечивает революционный скачок в эффективности развёртывания в реальных условиях.
Почему YOLO26 лидирует в отрасли#
Выпущенный в начале 2026 года, YOLO26 развивает наследие YOLO11, внедряя передовые технологии, адаптированные для эксплуатации в продуктивной среде:
- Сквозная архитектура без NMS: YOLO26 устраняет постобработку подавления немаксимумов (NMS). Это упрощает логику развёртывания и обеспечивает стабильную, предсказуемую задержку инференса.
- Оптимизатор MuSGD: вдохновлённый методами обучения больших языковых моделей, YOLO26 использует гибридный оптимизатор MuSGD. Он обеспечивает исключительно стабильное обучение и быструю сходимость, экономя ценные часы работы GPU.
- Превосходный инференс на CPU: за счёт удаления Distribution Focal Loss (DFL) и оптимизации графа сети YOLO26 обеспечивает ускорение инференса на CPU до 43 %, что делает его оптимальным выбором для периферийных устройств с ИИ.
- ProgLoss + STAL: эти продвинутые функции потерь значительно улучшают распознавание небольших объектов, что критически важно для операций с дронами и дистанционного зондирования.
- Непревзойдённая универсальность: в отличие от PP-YOLOE+, ориентированного исключительно на обнаружение, YOLO26 изначально поддерживает оценку позы, сегментацию экземпляров, классификацию изображений и ориентированные ограничивающие рамки (OBB).
Простота использования и эффективность обучения#
Обучение модели DAMO-YOLO требует управления ресурсоёмким конвейером дистилляции «учитель—ученик». Напротив, для обучения модели Ultralytics достаточно нескольких строк Python при минимальном использовании памяти CUDA по сравнению с конкурирующими архитектурами.
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model with native MuSGD optimization
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run an end-to-end NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")Оптимальные варианты использования и рекомендации#
Выбор оптимальной архитектуры компьютерного зрения во многом зависит от интеграции с экосистемой твоей команды и целевых сред развёртывания.
- Выбирай PP-YOLOE+, если весь твой конвейер глубоко интегрирован в экосистему Baidu PaddlePaddle. Это по-прежнему отличный выбор для анализа статичных изображений на мощных серверах, где максимальная точность является главным приоритетом.
- Выбирай DAMO-YOLO, если ты проводишь специализированные исследования алгоритмов поиска нейронной архитектуры или располагаешь инженерными ресурсами для поддержки сложных конвейеров дистилляции ради достижения агрессивных целевых показателей задержки TensorRT.
- Выбери Ultralytics YOLO26 для почти всех современных производственных сценариев. Экосистема Ultralytics предоставляет непревзойденную документацию, сниженные требования к памяти и упрощенный API. Создаешь ли ты системы автоматизированного контроля качества или запускаешь трекинг в реальном времени на Raspberry Pi, архитектура YOLO26 без NMS гарантирует быстрые, стабильные и высокоточные результаты из коробки.
Для разработчиков, изучающих другие передовые решения, документация Ultralytics также содержит обширные ресурсы по широко используемым YOLOv8 и надёжному YOLO11, помогая выбрать подходящую модель для любой задачи компьютерного зрения.