PP-YOLOE+ против DAMO-YOLO#
Непрерывное развитие компьютерного зрения привело к появлению множества узкоспециализированных архитектур для обнаружения объектов в реальном времени. При оценке моделей для промышленных и исследовательских приложений часто обсуждают две известные разработки 2022 года: PP-YOLOE+ от Baidu и DAMO-YOLO от Alibaba Group. Обе модели расширили возможности обнаружения объектов без якорей благодаря новым backbone, продвинутым стратегиям сопоставления меток и специализированным методам объединения признаков.
В этом руководстве подробно разбираются технические особенности PP-YOLOE+ и DAMO-YOLO, в том числе их архитектуры, методики обучения и преимущества при развертывании. Мы также сравним эти решения с современными моделями, такими как Ultralytics YOLO26, чтобы помочь тебе выбрать инструмент с учетом конкретных ограничений развертывания.
PP-YOLOE+: усовершенствованное обнаружение объектов для промышленности#
Разработанная в экосистеме Baidu, PP-YOLOE+ представляет собой итеративное улучшение оригинальной PP-YOLOE, тщательно оптимизированное для фреймворка глубокого обучения PaddlePaddle. Модель создана для максимальной точности и скорости инференса на оборудовании серверного класса, поэтому хорошо подходит для промышленного контроля и приложений умной розницы.
Архитектурные инновации#
PP-YOLOE+ предлагает несколько архитектурных улучшений по сравнению с предыдущими детекторами без якорей:
- Backbone CSPRepResNet: В этом backbone используется архитектура в стиле RepVGG в сочетании со связями Cross Stage Partial (CSP). Это обеспечивает хороший баланс между возможностями извлечения признаков и задержкой инференса.
- Task Alignment Learning (TAL): PP-YOLOE+ использует продвинутую стратегию динамического сопоставления меток, которая согласует задачи классификации и регрессии во время обучения, сокращая разрыв между результатами обучения и инференса.
- Эффективная голова обнаружения объектов с согласованием задач (ET-head): Упрощенная голова обнаружения объектов быстро обрабатывает признаки без потери пространственного разрешения, что особенно полезно для получения высоких показателей mAP.
Подробности о PP-YOLOE+:
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
- Документация: Документация PP-YOLOE+
DAMO-YOLO: поиск архитектуры нейронной сети на edge-устройствах#
Созданная академией Alibaba DAMO, DAMO-YOLO использует совершенно иной подход. Вместо ручного проектирования backbone исследовательская команда применила поиск архитектуры нейронной сети (NAS), чтобы найти эффективные топологии сети, адаптированные к жестким ограничениям по задержке.
Ключевые особенности и конвейер обучения#
DAMO-YOLO обеспечивает низкую задержку и высокую точность благодаря автоматизированной методике с активным использованием дистилляции:
- Backbone MAE-NAS: Используя поиск архитектуры нейронной сети с максимальной энтропией, DAMO-YOLO строит backbone, специально оптимизированные под компромисс между количеством параметров и точностью.
- Эффективная RepGFPN: Перепараметризованная обобщенная пирамидальная сеть признаков обеспечивает надежное объединение признаков разных масштабов. Это помогает модели обнаруживать объекты совершенно разных размеров в одном кадре.
- Архитектура ZeroHead: Сильно упрощенная голова обнаружения объектов, которая значительно снижает вычислительные затраты на этапе инференса.
- Улучшение за счет дистилляции: Чтобы повысить производительность компактных вариантов, DAMO-YOLO активно использует сложный процесс дистилляции знаний: большая модель-учитель направляет обучение модели-ученика.
Сведения о DAMO-YOLO:
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Документация: Документация DAMO-YOLO
Несмотря на серьезные теоретические новшества в PP-YOLOE+ и DAMO-YOLO, обе модели тесно связаны со своими фреймворками — PaddlePaddle и специфическими средами Alibaba соответственно. Это может усложнить перенос моделей в стандартизированные облачные среды или на edge-устройства.
Анализ производительности#
При оценке этих моделей компромисс между задержкой, вычислительной сложностью (FLOPs) и средней точностью по всем классам (mAP) определяет оптимальную среду развертывания.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
DAMO-YOLOt обеспечивает меньшую задержку в TensorRT, чем PP-YOLOE+t, а DAMO-YOLO точнее в вариантах Tiny и Small, поэтому хорошо подходит для видеопотоков с высокой пропускной способностью. Однако PP-YOLOE+ отлично масштабируется вплоть до варианта Extra-Large (x) и обеспечивает высокую точность на сложных изображениях, когда скорость инференса не является приоритетом.
Преимущества Ultralytics: развитие архитектур после 2022 года#
PP-YOLOE+ и DAMO-YOLO стали важными вехами, однако современная разработка требует большей универсальности, более простых конвейеров обучения и меньших требований к памяти. Платформа Ultralytics отвечает этим требованиям и обеспечивает простой запуск, значительно превосходя сложные процессы дистилляции и привязанные к конкретным фреймворкам настройки старых моделей.
Разработчикам, которым нужен оптимальный баланс производительности, Ultralytics YOLO26 предлагает революционно эффективное решение для развертывания в реальных условиях.
Почему YOLO26 лидирует в отрасли#
Выпущенная в начале 2026 года YOLO26 развивает наследие YOLO11, предлагая прорывные технологии для промышленного применения:
- Сквозная архитектура без NMS: YOLO26 может полностью пропускать постобработку с подавлением немаксимумов (NMS) благодаря необязательной голове «один к одному» (
nms=False). Это упрощает логику развертывания и обеспечивает стабильную, предсказуемую задержку инференса. - Оптимизатор MuSGD: Вдохновленная методами обучения больших языковых моделей, YOLO26 использует гибридный оптимизатор MuSGD. Он обеспечивает чрезвычайно стабильное обучение и быструю сходимость, экономя ценное время работы GPU.
- Улучшенный инференс на CPU: Удаляя Distribution Focal Loss (DFL) и оптимизируя граф сети, YOLO26 ускоряет инференс на CPU до 43%, что делает ее оптимальным выбором для edge-устройств с ИИ.
- ProgLoss + STAL: Эти продвинутые функции потерь значительно улучшают распознавание мелких объектов, что особенно важно для работы с дронами и дистанционного зондирования.
- Непревзойденная универсальность: В отличие от PP-YOLOE+, которая предназначена только для обнаружения объектов, YOLO26 изначально поддерживает оценку позы, сегментацию экземпляров, классификацию изображений и повернутые ограничивающие рамки (OBB).
Удобство использования и эффективность обучения#
Для обучения модели DAMO-YOLO необходимо управлять ресурсоемким конвейером дистилляции «учитель — ученик». В отличие от нее, для обучения модели Ultralytics достаточно нескольких строк Python, а памяти CUDA требуется значительно меньше, чем конкурирующим архитектурам.
from ultralytics import YOLO
# Инициализируй передовую модель YOLO26
model = YOLO("yolo26n.pt")
# Обучи модель с оптимизатором MuSGD
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, optimizer="MuSGD")
# Запусти сквозной инференс без NMS
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Экспортируй в ONNX или TensorRT без проблем
model.export(format="onnx")Оптимальные сценарии применения и рекомендации#
Выбор оптимальной архитектуры компьютерного зрения во многом зависит от интеграции с экосистемой команды и целевых сред развертывания.
- Выбирай PP-YOLOE+, если весь твой конвейер глубоко интегрирован в экосистему Baidu PaddlePaddle. Эта модель по-прежнему отлично подходит для анализа статических изображений на мощных серверах, когда главная цель — максимальная точность.
- Выбирай DAMO-YOLO, если ты проводишь специализированные исследования алгоритмов поиска архитектуры нейронной сети или располагаешь ресурсами для поддержки сложных конвейеров дистилляции, необходимых для достижения минимальной задержки в TensorRT.
- Выбирай Ultralytics YOLO26 почти для всех современных промышленных сценариев. Экосистема Ultralytics предлагает непревзойденную документацию, низкие требования к памяти и удобный API. Создаешь ли ты системы автоматизированного контроля качества или запускаешь отслеживание объектов в реальном времени на Raspberry Pi, архитектура YOLO26 без NMS сразу обеспечивает быстрые, стабильные и точные результаты.
Если ты рассматриваешь другие передовые решения, в документации Ultralytics также есть множество материалов о широко распространенной YOLOv8 и надежной YOLO11, чтобы ты мог выбрать подходящую модель для любой задачи компьютерного зрения.