DAMO-YOLO и PP-YOLOE+: сравнение#
В условиях высокой конкуренции в области компьютерного зрения в реальном времени крайне важно выбрать оптимальную архитектуру для конкретных требований к развёртыванию. В этом руководстве приведено подробное техническое сравнение DAMO-YOLO и PP-YOLOE+ с глубоким разбором их архитектуры, методик обучения и показателей производительности. Мы также рассмотрим, как эти модели сравниваются с передовыми решениями, такими как недавно выпущенная Ultralytics YOLO26.
Обзор моделей#
Обе платформы появились в 2022 году как мощные альтернативы для промышленных приложений, используя сложные методы для повышения точности и скорости инференса.
DAMO-YOLO#
Разработанная Alibaba Group, модель DAMO-YOLO представила несколько новых методов оптимизации компромисса между задержкой и точностью, активно используя автоматизированный поиск и передовое объединение признаков.
- Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: DAMO-YOLO: A Report on Real-Time Object Detection Design
- GitHub: tinyvision/DAMO-YOLO
- Документация: DAMO-YOLO README
DAMO-YOLO использует поиск архитектуры нейронных сетей на основе максимальной энтропии (MAE-NAS) для автоматического проектирования базовых сетей, оптимизированных под эффективность оборудования. Модель также оснащена эффективной структурой RepGFPN для слияния признаков в шейке и легковесным решением ZeroHead. Кроме того, DAMO-YOLO активно опирается на методы дистилляции в процессе обучения для повышения репрезентативной мощности модели-ученика.
PP-YOLOE+#
PP-YOLOE+, разработанная командой PaddlePaddle компании Baidu, представляет собой поэтапное улучшение архитектуры PP-YOLOE. Основное внимание уделяется предобучению на больших объёмах данных и усовершенствованным функциям потерь для достижения высокого mAP, особенно в исходной платформе глубокого обучения.
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: PP-YOLOE: An evolved version of YOLO
- GitHub: PaddlePaddle/PaddleDetection
- Документация: Конфигурации PP-YOLOE+
PP-YOLOE+ использует бэкбон CSPRepResNet и ET-head (эффективную голову, согласованную с задачей). Версия «plus» включает мощную стратегию предобучения на датасете Objects365, что значительно повышает способность модели обобщать на различные условия реального мира.
Сравнение архитектур#
Различия в подходах к проектированию этих двух моделей существенно влияют на оптимальные сценарии их применения и совместимость с оборудованием.
Объединение признаков и бэкбоны#
Бэкбоны DAMO-YOLO, созданные с помощью MAE-NAS, хорошо адаптированы к периферийным устройствам и часто обеспечивают выгодное соотношение скорости и числа параметров. Однако такие специализированные архитектуры могут быть негибкими и сложными для адаптации к новым задачам, например к сегментации экземпляров. Шея RepGFPN улучшает объединение многоуровневых признаков, но усложняет процесс экспорта с перепараметризацией.
PP-YOLOE+ использует более традиционный, но весьма эффективный CSPRepResNet. Хотя для достижения аналогичной точности этому бэкбону требуется больше параметров, его легко и стабильно обучать, а также проще интегрировать в существующие конвейеры. ET-head эффективно выполняет классификацию и регрессию, но по-прежнему требует этапов постобработки, таких как подавление немаксимумов (NMS).
И DAMO-YOLO, и PP-YOLOE+ требуют NMS для постобработки ограничивающих рамок. Если задержка инференса критична, рассмотрите Ultralytics YOLO26, в которой реализована нативная сквозная архитектура без NMS. Этот прорывной подход устраняет постобработку NMS, обеспечивая более быстрый и простой конвейер развёртывания.
Анализ производительности и метрик#
При оценке этих моделей для промышленной эксплуатации критически важно учитывать баланс между точностью (mAP), скоростью инференса и размером модели в параметрах. Ниже приведено прямое сравнение их основных вариантов.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Как показывает таблица, DAMO-YOLO обычно обеспечивает меньшую задержку на малых (s) и сверхмалых (t) масштабах благодаря бэкбонам, оптимизированным с помощью NAS. Однако PP-YOLOE+ отлично масштабируется до средних (m) и больших (l) вариантов, демонстрируя значительно более высокие значения mAP, хотя и с небольшим снижением скорости TensorRT на T4.
Требования к памяти и эффективность обучения#
Зависимость DAMO-YOLO от дистилляции означает, что перед обучением меньшей ученической модели часто требуется обучить гораздо более крупную учительскую модель. Это существенно увеличивает требования к памяти CUDA и общий вычислительный бюджет. PP-YOLOE+ упрощает этот процесс благодаря стандартному одностадийному обучению, но остаётся тесно связанной с платформой PaddlePaddle, что может ограничивать гибкость команд, привыкших к PyTorch.
В отличие от них, современная модель Ultralytics YOLO26 устраняет эти узкие места. Благодаря новому оптимизатору MuSGD — гибридному оптимизатору SGD и Muon, вдохновлённому инновациями в обучении LLM, — YOLO26 быстрее сходится и обеспечивает высокую стабильность обучения без сложных конвейеров дистилляции. Кроме того, моделям YOLO обычно требуется гораздо меньше памяти CUDA при обучении по сравнению с детекторами на основе Transformer, такими как RT-DETR.
Применение в реальных условиях и оптимальные сценарии использования#
Когда использовать DAMO-YOLO#
DAMO-YOLO идеально подходит для высокопроизводительного инференса на периферийных устройствах, где задержка является главным ограничением. Её малые варианты отлично работают в таких сценариях, как системы управления дорожным движением или базовое наблюдение с дронов, если у твоей инженерной команды достаточно ресурсов для управления сложными процессами дистилляции и перепараметризации.
Когда использовать PP-YOLOE+#
PP-YOLOE+ особенно эффективна, если ты уже глубоко интегрирован в экосистему Baidu или разворачиваешь крупномасштабные серверные системы. Благодаря впечатляющему mAP она подходит для сложного анализа медицинских изображений или плотного обнаружения дефектов на производстве.
Преимущества Ultralytics#
Хотя DAMO-YOLO и PP-YOLOE+ предлагают определённые преимущества в конкретных сценариях, разработчики, которым нужны максимальная универсальность, скорость и удобство использования, неизменно выбирают Ultralytics Platform.
При обновлении конвейера компьютерного зрения Ultralytics YOLO26 обеспечивает исключительный опыт разработки:
- До 43% более быстрый инференс на CPU: благодаря полному удалению Distribution Focal Loss (DFL) YOLO26 демонстрирует исключительно высокую скорость на периферийных CPU и маломощных IoT-устройствах.
- Улучшенное обнаружение малых объектов: интеграция функций потерь ProgLoss и STAL значительно повышает качество распознавания малых объектов, что особенно важно для аэрофотосъёмки.
- Широкая универсальность: в отличие от PP-YOLOE+, ориентированной исключительно на обнаружение объектов, YOLO26 без проблем работает с оценкой позы, ориентированными ограничивающими рамками (OBB) и семантической сегментацией благодаря архитектурным улучшениям для конкретных задач.
Заключение#
DAMO-YOLO и PP-YOLOE+ стали важными этапами в развитии безъякорного обнаружения объектов. DAMO-YOLO расширила возможности поиска нейронных архитектур для снижения задержки на периферийных устройствах, а PP-YOLOE+ продемонстрировала эффективность предобучения на больших объёмах данных.
Однако для разработчиков, которым нужен оптимальный баланс скорости, точности и простоты развёртывания, модель Ultralytics YOLO26 является очевидным выбором. Её архитектура без NMS, надёжный API Python и бесшовная интеграция с такими инструментами, как Weights & Biases и TensorRT, обеспечивают плавный переход проектов от прототипа к промышленной эксплуатации.
Готов начать? Изучи краткое руководство Ultralytics или сравни другие модели в нашем обзоре YOLO11 и DAMO-YOLO.