DAMO-YOLO и PP-YOLOE+#
В условиях острой конкуренции в сфере компьютерного зрения реального времени крайне важно выбрать архитектуру, оптимальную для конкретных требований к развёртыванию. В этом руководстве подробно сравниваются DAMO-YOLO и PP-YOLOE+: рассматриваются их архитектуры, методики обучения и показатели производительности. Мы также сравним эти модели с современными решениями, такими как недавно выпущенная Ultralytics YOLO26.
Обзор моделей#
Обе платформы появились в 2022 году как мощные альтернативы для промышленных приложений, использующие продвинутые методы для повышения точности и скорости инференса.
DAMO-YOLO#
DAMO-YOLO, разработанная Alibaba Group, представила несколько новых методов оптимизации компромисса между задержкой и точностью, активно используя автоматизированный поиск и продвинутое объединение признаков.
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: DAMO-YOLO: обзор проектирования детекторов объектов для работы в реальном времени
- GitHub: tinyvision/DAMO-YOLO
- Документация: README DAMO-YOLO
DAMO-YOLO использует поиск нейросетевой архитектуры по максимальной энтропии (MAE-NAS) для автоматического создания магистральных сетей, оптимизированных для аппаратной эффективности. В модели также применяется эффективная RepGFPN (обобщённая пирамида признаков с перепараметризацией) для объединения признаков в шейке и облегчённая архитектура «ZeroHead». Кроме того, во время обучения модель активно использует дистилляцию, повышая способность модели-ученика извлекать представления.
PP-YOLOE+#
PP-YOLOE+, созданная командой PaddlePaddle из Baidu, — это промежуточное обновление архитектуры PP-YOLOE. Модель ориентирована на предварительное обучение на крупных наборах данных и усовершенствованные функции потерь, обеспечивая высокую mAP, особенно в родном фреймворке глубокого обучения.
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: PP-YOLOE: эволюционная версия YOLO
- GitHub: PaddlePaddle/PaddleDetection
- Документация: Конфигурации PP-YOLOE+
В PP-YOLOE+ используется магистральная сеть CSPRepResNet и ET-голова (голова, выровненная по эффективным задачам). В версии «plus» добавлена эффективная стратегия предварительного обучения на наборе данных Objects365, значительно повышающая способность модели к обобщению в разнообразных условиях реального мира.
Сравнение архитектур#
Различия в подходах к проектированию этих моделей во многом определяют оптимальные сценарии их применения и совместимость с оборудованием.
Объединение признаков и магистральные сети#
Магистральные сети DAMO-YOLO, созданные с помощью MAE-NAS, хорошо адаптированы для периферийных устройств и часто обеспечивают выгодное соотношение скорости и числа параметров. Однако эти специализированные архитектуры могут быть негибкими и сложными для адаптации к новым задачам, например сегментации экземпляров. Шейка RepGFPN улучшает объединение признаков разных масштабов, но усложняет этап экспорта с перепараметризацией.
PP-YOLOE+ использует более традиционную, но весьма эффективную CSPRepResNet. Для той же точности этой магистральной сети требуется больше параметров, чем DAMO-YOLO, зато она очень стабильна при обучении и проще интегрируется в существующие конвейеры. ET-голова эффективно выполняет классификацию и регрессию, но по-прежнему требует постобработки, например подавления немаксимумов (NMS).
Для постобработки ограничивающих рамок и DAMO-YOLO, и PP-YOLOE+ используют NMS. Если задержка инференса критична, рассмотри Ultralytics YOLO26: в модели реализована нативная сквозная архитектура без NMS благодаря опциональной голове один-к-одному (nms=False). Этот прорывной подход исключает постобработку NMS, упрощая конвейер развёртывания и ускоряя его.
Анализ производительности и показателей#
При выборе модели для промышленного использования критически важно учитывать баланс точности (mAP), скорости инференса и числа параметров. Ниже приведено прямое сравнение основных вариантов этих моделей.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Как показывает таблица, DAMO-YOLO обеспечивает более высокую точность в сверхкомпактном (t) и малом (s) вариантах, а DAMO-YOLOt демонстрирует минимальную задержку TensorRT на T4 среди представленных моделей благодаря магистральным сетям, оптимизированным с помощью NAS. Однако PP-YOLOE+ отлично масштабируется до средних (m) и крупных (l) вариантов, достигая более высокой mAP ценой небольшого снижения скорости TensorRT на T4.
Требования к памяти и эффективность обучения#
Из-за использования дистилляции в DAMO-YOLO часто сначала нужно обучить гораздо более крупную модель-учителя, а затем модель-ученика меньшего размера. Это значительно увеличивает требования к памяти CUDA и общий объём вычислительных ресурсов. PP-YOLOE+ упрощает этот процесс благодаря стандартному одноэтапному обучению, но остаётся тесно привязанной к PaddlePaddle, что может ограничивать гибкость команд, привыкших к PyTorch.
В отличие от них, современная модель Ultralytics YOLO26 устраняет эти узкие места. Благодаря новому оптимизатору MuSGD — гибриду SGD и Muon, вдохновлённому инновациями в обучении LLM, — YOLO26 быстрее сходится и стабильно обучается без сложных конвейеров дистилляции. Кроме того, для обучения моделей YOLO обычно требуется гораздо меньше памяти CUDA, чем для детекторов на основе трансформеров, например RT-DETR.
Применение в реальном мире и подходящие сценарии использования#
Когда использовать DAMO-YOLO#
DAMO-YOLO отлично подходит для высокопроизводительного инференса на периферийных устройствах, когда главным ограничением является задержка. Компактные варианты хорошо работают в таких системах, как системы управления дорожным движением, и при базовом наблюдении с дронов, если у инженерной команды есть ресурсы для работы со сложными процессами дистилляции и перепараметризации.
Когда стоит выбрать PP-YOLOE+#
PP-YOLOE+ особенно хороша, если ты уже активно используешь экосистему Baidu или запускаешь крупномасштабные серверные развёртывания. Высокая mAP делает эту модель подходящей для сложного анализа медицинских изображений и детекции многочисленных производственных дефектов.
Преимущества Ultralytics#
Хотя DAMO-YOLO и PP-YOLOE+ обладают отдельными преимуществами в своих областях, разработчики, которым нужны максимальная универсальность, скорость и простота использования, неизменно выбирают платформу Ultralytics.
При обновлении конвейера компьютерного зрения Ultralytics YOLO26 обеспечивает разработчикам непревзойдённый опыт:
- До 43% быстрее инференс на CPU: Полностью удалив Distribution Focal Loss (DFL), YOLO26 заметно ускоряет работу на периферийных CPU и маломощных устройствах IoT.
- Улучшенная детекция мелких объектов: Благодаря функциям потерь ProgLoss и STAL модель значительно лучше распознаёт мелкие объекты, что особенно важно для аэрофотосъёмки.
- Широкая универсальность: В отличие от PP-YOLOE+, ориентированной исключительно на детекцию, YOLO26 без проблем выполняет оценку позы, детекцию ориентированных ограничивающих рамок (OBB) и семантическую сегментацию благодаря специализированным улучшениям архитектуры.
Заключение#
DAMO-YOLO и PP-YOLOE+ стали важными этапами развития детекции объектов без якорей. DAMO-YOLO расширила возможности поиска нейросетевой архитектуры для снижения задержки на периферийных устройствах, а PP-YOLOE+ продемонстрировала эффективность предварительного обучения на крупных наборах данных.
Однако разработчикам, которым нужен оптимальный баланс скорости, точности и простоты развёртывания, однозначно стоит выбрать модель Ultralytics YOLO26. Архитектура без NMS, надёжный API для Python и удобная интеграция с такими инструментами, как Weights & Biases и TensorRT, помогают плавно переводить проекты от прототипа к промышленной эксплуатации.
Готов начать? Изучи краткое руководство Ultralytics или сравни другие модели в нашем обзоре YOLO11 и DAMO-YOLO.