DAMO-YOLO против RTDETRv2#
Быстро развивающаяся сфера компьютерного зрения породила впечатляющее множество архитектур, созданных для баланса между скоростью, точностью и вычислительной эффективностью. Две выдающиеся модели, предложившие уникальные подходы к решению этих задач, — это DAMO-YOLO и RTDETRv2. Хотя обе модели стремятся обеспечить передовые решения для инференса в реальном времени, они фундаментально различаются в своей архитектурной философии.
Это подробное руководство глубоко погружается в технические характеристики, архитектурные инновации и практические сценарии использования обеих моделей, а также исследует, как современные решения, такие как Ultralytics Platform и передовая YOLO26, переопределили отраслевые стандарты развертывания и простоты использования.
Обзор моделей#
Понимание DAMO-YOLO#
Разработанный исследователями из Alibaba Group, метод DAMO-YOLO представляет собой быстрый и точный способ обнаружения объектов, в значительной степени полагающийся на Neural Architecture Search (NAS). Он заменяет традиционные бэкбоны, созданные вручную, на структуры, сгенерированные с помощью NAS, разработанные для обеспечения низкой задержки. Кроме того, он включает эффективный RepGFPN (Reparameterized Generalized Feature Pyramid Network) и дизайн ZeroHead для оптимизации агрегации признаков и предсказаний ограничивающих рамок.
Ключевые детали модели:
- Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
- Организация: Alibaba Group
- Дата: 23.11.2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Документация: DAMO-YOLO Documentation
Понимание RTDETRv2#
RTDETRv2 от Baidu представляет собой значительный скачок для трансформеров обнаружения в реальном времени. В отличие от традиционных сверточных нейронных сетей (CNN), которые полагаются на якорные рамки и Non-Maximum Suppression (NMS), RTDETRv2 использует механизмы self-attention для контекстного анализа всего изображения целиком. Она напрямую выдает ограничивающие рамки, полностью обходя этап пост-обработки NMS. Эта модель вводит стратегию обучения "bag of freebies" для улучшения базовой точности без увеличения задержки инференса.
Ключевые детали модели:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 24.07.2024
- Arxiv: 2407.17140
- GitHub: Репозиторий RT-DETR
- Документация: Документация RTDETRv2
Хотя трансформеры требуют больших вычислительных ресурсов, их способность обрабатывать глобальный контекст делает их невероятно эффективными для понимания сложных сцен, что является главным преимуществом RTDETRv2.
Сравнение производительности#
При оценке этих моделей для реального развертывания такие параметры, как Mean Average Precision (mAP), скорость инференса и объем используемой памяти, имеют критическое значение. Модели на основе трансформеров, такие как RTDETRv2, обычно требуют больше памяти CUDA во время обучения и инференса по сравнению с легковесными CNN, такими как DAMO-YOLO.
Ниже представлено детальное сравнение их метрик производительности.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Идеальные варианты использования#
В чем сильные стороны DAMO-YOLO: Благодаря оптимизированному с помощью NAS бэкбону и исключительно малому количеству параметров в меньших вариантах (таких как DAMO-YOLOt), модель отлично подходит для развертывания на жестко ограниченном железе. Если ты создаешь решения для встраиваемых устройств, используя такие рантаймы, как ONNX, или специализированные движки TensorRT для периферийных вычислений, DAMO-YOLO предоставляет высокопроизводительный фреймворк.
В чем сильные стороны RTDETRv2: RTDETRv2 блистает в сценариях, где доступны графические процессоры серверного класса и ключевое значение имеет глобальный контекст изображения. Архитектура Transformer позволяет ей естественным образом разрешать пересекающиеся ограничивающие рамки без NMS, что делает её надежным выбором для плотного управления толпой или сложного отслеживания объектов, где критически важны пространственные связи между удаленными объектами.
Преимущество Ultralytics: представляем YOLO26#
Хотя DAMO-YOLO и RTDETRv2 представляют собой значительные академические достижения, переход от этих моделей к масштабируемым приложениям, готовым к продакшену, может быть сложным. Разработчики часто сталкиваются с фрагментированными кодовыми базами, отсутствием поддержки многозадачного обучения и сложными конвейерами развертывания.
Именно здесь экосистема Ultralytics по-настоящему выделяется. Уделяя первостепенное внимание простоте использования, поддерживаемому API Python и непревзойденной универсальности, Ultralytics гарантирует, что ты будешь тратить меньше времени на отладку и больше на разработку.
Недавно выпущенная модель Ultralytics YOLO26 выводит эти преимущества на новый уровень, предлагая прорывы, которые превосходят как DAMO-YOLO, так и RTDETRv2:
- Сквозной дизайн без NMS: Впервые предложенный в YOLOv10, YOLO26 является изначально сквозным. Это полностью исключает постобработку NMS, делая развертывание быстрее и значительно проще по сравнению с традиционными CNN, одновременно сохраняя преимущества прямых выходных данных RTDETRv2.
- Инференс на CPU быстрее до 43%: Интенсивно оптимизировано для устройств Edge AI без дискретных GPU, что делает эту модель гораздо более предпочтительным выбором для IoT-приложений по сравнению с тяжелыми для памяти трансформаторами.
- Оптимизатор MuSGD: Вдохновленный Kimi K2 от Moonshot AI, этот гибрид SGD и Muon привносит инновации в обучении больших языковых моделей (LLM) в сферу компьютерного зрения, что приводит к удивительно стабильному обучению и более быстрой сходимости.
- ProgLoss + STAL: Эти продвинутые функции потерь обеспечивают заметные улучшения в распознавании мелких объектов — области, в которой модели традиционно испытывают трудности. Это критически важно для аэроснимков и приложений с дронами.
- Удаление DFL: Distribution Focal Loss был убран, чтобы обеспечить упрощенные форматы экспорта и лучшую совместимость с маломощными периферийными устройствами.
- Непревзойденная универсальность: В отличие от конкурирующих моделей, строго ограниченных детекцией, YOLO26 включает в себя улучшения для конкретных задач по всем направлениям, такие как специализированная потеря по углам для ориентированных ограничивающих рамок (OBB), потеря семантической сегментации для пиксельной точности и оценка остаточного лог-правдоподобия (RLE) для оценки позы.
Обучение моделей на основе трансформеров, таких как RTDETRv2, требует огромного объема памяти CUDA, что часто вынуждает использовать дорогостоящие конфигурации с несколькими GPU. Модели Ultralytics YOLO поддерживают значительно более низкие требования к памяти как во время обучения, так и при инференсе, демократизируя разработку ИИ как для исследователей, так и для энтузиастов.
Пример кода: унифицированный Ultralytics API#
Одно из самых больших преимуществ экосистемы Ultralytics — это унифицированный API. Ты можешь легко загружать, обучать и валидировать множество моделей — включая реализацию PyTorch для RTDETR и передовые модели YOLO — не меняя свой рабочий процесс.
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
results_yolo[0].show()Эта простота распространяется на обучение на пользовательских датасетах и экспорт. Используя пакет Python Ultralytics, ты можешь легко переносить свои обученные веса на платформы развертывания, такие как CoreML или OpenVINO, с помощью одной команды.
Заключение и дальнейшее изучение#
И DAMO-YOLO, и RTDETRv2, безусловно, расширили границы возможного в обнаружении объектов в реальном времени. DAMO-YOLO предоставляет высокооптимизированные, автоматически подобранные структуры сети для чистой эффективности, в то время как RTDETRv2 доказывает, что трансформеры могут конкурировать в пространстве реального времени, устраняя традиционные узкие места, такие как NMS.
Однако для разработчиков, стремящихся к максимальному балансу производительности, исчерпывающей документации и готовности к продакшену, модели Ultralytics YOLO остаются золотым стандартом. С появлением YOLO26 пользователи получают доступ к end-to-end обнаружению трансформерного типа, эффективности обучения, вдохновленной LLM, и непревзойденным скоростям на CPU — и все это в рамках интуитивно понятной и надежной экосистемы.
Если ты оцениваешь модели для своего следующего проекта, тебе также может быть полезно ознакомиться с нашими сравнениями EfficientDet против RTDETR, изучить предыдущее поколение YOLO11 или рассмотреть академические базовые модели, такие как YOLOX. Начни разработку сегодня, изучив руководство по быстрому старту Ultralytics.