YOLOv9 против RTDETRv2#
Ландшафт обнаружения объектов в реальном времени претерпел сдвиг парадигмы за последние годы. В этой области доминируют две разные архитектурные философии: высокооптимизированные сверточные нейронные сети (CNN) и трансформеры обнаружения в реальном времени (DETR). Пиком этих двух подходов являются YOLOv9 и RTDETRv2.
Это подробное руководство сравнивает эти две мощные модели, анализируя их архитектурные инновации, метрик производительности и идеальные сценарии развертывания, чтобы помочь тебе выбрать подходящую модель для твоего конвейера компьютерного зрения.
Краткий обзор#
Обе модели демонстрируют современные результаты, но они подходят для несколько различающихся ограничений развертывания и сред разработки.
- Выбирай YOLOv9, если: тебе нужна высокоэффективное использование параметров и быстрый вывод на периферийных устройствах. YOLOv9 расширяет теоретические границы эффективности CNN, что делает модель идеальной для сред, где вычислительные ресурсы строго ограничены.
- Выбирай RTDETRv2, если: тебе требуется глубокое понимание контекста, которое обеспечивают трансформеры, особенно в сценах с сильным перекрытием объектов или сложными взаимосвязями между ними, и если у тебя есть оборудование для поддержки чуть более тяжелой архитектуры.
- Выбирай YOLO26 (рекомендуется), если: тебе нужно абсолютное превосходство в обоих аспектах. Будучи новейшим поколением, доступным на платформе Ultralytics Platform, YOLO26 обладает нативным End-to-End NMS-Free Design (похожим на модели DETR, но намного более быстрым), устраняя узкие места постобработки и обеспечивая до 43% более быструю инференс-обработку на CPU по сравнению с предыдущими поколениями.
Технические характеристики и авторство#
Понимание происхождения и целей проектирования этих моделей дает важный контекст для их архитектурных решений.
YOLOv9#
Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
Организация: Institute of Information Science, Academia Sinica
Дата: 2024-02-21
Arxiv: https://arxiv.org/abs/2402.13616
GitHub: WongKinYiu/yolov9
RTDETRv2#
Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
Организация: Baidu
Дата: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR
Архитектурные инновации#
YOLOv9: Решение проблемы информационного узкого места#
Ultralytics YOLOv9 представляет две основные инновации, созданные для борьбы с потерей информации при прохождении данных через глубокие нейронные сети:
- Programmable Gradient Information (PGI): Этот фреймворк вспомогательного контроля гарантирует генерацию надежных градиентов для обновления весов сети, сохраняя ключевую информацию о признаках даже в очень глубоких слоях сети.
- Generalized Efficient Layer Aggregation Network (GELAN): Новая архитектура, сочетающая преимущества CSPNet и ELAN. GELAN оптимизирует эффективность параметров, позволяя YOLOv9 достигать более высокой точности с меньшим количеством FLOP по сравнению с традиционными CNN.
RTDETRv2: Улучшение трансформеров реального времени#
Опираясь на успех оригинального RT-DETR, RTDETRv2 использует архитектуру на основе Transformer, которая изначально исключает необходимость в Non-Maximum Suppression (NMS). Его улучшения включают в себя:
- Стратегия Bag-of-Freebies: Итерация v2 включает продвинутые методы обучения и аугментацию данных, которые значительно повышают точность без увеличения задержки вывода.
- Эффективный гибридный энкодер: Благодаря обработке многомасштабных признаков через декоплированный механизм внутримасштабного и кросс-масштабного внимания, RTDETRv2 эффективно управляет традиционно высокими вычислительными затратами Vision Transformers.
В то время как RTDETRv2 использует трансформеры для обнаружения без NMS, новая архитектура YOLO26 реализует это нативно в рамках высокооптимизированной структуры CNN, обеспечивая столь же упорядоченное развертывание, но с существенно более высокой скоростью инференса на периферийных устройствах.
Сравнение производительности#
При оценке моделей для продакшена критически важен баланс между точностью и требованиями к вычислениям. В таблице ниже представлена производительность моделей различных размеров на стандартных бенчмарках.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Анализ#
Как показывают данные, YOLOv9 сохраняет преимущество в эффективности параметров. Модель YOLOv9c достигает впечатляющих 53.0 mAP с параметрами всего в 25.3M, что делает ее невероятно легкой.
С другой стороны, RTDETRv2 составляет серьезную конкуренцию в категориях средних и крупных моделей. Тем не менее, это достигается за счет большего количества параметров и значительно больших FLOPs, что типично для моделей на основе Transformer. Это архитектурное различие также влияет на использование памяти: модели YOLO обычно требуют значительно меньше памяти CUDA как во время обучения, так и при инференсе по сравнению с их аналогами на базе трансформеров.
Преимущество Ultralytics: Экосистема и универсальность#
Хотя чистые архитектурные метрики важны, экосистема программного обеспечения часто определяет успех проекта в области ИИ. Доступ к этим передовым моделям через Python API Ultralytics дает непревзойденные преимущества.
Упрощенное обучение и развертывание#
Обучение детекционного трансформера обычно требует сложных конфигурационных файлов и дорогостоящих GPU. Используя фреймворк Ultralytics, ты можешь обучать модели как YOLOv9, так и RTDETR с помощью одинакового простого синтаксиса, получая выгоду от высокоэффективных пайплайнов обучения и готовых предобученных весов.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")Непревзойденная универсальность задач#
Существенным ограничением специализированных моделей, таких как RTDETRv2, является их узкая направленность на обнаружение ограничивающих прямоугольников (bounding box). В отличие от них, более широкая экосистема Ultralytics, включающая такие модели, как YOLO11 и YOLOv8, поддерживает широкий спектр задач компьютерного зрения. Сюда входят попиксельная сегментация экземпляров, скелетная оценка позы, классификация всего изображения и обнаружение с ориентированными ограничивающими рамками (OBB) для аэрофотоснимков.
Применение в реальных условиях#
Высокоскоростная периферийная аналитика#
Для торговых точек или производственных линий, требующих распознавания товаров в реальном времени на периферийных устройствах, YOLOv9 станет лучшим выбором. Его архитектура GELAN гарантирует высокую пропускную способность на ограниченном железе вроде серии NVIDIA Jetson, обеспечивая автоматизированный контроль качества без существенных задержек.
Анализ сложных сцен#
В сценариях, таких как мониторинг плотных толп или сложные дорожные перекрестки, где объекты часто перекрывают друг друга, механизмы глобального внимания RTDETRv2 проявляют себя лучше всего. Способность модели нативно рассуждать о контексте всего изображения позволяет ей поддерживать надежное отслеживание и обнаружение, даже если объекты частично скрыты.
Сценарии использования и рекомендации#
Выбор между YOLOv9 и RT-DETR зависит от твоих конкретных требований к проекту, ограничений по развертыванию и предпочтений в экосистеме.
Когда стоит выбрать YOLOv9#
YOLOv9 — отличный выбор для:
- Исследований информационных узких мест: Академические проекты по изучению архитектур Programmable Gradient Information (PGI) и Generalized Efficient Layer Aggregation Network (GELAN).
- Изучения оптимизации потока градиентов: Исследования, направленные на понимание и смягчение потери информации в глубоких слоях сети во время обучения.
- Бенчмаркинга обнаружения высокой точности: Сценарии, где высокие показатели производительности YOLOv9 в бенчмарке COCO необходимы в качестве точки отсчета для архитектурных сравнений.
Когда выбирать RT-DETR#
RT-DETR рекомендуется для:
- Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
- Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
- Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:
- Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
- Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
- Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.
Будущее: YOLO26#
Хотя YOLOv9 и RTDETRv2 представляют собой грандиозные достижения, сфера компьютерного зрения развивается стремительно. Для разработчиков, планирующих начать новые проекты, рекомендуемым передовым решением является YOLO26.
Выпущенная в 2026 году, YOLO26 объединяет лучшие черты как CNN, так и DETR. Она обладает End-to-End NMS-Free Design, полностью устраняющим задержку постобработки — этот метод был впервые применен в YOLOv10. Кроме того, YOLO26 удаляет Distribution Focal Loss (DFL) для лучшей совместимости с периферийными устройствами и представляет революционный MuSGD Optimizer. Вдохновленный обучением больших языковых моделей (а именно Kimi K2 от Moonshot AI), этот гибридный оптимизатор обеспечивает беспрецедентную стабильность обучения и ускоренную сходимость.
В сочетании с улучшенными функциями потерь, такими как ProgLoss и STAL для исключительного распознавания мелких объектов, YOLO26 обеспечивает до 43% более быстрый вывод на CPU, закрепляя свою позицию как идеальная модель для современных ИИ-развертываний.