YOLOv9 и RTDETRv2#
За последние годы подход к обнаружению объектов в реальном времени кардинально изменился. В этой области конкурируют две принципиально разные архитектурные концепции: высокооптимизированные свёрточные нейронные сети (CNN) и трансформеры для обнаружения объектов в реальном времени (DETR). Вершиной этих двух подходов стали YOLOv9 и RTDETRv2.
В этом подробном руководстве сравниваются две мощные модели: анализируются их архитектурные инновации, метрики производительности и оптимальные сценарии развёртывания. Это поможет тебе выбрать подходящую модель для конвейера компьютерного зрения.
Краткий обзор#
Обе модели показывают передовые результаты, но рассчитаны на несколько разные условия развёртывания и среды разработки.
- Выбирай YOLOv9, если: тебе нужно эффективно использовать параметры и быстро выполнять инференс на периферийных устройствах. YOLOv9 расширяет теоретические пределы эффективности CNN и отлично подходит для сред с жёсткими ограничениями по вычислительным ресурсам.
- Выбирай RTDETRv2, если: тебе необходимо контекстное понимание сложных сцен, которое обеспечивают Transformer, особенно при сильном перекрытии объектов или сложных взаимосвязях между ними, и у тебя есть оборудование для поддержки более ресурсоёмкой архитектуры.
- Выбирай YOLO26 (рекомендуется), если: тебе нужно самое лучшее из обоих миров. Как новейшее поколение, доступное на платформе Ultralytics, YOLO26 предлагает опциональную сквозную архитектуру без NMS (
nms=False, похожую на модели DETR, но гораздо более быструю), которая устраняет узкие места постобработки и обеспечивает инференс на CPU до 43% быстрее, чем модели предыдущих поколений.
Технические характеристики и авторы#
Понимание происхождения и назначения этих моделей помогает разобраться в причинах выбора тех или иных архитектурных решений.
YOLOv9#
- Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
- Организация: Институт информатики Академии Синика
- Дата: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
Архитектурные инновации#
YOLOv9: решение проблемы информационного узкого места#
YOLOv9 представляет две ключевые инновации, призванные решить проблему потери информации при прохождении данных через глубокие нейронные сети:
- Программируемая информация о градиентах (PGI): Эта вспомогательная схема обучения гарантирует формирование надежных градиентов для обновления весов сети и сохраняет важную информацию о признаках даже в очень глубоких слоях сети.
- Обобщенная эффективная сеть агрегации слоев (GELAN): Новая архитектура, объединяющая сильные стороны CSPNet и ELAN. GELAN повышает эффективность использования параметров, благодаря чему YOLOv9 обеспечивает более высокую точность при меньшем количестве FLOPs по сравнению с традиционными CNN.
RTDETRv2: усовершенствованные Transformer для работы в реальном времени#
Опираясь на успех оригинальной RT-DETR, RTDETRv2 использует архитектуру на основе Transformer, которая изначально не требует подавления немаксимумов (NMS). Среди улучшений:
- Стратегия Bag-of-Freebies: Версия v2 включает передовые методы обучения и аугментации данных, которые значительно повышают точность, не увеличивая задержку инференса.
- Эффективный гибридный энкодер: Обрабатывая многомасштабные признаки с помощью разделенного механизма внутримасштабного и межмасштабного внимания, RTDETRv2 эффективно снижает традиционно высокую вычислительную стоимость Vision Transformer.
RTDETRv2 использует Transformer для обнаружения объектов без NMS, а новая архитектура YOLO26 реализует тот же подход с помощью дополнительной головы один-к-одному (nms=False) в высокооптимизированной структуре CNN. Это упрощает развертывание и при этом обеспечивает значительно более высокую скорость инференса на периферийных устройствах.
Сравнение производительности#
При оценке моделей для промышленной эксплуатации важно учитывать компромисс между точностью и вычислительными требованиями. В таблице ниже приведены показатели моделей разных размеров на стандартных бенчмарках.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Анализ#
Как видно из данных, YOLOv9 сохраняет значительное преимущество в эффективности использования параметров. Модель YOLOv9c достигает впечатляющих 53.0 mAP всего с 25.5M параметров, оставаясь при этом очень компактной.
В свою очередь, RTDETRv2 успешно конкурирует в категориях моделей среднего и крупного размера. Однако за это приходится платить большим количеством параметров и значительно более высоким числом FLOPs — типичной особенностью моделей на основе Transformer. Различия в архитектуре сказываются и на использовании памяти: моделям YOLO обычно требуется значительно меньше CUDA-памяти при обучении и инференсе, чем их аналогам на основе Transformer.
Преимущества Ultralytics: экосистема и универсальность#
Чисто архитектурные показатели важны, но успех проекта в сфере ИИ часто определяется программной экосистемой. Доступ к этим передовым моделям через Python API Ultralytics дает непревзойденные преимущества.
Упрощенное обучение и развертывание#
Для обучения Detection Transformer обычно требуются сложные файлы конфигурации и мощные GPU. Используя фреймворк Ultralytics, разработчики могут обучать и YOLOv9, и RT-DETR с помощью одинакового простого синтаксиса, эффективных конвейеров обучения и готовых предобученных весов.
from ultralytics import RTDETR, YOLO
# Обучи модель YOLOv9
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Обучи модель RTDETR с помощью того же API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Легко экспортируй модели в OpenVINO или TensorRT
model_yolo.export(format="openvino")Непревзойденная универсальность в решении задач#
Важное ограничение специализированных моделей, таких как RTDETRv2, — узкая специализация на обнаружении ограничивающих рамок. В отличие от них, более широкая экосистема Ultralytics, включающая такие модели, как YOLO11 и YOLOv8, поддерживает множество задач компьютерного зрения. К ним относятся попиксельная сегментация экземпляров, скелетная оценка позы, классификация всего изображения и обнаружение объектов с повернутыми ограничивающими рамками (OBB) на аэрофотоснимках.
Применение в реальных условиях#
Высокоскоростная аналитика на периферии#
Для розничных магазинов и производственных линий, где требуется распознавать товары в реальном времени на периферийных устройствах, YOLOv9 — лучший выбор. Ее архитектура GELAN обеспечивает высокую пропускную способность на устройствах с ограниченными ресурсами, таких как NVIDIA Jetson, и позволяет автоматизировать контроль качества без существенных задержек.
Анализ сложных сцен#
В таких сценариях, как наблюдение за плотными толпами или сложными транспортными перекрестками, где объекты часто перекрывают друг друга, глобальные механизмы внимания RTDETRv2 особенно эффективны. Благодаря способности анализировать контекст всего изображения модель обеспечивает надежное отслеживание и обнаружение объектов, даже когда они частично скрыты.
Сценарии использования и рекомендации#
Выбор между YOLOv9 и RT-DETR зависит от требований твоего проекта, ограничений развертывания и предпочтений относительно экосистемы.
Когда выбирать YOLOv9#
YOLOv9 — хороший выбор для:
- Исследование информационного узкого места: Академические проекты, изучающие архитектуры программируемой информации о градиентах (PGI) и обобщённой эффективной сети агрегации слоёв (GELAN).
- Исследования оптимизации потока градиентов: Работы, посвящённые изучению и устранению потери информации в глубоких слоях сети во время обучения.
- Сравнительное тестирование точного детектирования: Сценарии, в которых высокая результативность YOLOv9 на тестах COCO нужна в качестве ориентира для сравнения архитектур.
Когда выбрать RT-DETR#
RT-DETR рекомендуется для:
- Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
- Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Будущее: встречай YOLO26#
YOLOv9 и RTDETRv2 — значительные достижения, но в области компьютерного зрения все быстро меняется. Разработчикам, которые начинают новые проекты, мы рекомендуем современное решение — YOLO26.
Выпущенная в 2026 году, YOLO26 сочетает лучшие возможности CNN и DETR. В ней реализована дополнительная сквозная архитектура без NMS (nms=False), устраняющая этап постобработки с NMS. Этот подход впервые был применен в YOLOv10. Кроме того, YOLO26 отказывается от Distribution Focal Loss (DFL), что улучшает совместимость с периферийными устройствами, и представляет революционный оптимизатор MuSGD. Этот гибридный оптимизатор, вдохновленный обучением больших языковых моделей — в частности, модели Kimi K2 от Moonshot AI, — обеспечивает беспрецедентную стабильность обучения и ускоряет сходимость.
В сочетании с ProgLoss и STAL (прогрессивной функцией потерь и назначением меток с учетом малых объектов) для особенно точного распознавания небольших объектов YOLO26 обеспечивает до 43% более быстрый инференс на CPU, закрепляя за собой статус оптимальной модели для современных решений на основе ИИ.