Ultralytics YOLO27:

YOLOv9 против RTDETRv2#

За последние годы в области обнаружения объектов в реальном времени произошел сдвиг парадигмы. Сформировались две различные архитектурные философии, доминирующие в этой области: высокооптимизированные сверточные нейронные сети (CNNs) и Detection Transformers (DETRs) реального времени. Вершиной этих двух подходов являются YOLOv9 и RTDETRv2.

Это подробное руководство сравнивает две мощные модели, анализируя их архитектурные инновации, метрики производительности и оптимальные сценарии развертывания, чтобы помочь тебе выбрать подходящую модель для своего конвейера компьютерного зрения.

Краткий обзор#

Обе модели достигают передовых результатов, но рассчитаны на несколько разные ограничения развертывания и экосистемы разработки.

  • Выбирай YOLOv9, если: тебе нужна высокая эффективность использования параметров и быстрый инференс на периферийных устройствах. YOLOv9 расширяет теоретические пределы эффективности CNN, что делает модель идеальной для сред с жесткими ограничениями вычислительных ресурсов.
  • Выбирай RTDETRv2, если: тебе требуется детальное понимание контекста, которое обеспечивают Transformer, особенно в сценах с сильными перекрытиями или сложными взаимосвязями объектов, и у тебя есть оборудование для поддержки немного более тяжелой архитектуры.
  • Выбирай YOLO26 (рекомендуется), если: тебе нужно лучшее из обоих миров. Как новейшее доступное поколение на Ultralytics Platform, YOLO26 оснащена встроенной архитектурой без NMS от начала до конца (аналогичной моделям DETR, но значительно более быстрой), которая устраняет узкие места постобработки и обеспечивает до 43% более быстрый инференс на CPU по сравнению с предыдущими поколениями.

Технические характеристики и авторство#

Понимание происхождения и замысла этих моделей дает важный контекст для их архитектурных решений.

YOLOv9#

Узнай больше о YOLOv9

RTDETRv2#

Архитектурные инновации#

YOLOv9: устранение информационного узкого места#

Ultralytics YOLOv9 внедряет две ключевые инновации, предназначенные для устранения потери информации по мере прохождения данных через глубокие нейронные сети:

  1. Программируемая градиентная информация (PGI): эта вспомогательная система обучения гарантирует формирование надежных градиентов для обновления весов сети, сохраняя важную информацию о признаках даже в очень глубоких слоях сети.
  2. Обобщенная сеть эффективной агрегации слоев (GELAN): новая архитектура, объединяющая сильные стороны CSPNet и ELAN. GELAN оптимизирует эффективность использования параметров, позволяя YOLOv9 достигать более высокой точности при меньшем количестве FLOPs по сравнению с традиционными CNN.

RTDETRv2: улучшение Transformer реального времени#

Развивая успех оригинальной RT-DETR, RTDETRv2 использует архитектуру на основе Transformer, которая изначально устраняет необходимость в подавлении немаксимумов (NMS). Среди улучшений:

  1. Стратегия Bag-of-Freebies: итерация v2 включает передовые методы обучения и аугментации данных, которые значительно повышают точность без увеличения задержки инференса.
  2. Эффективный гибридный энкодер: обрабатывая многоуровневые признаки с помощью раздельного механизма внимания внутри одного масштаба и между масштабами, RTDETRv2 эффективно управляет традиционно высокой вычислительной стоимостью Vision Transformer.
Обнаружение от начала до конца

Хотя RTDETRv2 использует Transformer для обнаружения без NMS, новая архитектура YOLO26 реализует эту возможность непосредственно в высокооптимизированной структуре CNN, обеспечивая такое же упрощенное развертывание, но значительно более высокую скорость инференса на периферийных устройствах.

Сравнение производительности#

При оценке моделей для промышленной эксплуатации критически важно учитывать компромисс между точностью и вычислительными требованиями. В таблице ниже приведена производительность моделей разных размеров на стандартных бенчмарках.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Анализ#

Как показывают данные, YOLOv9 сохраняет существенное преимущество по эффективности использования параметров. Модель YOLOv9c достигает впечатляющего показателя 53.0 mAP всего с 25.3M параметров, что делает ее невероятно легковесной.

В свою очередь, RTDETRv2 успешно конкурирует в категориях моделей среднего и большого размера. Однако это достигается ценой большего количества параметров и значительно большего числа FLOPs, что характерно для моделей Transformer. Это архитектурное различие также отражается на использовании памяти: модели YOLO обычно требуют значительно меньше памяти CUDA во время обучения и инференса по сравнению со своими аналогами на базе Transformer.

Преимущество Ultralytics: экосистема и универсальность#

Хотя чисто архитектурные метрики важны, успех проекта в области ИИ часто определяется программной экосистемой. Доступ к этим передовым моделям через Ultralytics Python API дает непревзойденные преимущества.

Упрощенное обучение и развертывание#

Обучение детекционного трансформера обычно требует сложных конфигурационных файлов и высокопроизводительных графических процессоров. Используя фреймворк Ultralytics, ты можешь обучать модели YOLOv9 и RT-DETR с помощью одинакового простого синтаксиса, используя высокоэффективные конвейеры обучения и готовые предобученные веса.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")

Непревзойденная универсальность задач#

Существенное ограничение специализированных моделей, таких как RTDETRv2, — узкая специализация на обнаружении ограничивающих рамок. В отличие от них, более широкая экосистема Ultralytics, включающая такие модели, как YOLO11 и YOLOv8, поддерживает широкий спектр задач компьютерного зрения. В их число входят попиксельная сегментация экземпляров, оценка позы по скелетной структуре, классификация всего изображения и обнаружение ориентированных ограничивающих рамок (OBB) на аэрофотоснимках.

Практические применения#

Высокоскоростная аналитика на периферии#

Для розничной торговли или производственных линий, где требуется распознавание товаров в реальном времени на периферийных устройствах, YOLOv9 — лучший выбор. Ее архитектура GELAN обеспечивает высокую пропускную способность на устройствах с ограниченными ресурсами, таких как серия NVIDIA Jetson, позволяя автоматизировать контроль качества без значительных задержек.

Анализ сложных сцен#

В таких сценариях, как наблюдение за плотными толпами или сложными транспортными перекрестками, где объекты часто перекрывают друг друга, глобальные механизмы внимания RTDETRv2 раскрывают весь свой потенциал. Способность модели изначально рассуждать обо всем контексте изображения позволяет ей сохранять надежное отслеживание и обнаружение, даже когда объекты частично скрыты.

Варианты применения и рекомендации#

Выбор между YOLOv9 и RT-DETR зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать YOLOv9#

YOLOv9 — хороший выбор для:

  • Исследований информационного узкого места: академических проектов, изучающих архитектуры Programmable Gradient Information (PGI) и Generalized Efficient Layer Aggregation Network (GELAN).
  • Исследований оптимизации потока градиентов: работ, посвященных пониманию и устранению потери информации в слоях глубоких сетей во время обучения.
  • Сравнительного тестирования обнаружения с высокой точностью: сценариев, где высокие результаты YOLOv9 на тесте COCO нужны как эталон для архитектурных сравнений.

Когда стоит выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Будущее: встречайте YOLO26#

Хотя YOLOv9 и RTDETRv2 являются выдающимися достижениями, область компьютерного зрения развивается стремительно. Разработчикам, которые хотят начать новые проекты, рекомендуется использовать YOLO26 — современное передовое решение.

Выпущенная в 2026 году, YOLO26 объединяет лучшие возможности CNN и DETR. Она оснащена архитектурой без NMS от начала до конца, полностью устраняющей задержку постобработки, — этот метод впервые был внедрен в YOLOv10. Кроме того, YOLO26 отказывается от распределенной фокальной функции потерь (DFL) для лучшей совместимости с периферийными устройствами и внедряет революционный оптимизатор MuSGD. Этот гибридный оптимизатор, вдохновленный обучением больших языковых моделей (в частности, Kimi K2 от Moonshot AI), обеспечивает беспрецедентную стабильность обучения и более быструю сходимость.

В сочетании с улучшенными функциями потерь, такими как ProgLoss и STAL, для исключительного распознавания малых объектов YOLO26 обеспечивает до 43% более быстрый инференс на CPU, закрепляя за собой статус оптимальной модели для современных развертываний ИИ.

Комментарии