RTDETRv2 и YOLOv10#
Развитие компьютерного зрения во многом определялось постоянным стремлением сбалансировать скорость и точность. Традиционно конвейеры обнаружения объектов в реальном времени использовали подавление немаксимумов (NMS) на этапе постобработки для фильтрации перекрывающихся ограничивающих рамок. Однако NMS создает узкие места, увеличивающие задержку, и усложняет настройку гиперпараметров. Недавно появились два разных архитектурных подхода, позволяющих решить эту проблему нативно: модели на основе Transformer, такие как RTDETRv2, и модели на основе CNN, такие как YOLOv10.
В этом руководстве приводится подробное техническое сравнение этих двух моделей: рассматриваются их архитектуры, показатели производительности и оптимальные варианты применения, а также показывается, как новейшие инновации экосистемы Ultralytics предлагают оптимальное решение для современного развертывания.
RTDETRv2: Transformer-модели обнаружения в реальном времени#
RTDETRv2 развивает исходную архитектуру RT-DETR, стремясь объединить понимание глобального контекста, свойственное Vision Transformer, со скоростью работы в реальном времени, которой традиционно славятся модели YOLO.
Ключевые характеристики:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: https://github.com/lyuwenyu/RT-DETR/tree/main/rtdetrv2_pytorch
Архитектура и методики обучения#
RTDETRv2 использует сквозную архитектуру Transformer, которая изначально не требует NMS. По сравнению с предшественником модель улучшена за счет подхода «Bag-of-Freebies», оптимизации стратегии обучения и добавления возможностей многомасштабного обнаружения. Модель использует CNN-бэкбон для извлечения карт признаков (визуальных деталей, таких как границы и текстуры), которые затем обрабатываются структурой кодировщика-декодировщика Transformer. Благодаря этому модель может одновременно анализировать контекст всего изображения, что делает ее особенно эффективной при работе со сложными сценами, где объекты расположены плотно или перекрываются.
Преимущества и недостатки#
Преимущества:
- Глобальный контекст: Механизм внимания позволяет модели превосходно работать в сложных, загроможденных сценах.
- Без NMS: Модель напрямую предсказывает координаты объектов, упрощая конвейер развертывания.
- Высокая точность: Модель достигает отличного значения средней точности (mAP) на наборе данных COCO.
Недостатки:
- Высокие требования к ресурсам: Архитектуры Transformer обычно требуют значительно больше памяти CUDA во время обучения по сравнению с CNN, поэтому их тонкая настройка на стандартном оборудовании обходится дорого.
- Переменная скорость инференса: Хотя модель работает быстро, ресурсоемкие вычисления внимания могут приводить к более низкому значению FPS в компьютерном зрении на периферийных устройствах без специализированных AI-ускорителей.
YOLOv10: обнаружение объектов в реальном времени от начала до конца#
YOLOv10 знаменует собой серьезный поворот в направлении обнаружения объектов YOLO, напрямую устраняя давнее узкое место, связанное с NMS, в рамках CNN-архитектуры.
Ключевые характеристики:
- Авторы: Ao Wang, Hui Chen, Lihao Liu и др.
- Организация: Университет Цинхуа
- Дата: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
Архитектура и методики обучения#
Ключевая инновация YOLOv10 — согласованные двойные назначения для обучения без NMS. Во время обучения используются две головы обнаружения: одна с назначением «один-ко-многим» (как в традиционных моделях YOLO) для предоставления богатых обучающих сигналов, а другая — с назначением «один-к-одному» для устранения необходимости в NMS. Во время инференса используется только голова с назначением «один-к-одному», что обеспечивает сквозной процесс. Кроме того, авторы применили целостную стратегию проектирования моделей, ориентированную на эффективность и точность, комплексно оптимизировав различные компоненты для сокращения вычислительной избыточности.
Преимущества и недостатки#
Преимущества:
- Экстремальная скорость: Благодаря удалению NMS и оптимизации архитектуры YOLOv10 обеспечивает исключительно низкую задержку инференса.
- Эффективность: Для достижения сопоставимой с другими моделями точности требуется меньше параметров и FLOPs, что делает модель особенно подходящей для сред с ограниченными ресурсами.
- Развертывание без NMS: Упрощает интеграцию в периферийные приложения, такие как интеллектуальное видеонаблюдение.
Недостатки:
- Концепция первого поколения: Как первая модель YOLO с такой архитектурой без NMS, она заложила основу, но оставила возможности для дальнейшего развития универсальности в многозадачных сценариях и оптимизации, реализованных в последующих моделях, таких как YOLO11 и YOLO26.
Сравнение производительности#
При оценке моделей для промышленной эксплуатации критически важно сбалансировать точность и вычислительные затраты. В таблице ниже показан компромисс между производительностью различных вариантов RTDETRv2 и YOLOv10.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
Хотя RTDETRv2 обеспечивает стабильную точность, YOLOv10 демонстрирует заметное преимущество по задержке и эффективности использования параметров, особенно в небольших вариантах (Nano и Small), что делает модель особенно привлекательной для приложений периферийных вычислений и AIoT.
Если ты развертываешь модель на серверных GPU, где размер батча и VRAM не являются серьезными ограничениями, более крупные модели (например, -x или -l) обеспечат максимальную точность. Для периферийных устройств, таких как Raspberry Pi или мобильные телефоны, выбирай варианты Nano (-n) или Small (-s), чтобы сохранять частоту кадров в реальном времени.
Варианты применения и рекомендации#
Выбор между RT-DETR и YOLOv10 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда стоит выбрать RT-DETR#
RT-DETR — подходящий выбор для:
- Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
- Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.
Когда выбирать YOLOv10#
YOLOv10 рекомендуется для:
- Обнаружения объектов в реальном времени без NMS: приложений, которым полезно сквозное обнаружение без подавления немаксимумов, что снижает сложность развертывания.
- Сбалансированного соотношения скорости и точности: проектов, требующих удачного баланса между скоростью инференса и точностью обнаружения для моделей разных размеров.
- Приложений со стабильной задержкой: сценариев развертывания, где критически важны предсказуемые времена инференса, например в робототехнике или автономных системах.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Преимущество Ultralytics: знакомство с YOLO26#
Хотя RTDETRv2 и YOLOv10 предлагают впечатляющие академические достижения, их использование в реальных сценариях требует надежной, хорошо поддерживаемой программной экосистемы. Платформа Ultralytics обеспечивает исключительный опыт для разработчиков, объединяя простоту использования, обширную документацию и мощные инструменты для аннотирования данных и развертывания.
Для разработчиков, которым в 2026 году нужен абсолютный передний край технологий, Ultralytics YOLO26 — оптимальная рекомендация. Она объединяет лучшие идеи обеих архитектур и предлагает революционные улучшения:
- Сквозная архитектура без NMS: Развивая концепцию, впервые реализованную в YOLOv10, YOLO26 нативно устраняет постобработку NMS, обеспечивая более быстрое и простое развертывание, а также нулевую вариативность задержки.
- Удаление DFL: Удаление функции потерь Distribution Focal Loss упрощает экспорт модели и значительно улучшает совместимость с периферийными устройствами и устройствами с низким энергопотреблением.
- Оптимизатор MuSGD: Этот новый оптимизатор, представляющий собой гибрид SGD и Muon (вдохновленный инновациями в обучении LLM), обеспечивает более стабильное обучение и значительно более быструю сходимость по сравнению с традиционными методами.
- До 43% более быстрый инференс на CPU: Тщательно оптимизирован для сред без выделенных GPU, делая высокопроизводительный AI для компьютерного зрения доступнее.
- ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание небольших объектов, что особенно важно для приложений с использованием дронов и IoT-сенсоров.
- Непревзойденная универсальность: В отличие от моделей, ограниченных ограничивающими рамками, YOLO26 поддерживает полный набор задач, включая сегментацию экземпляров, оценку позы, классификацию изображений и обнаружение OBB, а также специализированные улучшения, такие как оценка остаточного логарифмического правдоподобия (RLE) для позы.
Простая реализация с Python#
Обучение и развертывание этих моделей с помощью Python API Ultralytics разработано так, чтобы проходить без лишних сложностей. Во время обучения требования к памяти заметно ниже, чем у архитектур с большим количеством Transformer-компонентов, что позволяет тебе обучать мощные модели на стандартном оборудовании.
from ultralytics import YOLO
# Load the cutting-edge YOLO26 model (recommended)
# Alternatively, load a YOLOv10 model using YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Easily export to various formats for edge deployment
model.export(format="onnx", simplify=True)Будь то реализация систем охранной сигнализации или проведение анализа медицинских изображений, выбор модели с поддержкой активного сообщества Ultralytics гарантирует доступ к инструментам, руководствам по настройке гиперпараметров и постоянным обновлениям, необходимым для успеха. YOLOv10 и RTDETRv2 проложили путь для архитектур без NMS, а YOLO26 доводит эту формулу до совершенства, предлагая оптимальный баланс производительности, универсальности и готовности к промышленной эксплуатации.