YOLOv10 против RTDETRv2#
Сфера компьютерного зрения развивается стремительными темпами: новые архитектуры постоянно меняют представление о передовых технологиях обнаружения объектов в реальном времени. Двумя значимыми этапами этой эволюции стали YOLOv10 и RTDETRv2. Обе модели стремятся устранить фундаментальное узкое место традиционных конвейеров обнаружения, избавляясь от необходимости постобработки с подавлением немаксимумов (NMS), однако подходят к этой задаче с совершенно разных архитектурных позиций.
Это техническое сравнение содержит подробный анализ их архитектур, методик обучения и оптимальных сценариев развертывания, чтобы помочь разработчикам и исследователям выбрать подходящий инструмент для следующего проекта в области ИИ для компьютерного зрения.
YOLOv10: первопроходец без NMS#
Разработанная исследователями из Университета Ц清华, YOLOv10 уделяет особое внимание архитектурной эффективности и устранению узких мест постобработки. Благодаря введению согласованных двойных назначений для обучения без NMS модель обеспечивает конкурентоспособную производительность и одновременно существенно снижает задержку инференса.
Технические характеристики#
- Авторы: Ao Wang, Hui Chen, Lihao Liu и др.
- Организация: Университет Цинхуа
- Дата: 2024-05-23
- ArXiv: Документ YOLOv10
- GitHub: THU-MIG/yolov10
- Документация: Документация YOLOv10
Архитектура и методики#
Главный прорыв YOLOv10 заключается в целостном проектировании модели с учетом эффективности и точности. Она оптимизирует различные компоненты с обеих точек зрения, значительно снижая вычислительные затраты. Стратегия согласованных двойных назначений позволяет обучать модель без опоры на NMS, что обеспечивает более простой сквозной конвейер развертывания. Это особенно полезно при экспорте моделей в периферийные форматы, такие как ONNX или TensorRT, где операции постобработки могут вносить непредсказуемую задержку.
Преимущества и недостатки#
Модель демонстрирует исключительный баланс скорости и точности, особенно в небольших вариантах (N и S). Минимальная задержка делает ее идеальной для высокоскоростных периферийных сред. Однако, несмотря на выдающуюся скорость обнаружения объектов, YOLOv10 остается специализированной моделью только для обнаружения. Командам, которым нужны сегментация экземпляров или оценка позы, придется обратиться к более универсальным фреймворкам.
RTDETRv2: совершенствование Transformer для обнаружения объектов#
Развивая исходный Transformer для обнаружения объектов в реальном времени, RTDETRv2 использует «набор бесплатных улучшений» для совершенствования базовой версии и показывает, что Transformer может конкурировать с CNN в сценариях реального времени.
Технические характеристики#
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- ArXiv: Документ RTDETRv2
- GitHub: lyuwenyu/RT-DETR
- Документация: Документация RTDETRv2
Архитектура и методики#
RTDETRv2 использует гибридную архитектуру, объединяющую основу на базе свёрточной нейронной сети (CNN) для извлечения визуальных признаков с энкодером-декодером Transformer для комплексного понимания сцены. Механизм self-attention Transformer позволяет модели видеть изображение целиком, благодаря чему она особенно эффективно обрабатывает сложные сцены, перекрывающиеся объекты и плотные скопления людей.
Преимущества и недостатки#
Архитектура Transformer обеспечивает высокую точность, особенно при большом количестве параметров, и изначально выдает итоговые обнаружения без NMS. Однако это имеет свою цену. Для обучения моделей Transformer традиционно требуется значительно больше памяти CUDA, а сходимость у них может быть медленнее по сравнению с архитектурами, основанными исключительно на CNN. Хотя RTDETRv2 работает быстрее на этапе инференса, обычно она потребляет больше памяти, чем легковесные варианты YOLO.
Сравнение производительности#
Оценка метрик производительности позволяет яснее понять, в чем каждая модель превосходит другие. В следующей таблице показаны их возможности на датасете COCO:
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
При анализе данных видно, что YOLOv10 сохраняет заметное преимущество по эффективности использования параметров и скорости инференса TensorRT при сопоставимых размерах. RTDETRv2-x соответствует массивной YOLOv10x по точности, но требует почти на 20 миллионов параметров больше и значительно большего количества FLOPs.
Варианты применения и рекомендации#
Выбор между YOLOv10 и RT-DETR зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда выбирать YOLOv10#
YOLOv10 — подходящий выбор для:
- Обнаружения объектов в реальном времени без NMS: приложений, которым полезно сквозное обнаружение без подавления немаксимумов, что снижает сложность развертывания.
- Сбалансированного соотношения скорости и точности: проектов, требующих удачного баланса между скоростью инференса и точностью обнаружения для моделей разных размеров.
- Приложений со стабильной задержкой: сценариев развертывания, где критически важны предсказуемые времена инференса, например в робототехнике или автономных системах.
Когда стоит выбрать RT-DETR#
RT-DETR рекомендуется для:
- Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
- Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Преимущество Ultralytics: экосистема и инновации#
Хотя YOLOv10 и RTDETRv2 обеспечивают надежное обнаружение объектов, выбор модели часто определяется окружающей ее программной экосистемой. Платформа Ultralytics предоставляет удобный унифицированный интерфейс, скрывающий сложность глубокого обучения.
Новый стандарт: Ultralytics YOLO26#
Для разработчиков, которым нужна максимально высокая производительность, Ultralytics YOLO26 становится результатом последних архитектурных достижений. Выпущенная в начале 2026 года, YOLO26 унаследовала сквозную конструкцию без NMS, впервые представленную в YOLOv10, и полностью устраняет постобработку NMS для более быстрого и простого развертывания.
YOLO26 переносит инновации обучения LLM в компьютерное зрение с помощью оптимизатора MuSGD (гибрида SGD и Muon), обеспечивая более стабильное обучение и быструю сходимость. Кроме того, она обеспечивает до 43% более быстрый инференс на CPU, что делает ее оптимальным выбором для периферийных вычислений.
Кроме того, YOLO26 представляет ProgLoss + STAL, заметно улучшая распознавание небольших объектов, и, в отличие от специализированной YOLOv10, предлагает исключительную универсальность. Модель изначально поддерживает обнаружение объектов, сегментацию, оценку позы и ориентированные ограничивающие рамки (OBB), а также улучшения для конкретных задач, такие как функция потерь семантической сегментации и оценка остаточного логарифма правдоподобия (RLE) для позы. Кроме того, удаление Distribution Focal Loss (DFL) упрощает экспорт и повышает совместимость с маломощными устройствами.
Простота использования и эффективность обучения#
Экспериментируешь ли ты со старыми поколениями моделей, такими как Ultralytics YOLO11, или с передовой YOLO26, оптимизированный Python API обеспечивает меньшее потребление памяти во время обучения и чрезвычайно быстрые рабочие процессы.
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")Поддерживаемая в актуальном состоянии экосистема предоставляет инструменты для удобной настройки гиперпараметров и безупречно интегрируется с обширными решениями для отслеживания и вариантами развертывания моделей.
Заключение#
YOLOv10 и RTDETRv2 стали важными этапами на пути к обнаружению объектов без NMS. RTDETRv2 доказывает, что Transformer может обеспечивать задержку реального времени и отлично понимать глобальный контекст, хотя и требует больше памяти. YOLOv10 предлагает высокоэффективную и быструю альтернативу на базе CNN, адаптированную для задач обнаружения при ограниченных ресурсах.
Однако для сбалансированной производительности, универсальности в многозадачных сценариях и наиболее зрелой экосистемы разработчикам настоятельно рекомендуется использовать Ultralytics YOLO26. Она удачно объединяет архитектурные инновации предшественников с надежными и удобными инструментами, благодаря которым развертывание ИИ для компьютерного зрения становится простым и доступным.