RTDETRv2 и YOLOv6-3.0#
Ландшафт компьютерного зрения постоянно меняется, предлагая разработчикам множество вариантов архитектур для обнаружения объектов. Две заметные модели, представляющие разные подходы, — это RTDETRv2, современный vision Transformer, и YOLOv6-3.0, высокооптимизированная сверточная нейронная сеть (CNN), разработанная для промышленных приложений.
В этом подробном техническом сравнении рассматриваются архитектуры этих моделей, показатели производительности и оптимальные сценарии развертывания. Мы также рассмотрим, как более широкая экосистема Ultralytics обеспечивает превосходный опыт для разработчиков, и обратим внимание на возможности нового поколения Ultralytics YOLO26.
RTDETRv2: подход на основе vision Transformer#
Разработанная исследователями из Baidu, RTDETRv2 основана на исходной RT-DETR и представляет собой значительный шаг вперед в обнаружении объектов на основе Transformer обнаружении объектов.
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: lyuwenyu/RT-DETR
- Документация: README на GitHub для RTDETRv2
Архитектурные особенности#
RTDETRv2 использует гибридную архитектуру, объединяющую экстрактор признаков на основе CNN с мощным декодером Transformer. Главная отличительная особенность этой модели — встроенная архитектура без NMS. Благодаря устранению подавления немаксимумов (NMS) на этапе постобработки модель напрямую предсказывает ограничивающие рамки, что упрощает развертывание и стабилизирует задержку инференса.
Встроенный в RTDETRv2 «Bag-of-Freebies» повышает способность модели работать со сложными сценами и перекрывающимися объектами, поскольку механизмы глобального внимания лучше понимают пространственные взаимосвязи, чем локализованные свертки.
Хотя Transformer отлично справляются с пониманием сложных сцен, во время обучения им обычно требуется значительно больше памяти CUDA, чем CNN. Это может ограничивать размеры пакетов на стандартных потребительских GPU и увеличивать общее время обучения.
YOLOv6-3.0: максимизация промышленной пропускной способности#
Созданная в подразделении Vision AI компании Meituan, YOLOv6-3.0 была специально разработана как детектор нового поколения для промышленных конвейеров, где пропускная способность GPU имеет первостепенное значение.
- Авторы: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu и Xiangxiang Chu
- Организация: Meituan
- Дата: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Архитектурные особенности#
YOLOv6-3.0 использует магистральную сеть EfficientRep, тщательно спроектированную для минимизации затрат на доступ к памяти аппаратных ускорителей, таких как GPU NVIDIA. Архитектура шеи включает двунаправленный модуль конкатенации (BiC) для улучшения слияния признаков на разных масштабах.
Во время обучения применяется стратегия обучения с поддержкой якорей (AAT), позволяющая использовать преимущества парадигм на основе якорей при сохранении безъякорного режима инференса для более быстрого выполнения. Хотя модель обеспечивает исключительную пропускную способность на серверных GPU (например, T4 и A100), ее специализированная архитектура может приводить к неоптимальной задержке при развертывании на периферийных устройствах только с CPU.
Сравнение производительности#
При оценке моделей для промышленной эксплуатации критически важно сбалансировать точность (mAP), скорость инференса и вычислительные затраты (FLOPs). В таблице ниже показано, как эти модели сопоставляются друг с другом.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
YOLOv6-3.0 превосходит RTDETRv2 по чистой скорости обработки в TensorRT, тогда как RTDETRv2 достигает более высоких показателей mAP, особенно лучше масштабируясь на более крупных вариантах моделей. Однако обеим моделям не хватает широкой универсальности, характерной для современных унифицированных фреймворков. YOLOv6-3.0 в основном специализируется на обнаружении и не поддерживает изначально такие задачи, как сегментация экземпляров и оценка позы.
Варианты применения и рекомендации#
Выбор между RT-DETR и YOLOv6 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений относительно экосистемы.
Когда стоит выбрать RT-DETR#
RT-DETR — подходящий выбор для:
- Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
- Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.
Когда стоит выбрать YOLOv6#
YOLOv6 рекомендуется для:
- Развертывание с учетом промышленного оборудования: сценарии, в которых аппаратно-ориентированный дизайн модели и эффективная репараметризация обеспечивают оптимальную производительность на конкретном целевом оборудовании.
- Быстрое одностадийное обнаружение: приложения, в которых приоритетом является максимальная скорость инференса на GPU для обработки видео в реальном времени в контролируемых средах.
- Интеграция с экосистемой Meituan: команды, уже работающие в технологическом стеке и инфраструктуре развертывания Meituan.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Преимущества Ultralytics#
Выбор подходящей модели — это не только сырые показатели бенчмарков: опыт разработчиков, гибкость развертывания и поддержка экосистемы не менее важны. Используя модели, интегрированные в платформу Ultralytics, пользователи получают значительные преимущества по сравнению со статичными исследовательскими репозиториями.
- Простота использования: пакет
ultralyticsдля Python предоставляет удобный API. Для обучения, валидации и экспорта моделей достаточно всего нескольких строк кода. - Экосистема с активной поддержкой: в отличие от изолированных академических репозиториев, платформа Ultralytics активно обновляется. Она предлагает надежные интеграции с такими инструментами, как ONNX, OpenVINO и CoreML.
- Эффективность обучения: модели Ultralytics обычно потребляют значительно меньше VRAM во время обучения по сравнению с архитектурами на основе Transformer, такими как RTDETRv2, что позволяет использовать большие размеры пакетов на оборудовании потребительского уровня.
- Универсальность: В отличие от узкой направленности YOLOv6-3.0, модели Ultralytics являются многозадачными и изначально поддерживают классификацию изображений, ориентированные ограничивающие рамки (OBB) и сегментацию в рамках единой универсальной платформы.
С помощью CLI Ultralytics экспорт обученной модели для развертывания на периферийном устройстве выполняется так же просто, как запуск команды: yolo export model=yolo11n.pt format=tensorrt.
YOLO26: универсальное решение#
Хотя RTDETRv2 и YOLOv6-3.0 предлагают определенные преимущества, эта область быстро развивается. Командам, начинающим новые проекты в области компьютерного зрения, мы настоятельно рекомендуем YOLO26, выпущенную Ultralytics в январе 2026 года.
YOLO26 объединяет сильные стороны промышленных CNN и современных Transformer, устраняя присущие им недостатки:
- Сквозная архитектура без NMS: переняв прорывной подход, впервые представленный в YOLOv10, YOLO26 изначально устраняет постобработку NMS, обеспечивая стабильное и предсказуемое развертывание, аналогичное RTDETRv2, но с гораздо меньшими накладными расходами.
- Оптимизатор MuSGD: этот гибридный оптимизатор, вдохновленный передовыми методами обучения LLM, такими как Kimi K2 от Moonshot AI, обеспечивает стабильное обучение и более быструю сходимость, устраняя общеизвестную нестабильность традиционных vision Transformer.
- Оптимизация для периферийных устройств: благодаря инференсу на CPU, который до 43% быстрее, чем у предыдущих поколений, и стратегическому отказу от Distribution Focal Loss (DFL), YOLO26 идеально подходит для мобильных устройств и IoT-устройств, где ускорение GPU недоступно.
- ProgLoss + STAL: эти передовые функции потерь заметно улучшают распознавание небольших объектов — исторически сложную задачу для CNN, — что делает YOLO26 идеальным решением для аэрофотосъемки и робототехники.
Пример обучения#
Интуитивно понятный API Ultralytics позволяет легко обучать современные модели. Ниже приведен исполняемый пример обучения Nano-модели YOLO26 на датасете COCO8:
from ultralytics import YOLO
# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")
# Export the trained model to ONNX format for production
model.export(format="onnx")Итоги#
При сравнении RTDETRv2 и YOLOv6-3.0 выбор во многом зависит от конкретного оборудования и ограничений по задержке. RTDETRv2 особенно эффективна в исследовательских средах и при серверной обработке, где критически важно работать со сложными перекрывающимися объектами. YOLOv6-3.0 остается отличным выбором для высокопроизводительных производственных линий, оснащенных мощными GPU NVIDIA.
Однако для разработчиков, которым нужно лучшее из обоих подходов — сочетание элегантности Transformer без NMS с высокой скоростью и малым объемом памяти CNN, — YOLO26 остается непревзойденной. Благодаря подробной документации и активному сообществу экосистемы Ultralytics YOLO26 обеспечивает надежность, масштабируемость и долгосрочную актуальность твоих проектов в области vision AI.