RTDETRv2 и YOLOv6-3.0#
Сфера компьютерного зрения постоянно развивается, и разработчикам приходится выбирать из множества архитектур обнаружения объектов. Две заметные модели представляют разные подходы: RTDETRv2 — современный vision Transformer, а YOLOv6-3.0 — высокооптимизированная свёрточная нейронная сеть (CNN), предназначенная для промышленного применения.
В этом подробном техническом сравнении рассматриваются архитектуры моделей, показатели производительности и оптимальные сценарии развёртывания. Мы также разберём, как широкая экосистема Ultralytics обеспечивает более удобную работу разработчика и какие возможности следующего поколения предлагает Ultralytics YOLO26.
RTDETRv2: подход на основе vision Transformer#
Разработанная исследователями Baidu, RTDETRv2 развивает основы оригинальной RT-DETR и знаменует собой значительный шаг вперёд в области обнаружения объектов на базе Transformer.
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: lyuwenyu/RT-DETR
- Документация: README RTDETRv2 на GitHub
Основные особенности архитектуры#
RTDETRv2 использует гибридную архитектуру, сочетающую экстрактор признаков CNN с мощным декодером Transformer. Главная отличительная особенность этой модели — изначально без-NMS-дизайн. Устраняя подавление немаксимумов (NMS) на этапе постобработки, модель напрямую предсказывает ограничивающие рамки, что упрощает развёртывание и стабилизирует задержку инференса.
Встроенный в RTDETRv2 «набор бесплатных улучшений» повышает способность модели работать со сложными сценами и перекрывающимися объектами, поскольку механизмы глобального внимания по своей природе лучше учитывают пространственные взаимосвязи, чем локальные свёртки.
Хотя Transformer хорошо справляются с пониманием сложных сцен, при обучении им обычно требуется значительно больше CUDA-памяти, чем CNN. Это может ограничивать размер пакета на обычных потребительских GPU и увеличивать общее время обучения.
YOLOv6-3.0: максимальная производительность в промышленности#
Разработанная отделом Vision AI компании Meituan, YOLOv6-3.0 была специально создана как детектор нового поколения для промышленных конвейеров, где пропускная способность GPU имеет первостепенное значение.
- Авторы: Чуйи Ли, Лулу Ли, Ифэй Гэн, Хунлян Цзян, Мэн Чэн, Бо Чжан, Зайдань Кэ, Сяомин Сюй и Сянсян Чу
- Организация: Meituan
- Дата: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Особенности архитектуры#
В основе YOLOv6-3.0 лежит магистральная сеть EfficientRep, тщательно разработанная для минимизации затрат на доступ к памяти аппаратных ускорителей, таких как GPU NVIDIA. В архитектуре шеи используется модуль двунаправленной конкатенации (BiC), улучшающий слияние признаков на разных масштабах.
При обучении модель использует стратегию обучения с поддержкой якорей (AAT), чтобы воспользоваться преимуществами парадигм на основе якорей, сохраняя при этом безъякорный режим инференса для более быстрого выполнения. Модель обеспечивает исключительную пропускную способность на серверных GPU (например, T4 и A100), однако её специализированная архитектура может приводить к неоптимальной задержке при развёртывании на периферийных устройствах только с CPU.
Сравнение производительности#
При выборе моделей для промышленной эксплуатации важно найти баланс между точностью (mAP), скоростью инференса и вычислительными затратами (FLOPs). В таблице ниже показано, как эти модели соотносятся друг с другом.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
YOLOv6-3.0 лидирует по чистой скорости обработки на TensorRT, а RTDETRv2 показывает более высокие значения mAP, особенно хорошо масштабируясь в более крупных вариантах модели. Однако обеим моделям недостаёт широкой универсальности современных унифицированных фреймворков. YOLOv6-3.0 предназначена преимущественно для обнаружения объектов и изначально не поддерживает такие задачи, как сегментация экземпляров и оценка позы.
Сценарии использования и рекомендации#
Выбор между RT-DETR и YOLOv6 зависит от требований конкретного проекта, ограничений развёртывания и предпочтительной экосистемы.
Когда выбрать RT-DETR#
RT-DETR — отличный выбор для:
- Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
- Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.
Когда стоит выбрать YOLOv6#
YOLOv6 рекомендуется для следующих задач:
- Развертывание с учетом промышленного оборудования: сценарии, в которых аппаратно-ориентированный дизайн и эффективная репараметризация модели обеспечивают оптимальную производительность на конкретном целевом оборудовании.
- Быстрая одноэтапная детекция: приложения, где приоритетом является максимальная скорость инференса на GPU для обработки видео в реальном времени в контролируемых условиях.
- Интеграция с экосистемой Meituan: команды, уже работающие с технологическим стеком и инфраструктурой развертывания Meituan.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Преимущества Ultralytics#
Выбор подходящей модели зависит не только от результатов тестов: не менее важны удобство разработки, гибкость развёртывания и поддержка экосистемы. Используя модели, интегрированные в платформу Ultralytics, пользователи получают существенные преимущества по сравнению со статичными исследовательскими репозиториями.
- Простота использования: пакет Python
ultralyticsпредоставляет удобный API. Для обучения, валидации и экспорта моделей достаточно нескольких строк кода. - Поддерживаемая экосистема: в отличие от изолированных академических репозиториев, платформа Ultralytics активно развивается. Она предлагает надёжную интеграцию с такими инструментами, как ONNX, OpenVINO и CoreML.
- Эффективность обучения: при обучении модели Ultralytics обычно используют значительно меньше VRAM, чем архитектуры Transformer, например RTDETRv2. Благодаря этому на потребительском оборудовании можно использовать более крупные пакеты.
- Универсальность: в отличие от узкой специализации YOLOv6-3.0, модели Ultralytics поддерживают несколько задач, включая сегментацию, классификацию изображений и ориентированные ограничивающие рамки (OBB), в рамках единого унифицированного фреймворка.
Экспорт обученной модели для развёртывания на периферийном устройстве с помощью CLI Ultralytics так же прост, как запуск команды: yolo export model=yolo11n.pt format=tensorrt.
Знакомься с YOLO26: универсальное решение#
RTDETRv2 и YOLOv6-3.0 предлагают определённые преимущества, но эта область развивается стремительно. Командам, которые начинают новые проекты в области компьютерного зрения, мы настоятельно рекомендуем YOLO26, выпущенную Ultralytics в январе 2026 года.
YOLO26 объединяет сильные стороны промышленных CNN и современных Transformer, устраняя при этом их недостатки:
- Сквозная архитектура без NMS: используя прорывной подход, впервые представленный в YOLOv10, YOLO26 предлагает опциональную голову без NMS (
nms=False), которая устраняет постобработку с NMS и обеспечивает стабильное, предсказуемое развёртывание, как у RTDETRv2, но с гораздо меньшими накладными расходами. - Оптимизатор MuSGD: этот гибридный оптимизатор, вдохновлённый передовыми методами обучения LLM (например, Kimi K2 от Moonshot AI), обеспечивает стабильное обучение и более быструю сходимость, устраняя печально известную нестабильность традиционных vision Transformer.
- Оптимизация для периферийных устройств: благодаря инференсу на CPU до 43% быстрее, чем у предыдущих поколений, и целенаправленному отказу от Distribution Focal Loss (DFL), YOLO26 отлично подходит для мобильных и IoT-устройств без GPU-ускорения.
- ProgLoss + STAL: эти усовершенствованные функции потерь заметно улучшают распознавание небольших объектов — давнюю проблему CNN, — поэтому YOLO26 подходит для аэрофотоснимков и робототехники.
Пример обучения#
Интуитивно понятный API Ultralytics позволяет легко обучать передовые модели. Ниже приведён готовый к запуску пример обучения модели YOLO26 Nano на наборе данных COCO8:
from ultralytics import YOLO
# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")
# Export the trained model to ONNX format for production
model.export(format="onnx")Итоги#
При выборе между RTDETRv2 и YOLOv6-3.0 многое зависит от конкретного оборудования и ограничений по задержке. RTDETRv2 особенно эффективна в исследовательских средах и при обработке на сервере, где важно работать со сложными перекрывающимися объектами. YOLOv6-3.0 остаётся отличным выбором для высокопроизводительных производственных линий с мощными GPU NVIDIA.
Однако для разработчиков, которым нужно лучшее из двух подходов — изящество Transformer без NMS, а также высокая скорость и низкое потребление памяти CNN, — YOLO26 не имеет равных. Благодаря подробной документации и активному сообществу экосистемы Ultralytics YOLO26 помогает создавать надёжные, масштабируемые и готовые к будущему проекты в области компьютерного зрения.