Ultralytics YOLO27:
Get Started

RTDETRv2 и YOLOv6-3.0#

Сфера компьютерного зрения постоянно развивается, и разработчикам приходится выбирать из множества архитектур обнаружения объектов. Две заметные модели представляют разные подходы: RTDETRv2 — современный vision Transformer, а YOLOv6-3.0 — высокооптимизированная свёрточная нейронная сеть (CNN), предназначенная для промышленного применения.

В этом подробном техническом сравнении рассматриваются архитектуры моделей, показатели производительности и оптимальные сценарии развёртывания. Мы также разберём, как широкая экосистема Ultralytics обеспечивает более удобную работу разработчика и какие возможности следующего поколения предлагает Ultralytics YOLO26.

RTDETRv2: подход на основе vision Transformer#

Разработанная исследователями Baidu, RTDETRv2 развивает основы оригинальной RT-DETR и знаменует собой значительный шаг вперёд в области обнаружения объектов на базе Transformer.

Основные особенности архитектуры#

RTDETRv2 использует гибридную архитектуру, сочетающую экстрактор признаков CNN с мощным декодером Transformer. Главная отличительная особенность этой модели — изначально без-NMS-дизайн. Устраняя подавление немаксимумов (NMS) на этапе постобработки, модель напрямую предсказывает ограничивающие рамки, что упрощает развёртывание и стабилизирует задержку инференса.

Встроенный в RTDETRv2 «набор бесплатных улучшений» повышает способность модели работать со сложными сценами и перекрывающимися объектами, поскольку механизмы глобального внимания по своей природе лучше учитывают пространственные взаимосвязи, чем локальные свёртки.

Использование памяти Transformer

Хотя Transformer хорошо справляются с пониманием сложных сцен, при обучении им обычно требуется значительно больше CUDA-памяти, чем CNN. Это может ограничивать размер пакета на обычных потребительских GPU и увеличивать общее время обучения.

Узнай больше о RTDETRv2

YOLOv6-3.0: максимальная производительность в промышленности#

Разработанная отделом Vision AI компании Meituan, YOLOv6-3.0 была специально создана как детектор нового поколения для промышленных конвейеров, где пропускная способность GPU имеет первостепенное значение.

  • Авторы: Чуйи Ли, Лулу Ли, Ифэй Гэн, Хунлян Цзян, Мэн Чэн, Бо Чжан, Зайдань Кэ, Сяомин Сюй и Сянсян Чу
  • Организация: Meituan
  • Дата: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Особенности архитектуры#

В основе YOLOv6-3.0 лежит магистральная сеть EfficientRep, тщательно разработанная для минимизации затрат на доступ к памяти аппаратных ускорителей, таких как GPU NVIDIA. В архитектуре шеи используется модуль двунаправленной конкатенации (BiC), улучшающий слияние признаков на разных масштабах.

При обучении модель использует стратегию обучения с поддержкой якорей (AAT), чтобы воспользоваться преимуществами парадигм на основе якорей, сохраняя при этом безъякорный режим инференса для более быстрого выполнения. Модель обеспечивает исключительную пропускную способность на серверных GPU (например, T4 и A100), однако её специализированная архитектура может приводить к неоптимальной задержке при развёртывании на периферийных устройствах только с CPU.

Подробнее о YOLOv6

Сравнение производительности#

При выборе моделей для промышленной эксплуатации важно найти баланс между точностью (mAP), скоростью инференса и вычислительными затратами (FLOPs). В таблице ниже показано, как эти модели соотносятся друг с другом.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

YOLOv6-3.0 лидирует по чистой скорости обработки на TensorRT, а RTDETRv2 показывает более высокие значения mAP, особенно хорошо масштабируясь в более крупных вариантах модели. Однако обеим моделям недостаёт широкой универсальности современных унифицированных фреймворков. YOLOv6-3.0 предназначена преимущественно для обнаружения объектов и изначально не поддерживает такие задачи, как сегментация экземпляров и оценка позы.

Сценарии использования и рекомендации#

Выбор между RT-DETR и YOLOv6 зависит от требований конкретного проекта, ограничений развёртывания и предпочтительной экосистемы.

Когда выбрать RT-DETR#

RT-DETR — отличный выбор для:

  • Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
  • Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.

Когда стоит выбрать YOLOv6#

YOLOv6 рекомендуется для следующих задач:

  • Развертывание с учетом промышленного оборудования: сценарии, в которых аппаратно-ориентированный дизайн и эффективная репараметризация модели обеспечивают оптимальную производительность на конкретном целевом оборудовании.
  • Быстрая одноэтапная детекция: приложения, где приоритетом является максимальная скорость инференса на GPU для обработки видео в реальном времени в контролируемых условиях.
  • Интеграция с экосистемой Meituan: команды, уже работающие с технологическим стеком и инфраструктурой развертывания Meituan.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:

  • Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
  • Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
  • Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.

Преимущества Ultralytics#

Выбор подходящей модели зависит не только от результатов тестов: не менее важны удобство разработки, гибкость развёртывания и поддержка экосистемы. Используя модели, интегрированные в платформу Ultralytics, пользователи получают существенные преимущества по сравнению со статичными исследовательскими репозиториями.

  • Простота использования: пакет Python ultralytics предоставляет удобный API. Для обучения, валидации и экспорта моделей достаточно нескольких строк кода.
  • Поддерживаемая экосистема: в отличие от изолированных академических репозиториев, платформа Ultralytics активно развивается. Она предлагает надёжную интеграцию с такими инструментами, как ONNX, OpenVINO и CoreML.
  • Эффективность обучения: при обучении модели Ultralytics обычно используют значительно меньше VRAM, чем архитектуры Transformer, например RTDETRv2. Благодаря этому на потребительском оборудовании можно использовать более крупные пакеты.
  • Универсальность: в отличие от узкой специализации YOLOv6-3.0, модели Ultralytics поддерживают несколько задач, включая сегментацию, классификацию изображений и ориентированные ограничивающие рамки (OBB), в рамках единого унифицированного фреймворка.
Упрощенное развертывание

Экспорт обученной модели для развёртывания на периферийном устройстве с помощью CLI Ultralytics так же прост, как запуск команды: yolo export model=yolo11n.pt format=tensorrt.

Знакомься с YOLO26: универсальное решение#

RTDETRv2 и YOLOv6-3.0 предлагают определённые преимущества, но эта область развивается стремительно. Командам, которые начинают новые проекты в области компьютерного зрения, мы настоятельно рекомендуем YOLO26, выпущенную Ultralytics в январе 2026 года.

YOLO26 объединяет сильные стороны промышленных CNN и современных Transformer, устраняя при этом их недостатки:

  • Сквозная архитектура без NMS: используя прорывной подход, впервые представленный в YOLOv10, YOLO26 предлагает опциональную голову без NMS (nms=False), которая устраняет постобработку с NMS и обеспечивает стабильное, предсказуемое развёртывание, как у RTDETRv2, но с гораздо меньшими накладными расходами.
  • Оптимизатор MuSGD: этот гибридный оптимизатор, вдохновлённый передовыми методами обучения LLM (например, Kimi K2 от Moonshot AI), обеспечивает стабильное обучение и более быструю сходимость, устраняя печально известную нестабильность традиционных vision Transformer.
  • Оптимизация для периферийных устройств: благодаря инференсу на CPU до 43% быстрее, чем у предыдущих поколений, и целенаправленному отказу от Distribution Focal Loss (DFL), YOLO26 отлично подходит для мобильных и IoT-устройств без GPU-ускорения.
  • ProgLoss + STAL: эти усовершенствованные функции потерь заметно улучшают распознавание небольших объектов — давнюю проблему CNN, — поэтому YOLO26 подходит для аэрофотоснимков и робототехники.

Пример обучения#

Интуитивно понятный API Ultralytics позволяет легко обучать передовые модели. Ниже приведён готовый к запуску пример обучения модели YOLO26 Nano на наборе данных COCO8:

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

Итоги#

При выборе между RTDETRv2 и YOLOv6-3.0 многое зависит от конкретного оборудования и ограничений по задержке. RTDETRv2 особенно эффективна в исследовательских средах и при обработке на сервере, где важно работать со сложными перекрывающимися объектами. YOLOv6-3.0 остаётся отличным выбором для высокопроизводительных производственных линий с мощными GPU NVIDIA.

Однако для разработчиков, которым нужно лучшее из двух подходов — изящество Transformer без NMS, а также высокая скорость и низкое потребление памяти CNN, — YOLO26 не имеет равных. Благодаря подробной документации и активному сообществу экосистемы Ultralytics YOLO26 помогает создавать надёжные, масштабируемые и готовые к будущему проекты в области компьютерного зрения.

Комментарии