Ultralytics YOLO27:

YOLOv6-3.0 vs RTDETRv2#

Выбор оптимальной архитектуры для приложений компьютерного зрения требует баланса между скоростью, точностью и ограничениями развертывания. В этом подробном техническом обзоре мы анализируем YOLOv6-3.0 — сверточную нейронную сеть (CNN) промышленного уровня, оптимизированную для высокопроизводительных GPU-сред, — и сравниваем её с RTDETRv2, современной моделью на основе Transformer, которая использует механизмы внимания для обнаружения объектов в реальном времени.

Хотя обе модели стали значимыми достижениями в исследованиях искусственного интеллекта, разработчики, которым нужен наиболее универсальный и эффективный конвейер, часто выбирают надежную платформу Ultralytics.

YOLOv6-3.0: промышленная пропускная способность#

Разработанная отделом Vision AI компании Meituan, YOLOv6-3.0 ориентирована прежде всего на максимизацию исходной скорости обработки на аппаратных ускорителях, таких как GPU NVIDIA, что закрепило её место в устоявшихся промышленных приложениях.

Основные особенности архитектуры#

YOLOv6-3.0 использует удобный для аппаратного ускорения бэкбон EfficientRep, специально оптимизированный для быстрого вывода на GPU. Архитектура интегрирует модуль двунаправленной конкатенации (BiC) в neck для улучшения объединения признаков на разных пространственных разрешениях. Во время обучения она применяет стратегию обучения с поддержкой anchor-боксов (AAT), объединяя преимущества обучения на основе anchor-боксов с безanchor-боксовым конвейером вывода.

Преимущества и недостатки#

Преимущества:

  • Исключительно высокая пропускная способность на серверном оборудовании, таком как GPU T4 и A100.
  • Предоставляет специализированные руководства по квантованию для развертывания INT8 с использованием RepOpt.
  • Выгодное соотношение числа параметров и скорости для крупномасштабной видеоаналитики.

Недостатки:

  • В основном детектор ограничивающих рамок; ему не хватает универсальности для мультитасковых задач «из коробки» (например, Pose и OBB), которая есть у таких моделей, как Ultralytics YOLO11.
  • Более сильная зависимость от сложного подавления немаксимумов (NMS) на этапе постобработки, что увеличивает разброс задержки.
  • Менее активная экосистема по сравнению с популярными фреймворками, из-за чего обновления и поддержка сообщества менее предсказуемы.

Узнай больше о YOLOv6

RTDETRv2: Transformer в реальном времени#

Разработанная при ведущем участии исследователей Baidu, RTDETRv2 развивает оригинальную RT-DETR, совершенствуя архитектуру Transformer для обнаружения объектов с помощью подхода «набора бесплатных улучшений» и достигая передовой точности без потери пригодности для работы в реальном времени.

  • Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
  • Организация: Baidu
  • Дата: 2024-07-24
  • ArXiv: 2407.17140
  • GitHub: lyuwenyu/RT-DETR

Основные особенности архитектуры#

В отличие от традиционных CNN, RTDETRv2 изначально построена как сквозная модель. Благодаря слоям внимания Transformer архитектура полностью устраняет необходимость в постобработке с использованием NMS. Это обеспечивает более простой конвейер вывода. RTDETRv2 использует высокооптимизированное объединение признаков между масштабами и эффективный гибридный энкодер, что позволяет ей с высокой точностью обрабатывать стандартные наборы данных COCO.

Преимущества и недостатки#

Преимущества:

  • Механизмы внимания на основе Transformer обеспечивают исключительную среднюю точность (mAP), особенно на сложных или плотных сценах.
  • Архитектура без NMS стабилизирует задержку вывода и упрощает интеграцию в производственные среды.
  • Отлично подходит для сценариев, требующих максимально возможной точности, когда аппаратные ограничения минимальны.

Недостатки:

  • Слои Transformer требуют значительного объема памяти CUDA во время обучения, что ограничивает исследователей без доступа к высокопроизводительным GPU.
  • Скорость вывода на CPU заметно ниже, чем у специализированных периферийных CNN, что ограничивает применение модели на мобильных и IoT-устройствах.
  • Настройка и оптимизация могут быть сложными для команд, привыкших к традиционным операциям машинного обучения (MLOps).

Подробное сравнение производительности#

В следующей таблице YOLOv6-3.0 и RTDETRv2 сравниваются по ключевым показателям производительности. Обрати внимание на резкий контраст между эффективностью YOLOv6 по числу параметров и исходной точностью RTDETRv2.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Совет по развертыванию

Если ты выполняешь развертывание исключительно на CPU, например на Raspberry Pi, модели на основе CNN обычно значительно превосходят архитектуры Transformer по числу кадров в секунду (FPS). Для оптимальной производительности на периферийных устройствах рассмотри использование OpenVINO для ускорения вывода.

Варианты применения и рекомендации#

Выбор между YOLOv6 и RT-DETR зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать YOLOv6#

YOLOv6 — хороший выбор для:

  • Развертывание с учетом промышленного оборудования: сценарии, в которых аппаратно-ориентированный дизайн модели и эффективная репараметризация обеспечивают оптимальную производительность на конкретном целевом оборудовании.
  • Быстрое одностадийное обнаружение: приложения, в которых приоритетом является максимальная скорость инференса на GPU для обработки видео в реальном времени в контролируемых средах.
  • Интеграция с экосистемой Meituan: команды, уже работающие в технологическом стеке и инфраструктуре развертывания Meituan.

Когда стоит выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Преимущество Ultralytics: встречай YOLO26#

Хотя YOLOv6-3.0 и RTDETRv2 отлично подходят для своих ниш, современный ландшафт машинного обучения требует моделей, сочетающих скорость, точность и удобство для разработчиков. Экосистема Ultralytics идеально отвечает этим требованиям, особенно после выпуска YOLO26.

Выпущенная в январе 2026 года, Ultralytics YOLO26 представляет собой новый эталон в области компьютерного зрения, значительно превосходя старые модели, такие как YOLOv8, и созданные сообществом форки, такие как YOLO12.

Почему YOLO26 превосходит конкурентов#

  1. Сквозная архитектура без NMS: впервые представленная в YOLOv10, YOLO26 изначально устраняет постобработку NMS. Это обеспечивает простоту развертывания RTDETRv2, сохраняя при этом молниеносную скорость высокооптимизированной CNN.
  2. Оптимизатор MuSGD: вдохновленный инновациями в области больших языковых моделей, такими как Kimi K2 от Moonshot AI, YOLO26 использует комбинацию SGD и Muon. Это обеспечивает исключительно стабильную динамику обучения и быструю сходимость, сокращая время и вычислительные ресурсы, необходимые для пользовательских наборов данных.
  3. Непревзойденная производительность на периферийных устройствах: благодаря полному удалению DFL (Distribution Focal Loss) YOLO26 упрощает архитектуры экспорта. Эта оптимизация обеспечивает до 43% более быстрый вывод на CPU по сравнению с устаревшими моделями, делая её бесспорным лидером для периферийного AI и IoT-устройств.
  4. Улучшенное обнаружение малых объектов: внедрение функций потерь ProgLoss и STAL обеспечивает огромный скачок в обнаружении малых объектов — критически важном требовании для аналитики с дронов и аэрофотоснимков, с которым YOLOv6 исторически справлялась плохо.
  5. Универсальность задач: В отличие от YOLOv6, которая сосредоточена исключительно на детекции, YOLO26 поддерживает многозадачные рабочие процессы, включая сегментацию экземпляров, оценку позы, классификацию изображений и ориентированные ограничивающие рамки (OBB) — и все это с помощью единого унифицированного API.

Эффективность обучения и простота использования#

Python API Ultralytics разработан для максимального повышения продуктивности разработчиков. Ты можешь перейти от обучения к развертыванию всего за несколько строк кода, полностью минуя сложную настройку окружения, необходимую для отдельных исследовательских репозиториев.

Ниже приведен полный запускаемый пример обучения и валидации современной модели YOLO26 с использованием пакета Ultralytics:

from ultralytics import YOLO

# Load the state-of-the-art YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on a custom dataset (e.g., COCO8) for 50 epochs
# The API automatically handles dataset caching and environment config
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's accuracy on the validation split
val_metrics = model.val()
print(f"Validation mAP50-95: {val_metrics.box.map:.4f}")

# Export the trained model to ONNX for production deployment
model.export(format="onnx")

Заключение#

И YOLOv6-3.0, и RTDETRv2 — впечатляющие достижения сообщества AI. YOLOv6-3.0 остается мощным инструментом для промышленной автоматизации, требующей высокой производительности GPU, а RTDETRv2 доказывает, что архитектуры Transformer могут обеспечивать задержку в реальном времени при максимальной точности.

Однако для команд, которым нужен надежный готовый к промышленной эксплуатации фреймворк с активной поддержкой сообщества, модели Ultralytics YOLO неизменно оказываются лучшим выбором. Бесшовная интеграция с такими платформами, как Hugging Face и TensorRT, в сочетании с исключительно низкими затратами памяти во время обучения демократизирует доступ к передовым технологиям AI. Перейдя на YOLO26, разработчики могут использовать революционный оптимизатор MuSGD и архитектуру без NMS для создания более быстрых, интеллектуальных и масштабируемых конвейеров компьютерного зрения.

Комментарии