Ultralytics YOLO27:

RTDETRv2 и YOLOv6-3.0#

Ландшафт компьютерного зрения постоянно меняется, предлагая разработчикам множество вариантов архитектур для обнаружения объектов. Две заметные модели, представляющие разные подходы, — это RTDETRv2, современный vision Transformer, и YOLOv6-3.0, высокооптимизированная сверточная нейронная сеть (CNN), разработанная для промышленных приложений.

В этом подробном техническом сравнении рассматриваются архитектуры этих моделей, показатели производительности и оптимальные сценарии развертывания. Мы также рассмотрим, как более широкая экосистема Ultralytics обеспечивает превосходный опыт для разработчиков, и обратим внимание на возможности нового поколения Ultralytics YOLO26.

RTDETRv2: подход на основе vision Transformer#

Разработанная исследователями из Baidu, RTDETRv2 основана на исходной RT-DETR и представляет собой значительный шаг вперед в обнаружении объектов на основе Transformer обнаружении объектов.

Архитектурные особенности#

RTDETRv2 использует гибридную архитектуру, объединяющую экстрактор признаков на основе CNN с мощным декодером Transformer. Главная отличительная особенность этой модели — встроенная архитектура без NMS. Благодаря устранению подавления немаксимумов (NMS) на этапе постобработки модель напрямую предсказывает ограничивающие рамки, что упрощает развертывание и стабилизирует задержку инференса.

Встроенный в RTDETRv2 «Bag-of-Freebies» повышает способность модели работать со сложными сценами и перекрывающимися объектами, поскольку механизмы глобального внимания лучше понимают пространственные взаимосвязи, чем локализованные свертки.

Использование памяти Transformer

Хотя Transformer отлично справляются с пониманием сложных сцен, во время обучения им обычно требуется значительно больше памяти CUDA, чем CNN. Это может ограничивать размеры пакетов на стандартных потребительских GPU и увеличивать общее время обучения.

YOLOv6-3.0: максимизация промышленной пропускной способности#

Созданная в подразделении Vision AI компании Meituan, YOLOv6-3.0 была специально разработана как детектор нового поколения для промышленных конвейеров, где пропускная способность GPU имеет первостепенное значение.

  • Авторы: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu и Xiangxiang Chu
  • Организация: Meituan
  • Дата: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Архитектурные особенности#

YOLOv6-3.0 использует магистральную сеть EfficientRep, тщательно спроектированную для минимизации затрат на доступ к памяти аппаратных ускорителей, таких как GPU NVIDIA. Архитектура шеи включает двунаправленный модуль конкатенации (BiC) для улучшения слияния признаков на разных масштабах.

Во время обучения применяется стратегия обучения с поддержкой якорей (AAT), позволяющая использовать преимущества парадигм на основе якорей при сохранении безъякорного режима инференса для более быстрого выполнения. Хотя модель обеспечивает исключительную пропускную способность на серверных GPU (например, T4 и A100), ее специализированная архитектура может приводить к неоптимальной задержке при развертывании на периферийных устройствах только с CPU.

Узнай больше о YOLOv6

Сравнение производительности#

При оценке моделей для промышленной эксплуатации критически важно сбалансировать точность (mAP), скорость инференса и вычислительные затраты (FLOPs). В таблице ниже показано, как эти модели сопоставляются друг с другом.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

YOLOv6-3.0 превосходит RTDETRv2 по чистой скорости обработки в TensorRT, тогда как RTDETRv2 достигает более высоких показателей mAP, особенно лучше масштабируясь на более крупных вариантах моделей. Однако обеим моделям не хватает широкой универсальности, характерной для современных унифицированных фреймворков. YOLOv6-3.0 в основном специализируется на обнаружении и не поддерживает изначально такие задачи, как сегментация экземпляров и оценка позы.

Варианты применения и рекомендации#

Выбор между RT-DETR и YOLOv6 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений относительно экосистемы.

Когда стоит выбрать RT-DETR#

RT-DETR — подходящий выбор для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда стоит выбрать YOLOv6#

YOLOv6 рекомендуется для:

  • Развертывание с учетом промышленного оборудования: сценарии, в которых аппаратно-ориентированный дизайн модели и эффективная репараметризация обеспечивают оптимальную производительность на конкретном целевом оборудовании.
  • Быстрое одностадийное обнаружение: приложения, в которых приоритетом является максимальная скорость инференса на GPU для обработки видео в реальном времени в контролируемых средах.
  • Интеграция с экосистемой Meituan: команды, уже работающие в технологическом стеке и инфраструктуре развертывания Meituan.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Преимущества Ultralytics#

Выбор подходящей модели — это не только сырые показатели бенчмарков: опыт разработчиков, гибкость развертывания и поддержка экосистемы не менее важны. Используя модели, интегрированные в платформу Ultralytics, пользователи получают значительные преимущества по сравнению со статичными исследовательскими репозиториями.

  • Простота использования: пакет ultralytics для Python предоставляет удобный API. Для обучения, валидации и экспорта моделей достаточно всего нескольких строк кода.
  • Экосистема с активной поддержкой: в отличие от изолированных академических репозиториев, платформа Ultralytics активно обновляется. Она предлагает надежные интеграции с такими инструментами, как ONNX, OpenVINO и CoreML.
  • Эффективность обучения: модели Ultralytics обычно потребляют значительно меньше VRAM во время обучения по сравнению с архитектурами на основе Transformer, такими как RTDETRv2, что позволяет использовать большие размеры пакетов на оборудовании потребительского уровня.
  • Универсальность: В отличие от узкой направленности YOLOv6-3.0, модели Ultralytics являются многозадачными и изначально поддерживают классификацию изображений, ориентированные ограничивающие рамки (OBB) и сегментацию в рамках единой универсальной платформы.
Упрощенное развертывание

С помощью CLI Ultralytics экспорт обученной модели для развертывания на периферийном устройстве выполняется так же просто, как запуск команды: yolo export model=yolo11n.pt format=tensorrt.

YOLO26: универсальное решение#

Хотя RTDETRv2 и YOLOv6-3.0 предлагают определенные преимущества, эта область быстро развивается. Командам, начинающим новые проекты в области компьютерного зрения, мы настоятельно рекомендуем YOLO26, выпущенную Ultralytics в январе 2026 года.

YOLO26 объединяет сильные стороны промышленных CNN и современных Transformer, устраняя присущие им недостатки:

  • Сквозная архитектура без NMS: переняв прорывной подход, впервые представленный в YOLOv10, YOLO26 изначально устраняет постобработку NMS, обеспечивая стабильное и предсказуемое развертывание, аналогичное RTDETRv2, но с гораздо меньшими накладными расходами.
  • Оптимизатор MuSGD: этот гибридный оптимизатор, вдохновленный передовыми методами обучения LLM, такими как Kimi K2 от Moonshot AI, обеспечивает стабильное обучение и более быструю сходимость, устраняя общеизвестную нестабильность традиционных vision Transformer.
  • Оптимизация для периферийных устройств: благодаря инференсу на CPU, который до 43% быстрее, чем у предыдущих поколений, и стратегическому отказу от Distribution Focal Loss (DFL), YOLO26 идеально подходит для мобильных устройств и IoT-устройств, где ускорение GPU недоступно.
  • ProgLoss + STAL: эти передовые функции потерь заметно улучшают распознавание небольших объектов — исторически сложную задачу для CNN, — что делает YOLO26 идеальным решением для аэрофотосъемки и робототехники.

Пример обучения#

Интуитивно понятный API Ultralytics позволяет легко обучать современные модели. Ниже приведен исполняемый пример обучения Nano-модели YOLO26 на датасете COCO8:

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

Итоги#

При сравнении RTDETRv2 и YOLOv6-3.0 выбор во многом зависит от конкретного оборудования и ограничений по задержке. RTDETRv2 особенно эффективна в исследовательских средах и при серверной обработке, где критически важно работать со сложными перекрывающимися объектами. YOLOv6-3.0 остается отличным выбором для высокопроизводительных производственных линий, оснащенных мощными GPU NVIDIA.

Однако для разработчиков, которым нужно лучшее из обоих подходов — сочетание элегантности Transformer без NMS с высокой скоростью и малым объемом памяти CNN, — YOLO26 остается непревзойденной. Благодаря подробной документации и активному сообществу экосистемы Ultralytics YOLO26 обеспечивает надежность, масштабируемость и долгосрочную актуальность твоих проектов в области vision AI.

Комментарии