YOLO Vision 2026:

YOLOv6-3.0 против RTDETRv2#

Выбор оптимальной архитектуры для приложений computer vision требует баланса между скоростью, точностью и ограничениями развертывания. В этом подробном техническом разборе мы анализируем YOLOv6-3.0, сверточную нейронную сеть (CNN) промышленного уровня, разработанную для высокопроизводительных сред GPU, в сравнении с RTDETRv2, ультрасовременной моделью на базе трансформеров, привносящей механизмы внимания в обнаружение объектов в реальном времени.

Хотя обе модели представляют собой значительные вехи в исследованиях искусственного интеллекта, разработчики, ищущие наиболее универсальный и эффективный пайплайн, часто обращаются к надежной Ultralytics Platform.


YOLOv6-3.0: промышленная пропускная способность#

Разработанная отделом Vision AI компании Meituan, модель YOLOv6-3.0 делает упор на максимальное увеличение скорости обработки на аппаратных ускорителях, таких как GPU от NVIDIA, что закрепляет её позиции в классических промышленных приложениях.

Основные особенности архитектуры#

YOLOv6-3.0 использует удобный для оборудования бэкбон EfficientRep, специально созданный для высокоскоростного GPU-инференса. Архитектура включает модуль двунаправленной конкатенации (BiC) в «шее» для улучшения слияния признаков при различных пространственных разрешениях. Во время обучения она использует стратегию обучения с поддержкой якорей (Anchor-Aided Training, AAT), чтобы использовать преимущества обучения на основе якорей, сохраняя при этом конвейер инференса без якорей.

Сильные и слабые стороны#

Преимущества:

  • Исключительная пропускная способность на серверном оборудовании, таком как GPU T4 и A100.
  • Предоставляет специализированные quantization tutorials для развертывания INT8 с использованием RepOpt.
  • Выгодное соотношение количества параметров к скорости для крупномасштабной видеоаналитики.

Недостатки:

  • В первую очередь детектор ограничивающих рамок; ему не хватает универсальности для многозадачности из коробки (например, Pose, OBB), присущей таким моделям, как Ultralytics YOLO11.
  • Более сильная зависимость от сложного алгоритма подавления немаксимумов (NMS) при постобработке, что увеличивает вариативность задержек.
  • Менее активная экосистема по сравнению с популярными фреймворками, что делает обновления и поддержку сообщества менее предсказуемыми.

Узнай больше о YOLOv6


RTDETRv2: Трансформеры реального времени#

Возглавляемый исследователями из Baidu, проект RTDETRv2 развивает оригинальный RT-DETR, совершенствуя фреймворк детекции на базе трансформеров с помощью подхода «bag-of-freebies», что позволяет достичь передовой точности без ущерба для работы в реальном времени.

  • Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
  • Организация: Baidu
  • Дата: 24.07.2024
  • ArXiv: 2407.17140
  • GitHub: lyuwenyu/RT-DETR

Основные особенности архитектуры#

В отличие от традиционных CNN, RTDETRv2 является изначально сквозной (end-to-end). За счет использования слоев внимания трансформера архитектура полностью устраняет необходимость в постобработке NMS. Это обеспечивает оптимизированный пайплайн инференса. RTDETRv2 представляет высокооптимизированное слияние признаков по нескольким шкалам и эффективный гибридный энкодер, позволяя ей обрабатывать стандартные COCO datasets с поразительной точностью.

Сильные и слабые стороны#

Преимущества:

  • Механизмы внимания на основе трансформеров обеспечивают исключительную mean Average Precision (mAP), особенно на сложных или плотных сценах.
  • Дизайн без использования NMS стандартизирует задержку инференса и упрощает интеграцию в производственные среды.
  • Отлично подходит для сценариев, требующих максимально высокой точности при минимальных аппаратных ограничениях.

Недостатки:

  • Слои Transformer требуют значительного объема памяти CUDA во время обучения, что ограничивает исследователей, у которых нет доступа к мощным GPU.
  • Скорость инференса на CPU заметно ниже, чем у специализированных граничных CNN, что ограничивает использование в мобильных устройствах или устройствах IoT.
  • Настройка и тюнинг могут быть сложными для команд, привыкших к традиционным machine learning operations (MLOps).

Узнай больше о RTDETR


Детальное сравнение производительности#

В следующей таблице представлены показатели YOLOv6-3.0 и RTDETRv2 по ключевым индикаторам производительности. Обрати внимание на резкий контраст между эффективностью параметров YOLOv6 и чистой точностью RTDETRv2.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Совет по развертыванию

Если ты развертываешь модели на чисто процессорном (CPU) железе, таком как Raspberry Pi, модели на базе CNN обычно значительно превосходят архитектуры трансформеров по количеству кадров в секунду (FPS). Для оптимальной производительности на периферии рассмотри возможность использования OpenVINO для ускорения инференса.


Сценарии использования и рекомендации#

Выбор между YOLOv6 и RT-DETR зависит от твоих конкретных требований к проекту, ограничений развертывания и предпочтений в экосистеме.

Когда выбирать YOLOv6#

YOLOv6 — сильный выбор для:

  • Промышленного внедрения с учетом оборудования: сценарии, где аппаратная ориентированность модели и эффективная репараметризация обеспечивают оптимизированную производительность на конкретном целевом оборудовании.
  • Быстрого одноэтапного обнаружения: приложения, где приоритетом является чистая скорость вывода на GPU для обработки видео в реальном времени в контролируемых условиях.
  • Интеграция с экосистемой Meituan: Команды, уже работающие в стеке технологий и инфраструктуре развертывания Meituan's.

Когда выбирать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
  • Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
  • Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Преимущество Ultralytics: знакомься с YOLO26#

Хотя YOLOv6-3.0 и RTDETRv2 превосходны в своих конкретных нишах, современный ландшафт машинного обучения требует моделей, сочетающих в себе скорость, точность и удобство для разработчиков. Ultralytics ecosystem идеально отвечает этим потребностям, особенно с выходом YOLO26.

Выпущенный в январе 2026 года, Ultralytics YOLO26 представляет собой окончательный стандарт компьютерного зрения, значительно опережая старые модели вроде YOLOv8 и форки сообщества вроде YOLO12.

Почему YOLO26 превосходит конкурентов#

  1. Дизайн End-to-End без NMS: Впервые предложенный в YOLOv10, YOLO26 нативно исключает постобработку NMS. Это обеспечивает простоту развертывания RTDETRv2 при сохранении молниеносной скорости высокооптимизированной CNN.
  2. Оптимизатор MuSGD: Вдохновленный инновациями в области больших языковых моделей (таких как Kimi K2 от Moonshot AI), YOLO26 использует гибрид SGD и Muon. Это обеспечивает невероятно стабильную динамику обучения и быструю сходимость, сокращая время и вычислительные ресурсы, необходимые для пользовательских наборов данных.
  3. Непревзойденная производительность на периферии: Благодаря полному удалению DFL (Distribution Focal Loss), YOLO26 упрощает архитектуры экспорта. Эта оптимизация дает до 43% более быстрый инференс на CPU по сравнению с предыдущими моделями, делая ее бесспорным чемпионом для Edge AI и устройств IoT.
  4. Улучшенное обнаружение мелких объектов: Внедрение функций потерь ProgLoss и STAL обеспечивает огромный скачок в обнаружении мелких объектов — критическое требование для анализа данных с дронов и аэрофотосъемки, с чем YOLOv6 исторически справлялась с трудом.
  5. Многозадачность: В отличие от YOLOv6, который фокусируется исключительно на детекции, YOLO26 поддерживает многомодальные рабочие процессы, включая Instance Segmentation, Pose Estimation, Image Classification и Oriented Bounding Box (OBB) — и все это из единого унифицированного API.

Узнай больше о YOLO26

Эффективность обучения и простота использования#

Python API от Ultralytics создан для максимального повышения продуктивности разработчиков. Ты можешь перейти от обучения к развертыванию всего за несколько строк кода, полностью минуя сложную настройку окружения, требуемую автономными исследовательскими репозиториями.

Ниже приведен полный рабочий пример того, как обучить и проверить передовую модель YOLO26 с помощью пакета Ultralytics:

from ultralytics import YOLO

# Load the state-of-the-art YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on a custom dataset (e.g., COCO8) for 50 epochs
# The API automatically handles dataset caching and environment config
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's accuracy on the validation split
val_metrics = model.val()
print(f"Validation mAP50-95: {val_metrics.box.map:.4f}")

# Export the trained model to ONNX for production deployment
model.export(format="onnx")

Заключение#

И YOLOv6-3.0, и RTDETRv2 являются впечатляющим вкладом в AI-сообщество. YOLOv6-3.0 остается мощным инструментом для промышленной автоматизации на GPU, а RTDETRv2 доказывает, что архитектуры трансформеров могут достигать задержек реального времени при максимальной точности.

Тем не менее, для команд, которым требуется надежный, готовый к продакшену фреймворк с активной поддержкой сообщества, модели Ultralytics YOLO неизменно являются лучшим выбором. Бесшовная интеграция с такими платформами, как Hugging Face и TensorRT, в сочетании с невероятно низкими накладными расходами памяти во время обучения, демократизирует доступ к высококлассному ИИ. Обновившись до YOLO26, разработчики могут задействовать новаторский оптимизатор MuSGD и архитектуру без NMS для создания более быстрых, умных и масштабируемых пайплайнов компьютерного зрения.

Комментарии