YOLO Vision 2026:

RTDETRv2 против YOLO26#

Среда систем обнаружения объектов в реальном времени претерпела значительные изменения: исследователи постоянно расширяют границы скорости, точности и эффективности развертывания. Две самые заметные архитектуры, лидирующие в этом направлении — это RTDETRv2 на основе Transformer и передовая сверточная нейросеть (CNN) Ultralytics YOLO26. Это руководство содержит подробный анализ их архитектур, метрик производительности и оптимальных вариантов использования, чтобы помочь тебе выбрать подходящую модель для твоего следующего проекта по computer vision.

RTDETRv2: Трансформеры для детектирования в реальном времени#

RTDETRv2 создана на основе оригинальной архитектуры RT-DETR и призвана объединить контекстную осведомленность vision transformers во всем мире со скоростью, необходимой для приложений реального времени.

Основные характеристики:

  • Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
  • Организация: Baidu
  • Дата: 24.07.2024
  • Ссылки: Arxiv, GitHub, Docs

Архитектура и преимущества#

В отличие от традиционных детекторов на базе якорей, RTDETRv2 использует подход на основе Transformer, который изначально исключает необходимость в Non-Maximum Suppression (NMS) на этапе постобработки. Благодаря гибкому механизму внимания модель отлично справляется с пониманием сложных сцен и перекрывающихся объектов. Усовершенствования из набора "Bag-of-Freebies" значительно повысили ее точность на COCO dataset при сохранении приемлемой скорости инференса на высокопроизводительных GPU.

Ограничения#

Хотя RTDETRv2 демонстрирует впечатляющие академические результаты, ее использование в производственных средах часто сопряжено со сложностями. Архитектуры Transformer изначально требуют больше памяти как при обучении, так и при инференсе по сравнению с CNN. Это может затруднить развертывание на ограниченных по ресурсам edge AI устройствах. Кроме того, обучение трансформаторов обычно требует больших размеров батчей и большего объема памяти CUDA, что может стать узким местом для исследователей с ограниченным аппаратным обеспечением.

Узнай больше о RTDETRv2

YOLO26: Вершина Edge-First Vision AI#

Выпущенная в начале 2026 года, Ultralytics YOLO26 меняет представление о том, что возможно с помощью детектирования объектов на базе CNN. Она включает передовые оптимизации, специально разработанные для беспрепятственного развертывания в продакшене и экстремальной аппаратной эффективности.

Основные характеристики:

  • Авторы: Glenn Jocher и Jing Qiu
  • Организация: Ultralytics
  • Дата: 14 января 2026 г.
  • Ссылки: GitHub, Docs

Архитектурные прорывы#

YOLO26 представляет несколько революционных функций, которые решают распространенные проблемы при развертывании моделей:

  • Сквозной дизайн без NMS: Опираясь на концепции, впервые примененные в YOLOv10, модель YOLO26 изначально является сквозной (end-to-end). Исключение постобработки NMS позволяет радикально снизить вариативность задержек, обеспечивая высокую предсказуемость времени инференса в продакшене.
  • Инференс на CPU быстрее до 43%: Благодаря стратегическим архитектурным доработкам и удалению функции Distribution Focal Loss (DFL), YOLO26 достигает беспрецедентной скорости на CPU, становясь лучшим выбором для edge computing без специализированных GPU.
  • Оптимизатор MuSGD: вдохновленный методами обучения LLM, такими как Kimi K2 от Moonshot AI, YOLO26 использует оптимизатор MuSGD (гибрид SGD и Muon). Это обеспечивает высокую стабильность обучения и невероятно быструю сходимость.
  • ProgLoss + STAL: Эти передовые функции потерь обеспечивают заметное улучшение распознавания мелких объектов, что является критически важным обновлением для приложений, использующих aerial imagery и мониторинг с помощью дронов.
Специфические улучшения задач в YOLO26

Помимо стандартного обнаружения, YOLO26 обладает специализированными улучшениями: потерями для семантической сегментации и мультимасштабными прото для segmentation tasks, оценкой остаточного логарифма правдоподобия (RLE) для pose estimation и настраиваемой угловой функцией потерь для решения проблем с границами при обнаружении Oriented Bounding Box (OBB).

Узнай больше о YOLO26

Сравнение производительности#

При оценке этих моделей крайне важно достичь баланса производительности между точностью (mAP) и вычислительной эффективностью. Таблица ниже демонстрирует, как YOLO26 стабильно превосходит RTDETRv2 во всех размерных вариантах.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Как видно выше, модель YOLO26x достигает впечатляющего показателя 57.5 mAP, значительно превосходя модель RTDETRv2-x при использовании меньшего количества параметров и сохранении более высокой скорости инференса TensorRT. Более того, требования YOLO26 к памяти заметно ниже, что делает ее оптимальным выбором для развертывания на периферийных устройствах в реальном времени.

Экосистема и простота использования#

Хотя чистая производительность крайне важна, окружающая экосистема определяет, как быстро модель может быть перенесена из исследований в продакшен. Именно здесь Ultralytics Platform предоставляет непревзойденное преимущество.

Хорошо поддерживаемая, единая экосистема#

RTDETRv2 в основном функционирует как репозиторий исследовательского уровня, что может потребовать сложной настройки окружения и написания скриптов вручную для пользовательских задач. Напротив, Ultralytics YOLO26 выигрывает от зрелого, тщательно протестированного пакета Python. Экосистема Ultralytics обеспечивает невероятно простой пользовательский опыт, предлагая простой API для обучения, валидации, предсказания и экспорта.

Благодаря встроенным интеграциям для Weights & Biases и Comet ML отслеживание экспериментов происходит легко и непринужденно. Кроме того, модели Ultralytics обладают высокой универсальностью: в то время как RTDETRv2 фокусируется на обнаружении объектов, YOLO26 изначально поддерживает сегментацию экземпляров, оценку поз и классификацию изображений в рамках абсолютно того же фреймворка.

Пример кода: Простота в действии#

API Ultralytics позволяет тебе загружать, обучать и запускать вывод всего несколькими строками кода. Это значительно повышает эффективность обучения и сокращает время выхода на рынок.

from ultralytics import RTDETR, YOLO

# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the YOLO26 results
results_yolo[0].show()

# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")

Сценарии использования и рекомендации#

Выбор между RT-DETR и YOLO26 зависит от твоих конкретных проектных требований, ограничений развертывания и предпочтений в экосистеме.

Когда выбирать RT-DETR#

RT-DETR — отличный выбор для:

  • Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
  • Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
  • Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.

Когда стоит выбрать YOLO26#

YOLO26 рекомендуется для:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Изучение других архитектур#

Хотя YOLO26 представляет собой текущую вершину производительности, разработчики также могут найти пользу в изучении предыдущих версий. Успешная модель YOLO11 остается надежной и полностью поддерживаемой для различных устаревших систем. Ты можешь подробнее ознакомиться с ее возможностями, прочитав наше RTDETR vs YOLO11 comparison. Кроме того, если ты анализируешь более старые архитектуры, ознакомление с EfficientDet vs YOLO26 comparison дает отличный исторический контекст о том, как далеко продвинулись object detection architectures.

Заключительные мысли#

И RTDETRv2, и YOLO26 предлагают невероятные достижения в области ИИ. Однако для команд, для которых в приоритете бесшовный переход в продакшен, минимальное потребление памяти и широкая универсальность задач, Ultralytics YOLO26 — это очевидная рекомендация. Ее архитектура без NMS, высокая скорость на CPU и поддержка надежной экосистемы Ultralytics гарантируют, что твои проекты компьютерного зрения останутся масштабируемыми, эффективными и готовыми к будущему. Развертываешь ли ты модель на облачном сервере или на ограниченном по ресурсам Raspberry Pi, YOLO26 обеспечивает бескомпромиссную производительность

Участники

Комментарии