RTDETRv2 против YOLO26#
Среда систем обнаружения объектов в реальном времени претерпела значительные изменения: исследователи постоянно расширяют границы скорости, точности и эффективности развертывания. Две самые заметные архитектуры, лидирующие в этом направлении — это RTDETRv2 на основе Transformer и передовая сверточная нейросеть (CNN) Ultralytics YOLO26. Это руководство содержит подробный анализ их архитектур, метрик производительности и оптимальных вариантов использования, чтобы помочь тебе выбрать подходящую модель для твоего следующего проекта по computer vision.
RTDETRv2: Трансформеры для детектирования в реальном времени#
RTDETRv2 создана на основе оригинальной архитектуры RT-DETR и призвана объединить контекстную осведомленность vision transformers во всем мире со скоростью, необходимой для приложений реального времени.
Основные характеристики:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 24.07.2024
- Ссылки: Arxiv, GitHub, Docs
Архитектура и преимущества#
В отличие от традиционных детекторов на базе якорей, RTDETRv2 использует подход на основе Transformer, который изначально исключает необходимость в Non-Maximum Suppression (NMS) на этапе постобработки. Благодаря гибкому механизму внимания модель отлично справляется с пониманием сложных сцен и перекрывающихся объектов. Усовершенствования из набора "Bag-of-Freebies" значительно повысили ее точность на COCO dataset при сохранении приемлемой скорости инференса на высокопроизводительных GPU.
Ограничения#
Хотя RTDETRv2 демонстрирует впечатляющие академические результаты, ее использование в производственных средах часто сопряжено со сложностями. Архитектуры Transformer изначально требуют больше памяти как при обучении, так и при инференсе по сравнению с CNN. Это может затруднить развертывание на ограниченных по ресурсам edge AI устройствах. Кроме того, обучение трансформаторов обычно требует больших размеров батчей и большего объема памяти CUDA, что может стать узким местом для исследователей с ограниченным аппаратным обеспечением.
YOLO26: Вершина Edge-First Vision AI#
Выпущенная в начале 2026 года, Ultralytics YOLO26 меняет представление о том, что возможно с помощью детектирования объектов на базе CNN. Она включает передовые оптимизации, специально разработанные для беспрепятственного развертывания в продакшене и экстремальной аппаратной эффективности.
Основные характеристики:
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 14 января 2026 г.
- Ссылки: GitHub, Docs
Архитектурные прорывы#
YOLO26 представляет несколько революционных функций, которые решают распространенные проблемы при развертывании моделей:
- Сквозной дизайн без NMS: Опираясь на концепции, впервые примененные в YOLOv10, модель YOLO26 изначально является сквозной (end-to-end). Исключение постобработки NMS позволяет радикально снизить вариативность задержек, обеспечивая высокую предсказуемость времени инференса в продакшене.
- Инференс на CPU быстрее до 43%: Благодаря стратегическим архитектурным доработкам и удалению функции Distribution Focal Loss (DFL), YOLO26 достигает беспрецедентной скорости на CPU, становясь лучшим выбором для edge computing без специализированных GPU.
- Оптимизатор MuSGD: вдохновленный методами обучения LLM, такими как Kimi K2 от Moonshot AI, YOLO26 использует оптимизатор MuSGD (гибрид SGD и Muon). Это обеспечивает высокую стабильность обучения и невероятно быструю сходимость.
- ProgLoss + STAL: Эти передовые функции потерь обеспечивают заметное улучшение распознавания мелких объектов, что является критически важным обновлением для приложений, использующих aerial imagery и мониторинг с помощью дронов.
Помимо стандартного обнаружения, YOLO26 обладает специализированными улучшениями: потерями для семантической сегментации и мультимасштабными прото для segmentation tasks, оценкой остаточного логарифма правдоподобия (RLE) для pose estimation и настраиваемой угловой функцией потерь для решения проблем с границами при обнаружении Oriented Bounding Box (OBB).
Сравнение производительности#
При оценке этих моделей крайне важно достичь баланса производительности между точностью (mAP) и вычислительной эффективностью. Таблица ниже демонстрирует, как YOLO26 стабильно превосходит RTDETRv2 во всех размерных вариантах.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Как видно выше, модель YOLO26x достигает впечатляющего показателя 57.5 mAP, значительно превосходя модель RTDETRv2-x при использовании меньшего количества параметров и сохранении более высокой скорости инференса TensorRT. Более того, требования YOLO26 к памяти заметно ниже, что делает ее оптимальным выбором для развертывания на периферийных устройствах в реальном времени.
Экосистема и простота использования#
Хотя чистая производительность крайне важна, окружающая экосистема определяет, как быстро модель может быть перенесена из исследований в продакшен. Именно здесь Ultralytics Platform предоставляет непревзойденное преимущество.
Хорошо поддерживаемая, единая экосистема#
RTDETRv2 в основном функционирует как репозиторий исследовательского уровня, что может потребовать сложной настройки окружения и написания скриптов вручную для пользовательских задач. Напротив, Ultralytics YOLO26 выигрывает от зрелого, тщательно протестированного пакета Python. Экосистема Ultralytics обеспечивает невероятно простой пользовательский опыт, предлагая простой API для обучения, валидации, предсказания и экспорта.
Благодаря встроенным интеграциям для Weights & Biases и Comet ML отслеживание экспериментов происходит легко и непринужденно. Кроме того, модели Ultralytics обладают высокой универсальностью: в то время как RTDETRv2 фокусируется на обнаружении объектов, YOLO26 изначально поддерживает сегментацию экземпляров, оценку поз и классификацию изображений в рамках абсолютно того же фреймворка.
Пример кода: Простота в действии#
API Ultralytics позволяет тебе загружать, обучать и запускать вывод всего несколькими строками кода. Это значительно повышает эффективность обучения и сокращает время выхода на рынок.
from ultralytics import RTDETR, YOLO
# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Display the YOLO26 results
results_yolo[0].show()
# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")Сценарии использования и рекомендации#
Выбор между RT-DETR и YOLO26 зависит от твоих конкретных проектных требований, ограничений развертывания и предпочтений в экосистеме.
Когда выбирать RT-DETR#
RT-DETR — отличный выбор для:
- Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
- Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
- Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.
Когда стоит выбрать YOLO26#
YOLO26 рекомендуется для:
- Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
- Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
- Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.
Изучение других архитектур#
Хотя YOLO26 представляет собой текущую вершину производительности, разработчики также могут найти пользу в изучении предыдущих версий. Успешная модель YOLO11 остается надежной и полностью поддерживаемой для различных устаревших систем. Ты можешь подробнее ознакомиться с ее возможностями, прочитав наше RTDETR vs YOLO11 comparison. Кроме того, если ты анализируешь более старые архитектуры, ознакомление с EfficientDet vs YOLO26 comparison дает отличный исторический контекст о том, как далеко продвинулись object detection architectures.
Заключительные мысли#
И RTDETRv2, и YOLO26 предлагают невероятные достижения в области ИИ. Однако для команд, для которых в приоритете бесшовный переход в продакшен, минимальное потребление памяти и широкая универсальность задач, Ultralytics YOLO26 — это очевидная рекомендация. Ее архитектура без NMS, высокая скорость на CPU и поддержка надежной экосистемы Ultralytics гарантируют, что твои проекты компьютерного зрения останутся масштабируемыми, эффективными и готовыми к будущему. Развертываешь ли ты модель на облачном сервере или на ограниченном по ресурсам Raspberry Pi, YOLO26 обеспечивает бескомпромиссную производительность