RTDETRv2 против YOLO26#
Ландшафт обнаружения объектов в реальном времени кардинально изменился: исследователи постоянно расширяют границы скорости, точности и эффективности развертывания. Две наиболее заметные архитектуры, которые в настоящее время лидируют в этом направлении, — это основанная на Transformer архитектура RTDETRv2 и современная сверточная нейронная сеть (CNN) Ultralytics YOLO26. Это руководство содержит подробный анализ их архитектур, показателей производительности и оптимальных сценариев использования, чтобы помочь тебе выбрать подходящую модель для следующего проекта в области компьютерного зрения.
RTDETRv2: Transformer-модели обнаружения в реальном времени#
RTDETRv2 развивает исходную архитектуру RT-DETR, стремясь объединить способность vision Transformer учитывать глобальный контекст со скоростью, необходимой для приложений реального времени.
Ключевые характеристики:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Ссылки: Arxiv, GitHub, Документация
Архитектура и преимущества#
В отличие от традиционных детекторов на основе якорей, RTDETRv2 использует подход на основе Transformer, который изначально устраняет необходимость в подавлении немаксимумов (NMS) на этапе постобработки. Благодаря гибкому механизму внимания модель эффективно распознает сложные сцены и перекрывающиеся объекты. Улучшения «Bag-of-Freebies» значительно повысили ее точность на датасете COCO, сохранив приемлемую скорость инференса на высокопроизводительных GPU.
Ограничения#
Несмотря на впечатляющие академические результаты RTDETRv2, его использование в производственных средах часто сопряжено с трудностями. Архитектуры Transformer по своей природе требуют больше памяти во время обучения и инференса по сравнению с CNN. Это может затруднить развертывание на устройствах граничного AI с ограниченными ресурсами. Кроме того, для обучения Transformer обычно требуются большие размеры батчей и больше памяти CUDA, что может стать узким местом для исследователей с ограниченными аппаратными ресурсами.
YOLO26: вершина AI компьютерного зрения с приоритетом периферийных устройств#
Выпущенная в начале 2026 года, Ultralytics YOLO26 переосмысливает возможности обнаружения объектов на основе CNN. В ней реализованы передовые оптимизации, специально предназначенные для бесшовного развертывания в продакшене и чрезвычайно эффективного использования оборудования.
Ключевые характеристики:
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 14 января 2026 года
- Ссылки: GitHub, Документация
Архитектурные прорывы#
YOLO26 представляет несколько революционных функций, которые решают распространенные проблемы развертывания моделей:
- Сквозной дизайн без NMS: развивая концепции, впервые реализованные в YOLOv10, YOLO26 изначально работает по сквозному принципу. Устранение постобработки NMS значительно уменьшает вариативность задержки, обеспечивая высокопредсказуемое время инференса в продакшене.
- До 43% более быстрый инференс на CPU: благодаря продуманным архитектурным улучшениям и удалению Distribution Focal Loss (DFL) YOLO26 достигает беспрецедентной скорости работы на CPU, что делает ее оптимальным выбором для периферийных вычислений без выделенных GPU.
- Оптимизатор MuSGD: вдохновленный методами обучения больших языковых моделей (LLM), такими как Kimi K2 от Moonshot AI, YOLO26 использует оптимизатор MuSGD — гибрид SGD и Muon. Это обеспечивает высокую стабильность процессов обучения и чрезвычайно быструю сходимость.
- ProgLoss + STAL: эти продвинутые функции потерь значительно улучшают распознавание малоразмерных объектов, что особенно важно для приложений, использующих аэрофотосъемку и наблюдение с дронов.
Помимо стандартного обнаружения, YOLO26 содержит специализированные улучшения: loss для семантической сегментации и multi-scale proto для задач сегментации, Residual Log-Likelihood Estimation (RLE) для оценки позы и настраиваемую функцию потерь угла для устранения проблем с границами при обнаружении ориентированных ограничивающих рамок (OBB).
Сравнение производительности#
При оценке этих моделей крайне важно добиться оптимального баланса между точностью (mAP) и вычислительной эффективностью. Приведенная ниже таблица показывает, как YOLO26 стабильно превосходит RTDETRv2 в различных вариантах размера.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Как видно выше, модель YOLO26x достигает впечатляющего показателя 57.5 mAP, значительно превосходя модель RTDETRv2-x, используя при этом меньше параметров и обеспечивая более высокую скорость инференса в TensorRT. Кроме того, YOLO26 требует заметно меньше памяти, что делает ее оптимальным выбором для развертывания на периферийных устройствах в реальном времени.
Экосистема и простота использования#
Хотя чистая производительность жизненно важна, окружающая экосистема определяет, насколько быстро модель можно перевести из исследований в продакшен. Именно здесь Ultralytics Platform предоставляет беспрецедентное преимущество.
Хорошо поддерживаемая унифицированная экосистема#
RTDETRv2 в основном работает как репозиторий исследовательского уровня, что может потребовать сложной настройки окружения и написания скриптов вручную для пользовательских задач. В свою очередь, Ultralytics YOLO26 использует зрелый, тщательно протестированный пакет Python. Экосистема Ultralytics обеспечивает чрезвычайно упрощенный пользовательский опыт, предлагая простой API для обучения, валидации, предсказаний и экспорта.
Благодаря встроенным интеграциям с Weights & Biases и Comet ML отслеживание экспериментов становится бесшовным. Кроме того, модели Ultralytics отличаются высокой универсальностью: если RTDETRv2 ориентирована на обнаружение объектов, то YOLO26 изначально поддерживает сегментацию экземпляров, оценку позы и классификацию изображений в рамках той же самой платформы.
Пример кода: простота в действии#
API Ultralytics позволяет разработчикам загружать модели, обучать их и запускать инференс всего несколькими строками кода. Это значительно повышает эффективность обучения и сокращает время вывода продукта на рынок.
from ultralytics import RTDETR, YOLO
# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Display the YOLO26 results
results_yolo[0].show()
# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")Варианты применения и рекомендации#
Выбор между RT-DETR и YOLO26 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений относительно экосистемы.
Когда стоит выбрать RT-DETR#
RT-DETR — подходящий выбор для:
- Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
- Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.
Когда стоит выбрать YOLO26#
YOLO26 рекомендуется для:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Изучение других архитектур#
Хотя YOLO26 представляет собой текущую вершину производительности, ты также можешь найти пользу в изучении предыдущих итераций. Весьма успешная YOLO11 остается надежной и полностью поддерживаемой моделью для различных устаревших систем. Ты можешь глубже погрузиться в возможности YOLO11, прочитав наше RT-DETR vs YOLO11 comparison. Кроме того, если ты анализируешь более старые архитектуры, ознакомление со сравнением EfficientDet vs YOLO26 comparison дает отличный исторический контекст о том, как далеко продвинулись object detection architectures.
Заключение#
И RTDETRv2, и YOLO26 предлагают впечатляющие достижения в области AI. Однако для команд, которые ставят во главу угла бесшовный переход в продакшен, минимальное потребление памяти и широкую универсальность задач, Ultralytics YOLO26 является очевидной рекомендацией. Ее архитектура без NMS, высокая скорость работы на CPU и поддержка надежной экосистемы Ultralytics гарантируют, что твои проекты в области AI компьютерного зрения останутся масштабируемыми, эффективными и готовыми к будущим изменениям. Независимо от того, развертываешь ли ты модель на облачном сервере или на Raspberry Pi с ограниченными ресурсами, YOLO26 обеспечивает uncompromising производительность сразу после установки.