Ultralytics YOLO27:

RTDETRv2 против YOLO26#

Ландшафт обнаружения объектов в реальном времени кардинально изменился: исследователи постоянно расширяют границы скорости, точности и эффективности развертывания. Две наиболее заметные архитектуры, которые в настоящее время лидируют в этом направлении, — это основанная на Transformer архитектура RTDETRv2 и современная сверточная нейронная сеть (CNN) Ultralytics YOLO26. Это руководство содержит подробный анализ их архитектур, показателей производительности и оптимальных сценариев использования, чтобы помочь тебе выбрать подходящую модель для следующего проекта в области компьютерного зрения.

RTDETRv2: Transformer-модели обнаружения в реальном времени#

RTDETRv2 развивает исходную архитектуру RT-DETR, стремясь объединить способность vision Transformer учитывать глобальный контекст со скоростью, необходимой для приложений реального времени.

Ключевые характеристики:

Архитектура и преимущества#

В отличие от традиционных детекторов на основе якорей, RTDETRv2 использует подход на основе Transformer, который изначально устраняет необходимость в подавлении немаксимумов (NMS) на этапе постобработки. Благодаря гибкому механизму внимания модель эффективно распознает сложные сцены и перекрывающиеся объекты. Улучшения «Bag-of-Freebies» значительно повысили ее точность на датасете COCO, сохранив приемлемую скорость инференса на высокопроизводительных GPU.

Ограничения#

Несмотря на впечатляющие академические результаты RTDETRv2, его использование в производственных средах часто сопряжено с трудностями. Архитектуры Transformer по своей природе требуют больше памяти во время обучения и инференса по сравнению с CNN. Это может затруднить развертывание на устройствах граничного AI с ограниченными ресурсами. Кроме того, для обучения Transformer обычно требуются большие размеры батчей и больше памяти CUDA, что может стать узким местом для исследователей с ограниченными аппаратными ресурсами.

Узнай больше о RTDETRv2

YOLO26: вершина AI компьютерного зрения с приоритетом периферийных устройств#

Выпущенная в начале 2026 года, Ultralytics YOLO26 переосмысливает возможности обнаружения объектов на основе CNN. В ней реализованы передовые оптимизации, специально предназначенные для бесшовного развертывания в продакшене и чрезвычайно эффективного использования оборудования.

Ключевые характеристики:

Архитектурные прорывы#

YOLO26 представляет несколько революционных функций, которые решают распространенные проблемы развертывания моделей:

  • Сквозной дизайн без NMS: развивая концепции, впервые реализованные в YOLOv10, YOLO26 изначально работает по сквозному принципу. Устранение постобработки NMS значительно уменьшает вариативность задержки, обеспечивая высокопредсказуемое время инференса в продакшене.
  • До 43% более быстрый инференс на CPU: благодаря продуманным архитектурным улучшениям и удалению Distribution Focal Loss (DFL) YOLO26 достигает беспрецедентной скорости работы на CPU, что делает ее оптимальным выбором для периферийных вычислений без выделенных GPU.
  • Оптимизатор MuSGD: вдохновленный методами обучения больших языковых моделей (LLM), такими как Kimi K2 от Moonshot AI, YOLO26 использует оптимизатор MuSGD — гибрид SGD и Muon. Это обеспечивает высокую стабильность процессов обучения и чрезвычайно быструю сходимость.
  • ProgLoss + STAL: эти продвинутые функции потерь значительно улучшают распознавание малоразмерных объектов, что особенно важно для приложений, использующих аэрофотосъемку и наблюдение с дронов.
Улучшения YOLO26 для конкретных задач

Помимо стандартного обнаружения, YOLO26 содержит специализированные улучшения: loss для семантической сегментации и multi-scale proto для задач сегментации, Residual Log-Likelihood Estimation (RLE) для оценки позы и настраиваемую функцию потерь угла для устранения проблем с границами при обнаружении ориентированных ограничивающих рамок (OBB).

Сравнение производительности#

При оценке этих моделей крайне важно добиться оптимального баланса между точностью (mAP) и вычислительной эффективностью. Приведенная ниже таблица показывает, как YOLO26 стабильно превосходит RTDETRv2 в различных вариантах размера.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Как видно выше, модель YOLO26x достигает впечатляющего показателя 57.5 mAP, значительно превосходя модель RTDETRv2-x, используя при этом меньше параметров и обеспечивая более высокую скорость инференса в TensorRT. Кроме того, YOLO26 требует заметно меньше памяти, что делает ее оптимальным выбором для развертывания на периферийных устройствах в реальном времени.

Экосистема и простота использования#

Хотя чистая производительность жизненно важна, окружающая экосистема определяет, насколько быстро модель можно перевести из исследований в продакшен. Именно здесь Ultralytics Platform предоставляет беспрецедентное преимущество.

Хорошо поддерживаемая унифицированная экосистема#

RTDETRv2 в основном работает как репозиторий исследовательского уровня, что может потребовать сложной настройки окружения и написания скриптов вручную для пользовательских задач. В свою очередь, Ultralytics YOLO26 использует зрелый, тщательно протестированный пакет Python. Экосистема Ultralytics обеспечивает чрезвычайно упрощенный пользовательский опыт, предлагая простой API для обучения, валидации, предсказаний и экспорта.

Благодаря встроенным интеграциям с Weights & Biases и Comet ML отслеживание экспериментов становится бесшовным. Кроме того, модели Ultralytics отличаются высокой универсальностью: если RTDETRv2 ориентирована на обнаружение объектов, то YOLO26 изначально поддерживает сегментацию экземпляров, оценку позы и классификацию изображений в рамках той же самой платформы.

Пример кода: простота в действии#

API Ultralytics позволяет разработчикам загружать модели, обучать их и запускать инференс всего несколькими строками кода. Это значительно повышает эффективность обучения и сокращает время вывода продукта на рынок.

from ultralytics import RTDETR, YOLO

# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the YOLO26 results
results_yolo[0].show()

# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")

Варианты применения и рекомендации#

Выбор между RT-DETR и YOLO26 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений относительно экосистемы.

Когда стоит выбрать RT-DETR#

RT-DETR — подходящий выбор для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда стоит выбрать YOLO26#

YOLO26 рекомендуется для:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Изучение других архитектур#

Хотя YOLO26 представляет собой текущую вершину производительности, ты также можешь найти пользу в изучении предыдущих итераций. Весьма успешная YOLO11 остается надежной и полностью поддерживаемой моделью для различных устаревших систем. Ты можешь глубже погрузиться в возможности YOLO11, прочитав наше RT-DETR vs YOLO11 comparison. Кроме того, если ты анализируешь более старые архитектуры, ознакомление со сравнением EfficientDet vs YOLO26 comparison дает отличный исторический контекст о том, как далеко продвинулись object detection architectures.

Заключение#

И RTDETRv2, и YOLO26 предлагают впечатляющие достижения в области AI. Однако для команд, которые ставят во главу угла бесшовный переход в продакшен, минимальное потребление памяти и широкую универсальность задач, Ultralytics YOLO26 является очевидной рекомендацией. Ее архитектура без NMS, высокая скорость работы на CPU и поддержка надежной экосистемы Ultralytics гарантируют, что твои проекты в области AI компьютерного зрения останутся масштабируемыми, эффективными и готовыми к будущим изменениям. Независимо от того, развертываешь ли ты модель на облачном сервере или на Raspberry Pi с ограниченными ресурсами, YOLO26 обеспечивает uncompromising производительность сразу после установки.

Комментарии