Ultralytics YOLO27:

RTDETRv2 и YOLOX#

Ландшафт компьютерного зрения стремительно развивается, предоставляя разработчикам и исследователям широкий выбор архитектур для создания систем на основе компьютерного зрения. Двумя заметными вехами на этом пути стали RTDETRv2 на базе Transformer и YOLOX на базе CNN. Хотя обе модели внесли значительный вклад в область обнаружения объектов в реальном времени, они представляют принципиально разные подходы к решению задач визуального распознавания.

В этом подробном руководстве рассматриваются архитектурные особенности, показатели производительности и оптимальные сценарии развертывания обеих моделей. Кроме того, мы изучим, как современные альтернативы, такие как передовой Ultralytics YOLO26, развивают эти основы, обеспечивая более высокую точность, эффективность и удобство использования.

RTDETRv2: Transformer-модели обнаружения в реальном времени#

RTDETRv2, представленный как преемник оригинального RT-DETR, использует архитектуру Transformer для высокопроизводительного обнаружения объектов в реальном времени. За счет отказа от подавления немаксимумов (NMS) он упрощает конвейер инференса.

Архитектура и дизайн#

RTDETRv2 активно использует механизмы self-attention, присущие Transformer, что позволяет модели захватывать глобальный контекст всего изображения. Такое целостное понимание позволяет ей напрямую предсказывать ограничивающие рамки и вероятности классов. В модели реализованы многоуровневые признаки обнаружения, улучшающие распознавание небольших объектов в сложных сценах.

Узкие места Transformer

Хотя Transformer отлично захватывают глобальный контекст, их механизмы self-attention масштабируются квадратично относительно длины последовательности, что часто приводит к значительно более высокому потреблению памяти CUDA во время обучения по сравнению с традиционными CNN.

Преимущества и недостатки#

Главное преимущество RTDETRv2 заключается в его изначально сквозной архитектуре. Отказываясь от NMS, модель избегает скачков задержки, часто связанных с плотными перекрывающимися предсказаниями. Однако значительная вычислительная нагрузка блоков Transformer означает, что для обучения и развертывания требуются существенные ресурсы GPU. Поэтому модель хуже подходит для периферийных устройств с ограниченными ресурсами и устаревшего мобильного оборудования.

Узнай больше о RTDETRv2

YOLOX: развитие CNN без anchor-боксов#

Созданная для преодоления разрыва между академическими исследованиями и промышленным применением, YOLOX привнесла в популярное семейство моделей YOLO раздельную голову и дизайн без anchor-боксов.

Архитектура и дизайн#

YOLOX отходит от традиционных детекторов на основе anchor-боксов, напрямую предсказывая расположение объектов без заранее заданных anchor-боксов. Это упрощает архитектуру сети и уменьшает количество эвристических параметров настройки, необходимых для оптимальной производительности. Кроме того, YOLOX использует раздельную голову, отделяющую задачи классификации и регрессии, что ускоряет сходимость во время обучения.

Преимущества и недостатки#

Архитектура YOLOX без anchor-боксов делает модель хорошо адаптируемой к различным задачам компьютерного зрения и упрощает обучение на пользовательских наборах данных. Облегченные варианты, такие как YOLOX-Nano, хорошо подходят для развертывания на микроконтроллерах и маломощных IoT-устройствах. Однако, поскольку YOLOX появилась до распространения детекторов без NMS, она по-прежнему использует традиционную постобработку, которая может усложнять развертывание и увеличивать задержку в плотных сценах.

Узнай больше о YOLOX

Сравнение производительности и метрик#

При сравнении этих моделей важно оценить их скорость, точность и эффективность использования параметров, чтобы определить наиболее подходящий вариант для твоего конкретного сценария. В таблице ниже приведены показатели моделей разных размеров на стандартном наборе данных COCO.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Как видно из данных, RTDETRv2 достигает более высокой максимальной точности (54.3 mAP) в своей крупнейшей версии по сравнению с YOLOXx. Однако YOLOX предлагает значительно меньшие и более быстрые варианты, такие как YOLOXs, у которых меньше параметров и выше скорость инференса на GPU NVIDIA T4.

Преимущество Ultralytics: встречай YOLO26#

Хотя RTDETRv2 и YOLOX обладают уникальными преимуществами, современным разработчикам часто требуется единое решение, сочетающее лучшее из обоих подходов — высокую точность, молниеносный инференс и доступную экосистему. Недавно выпущенная Ultralytics YOLO26 представляет вершину этой эволюции.

Ключевые инновации YOLO26#

  • Сквозная архитектура без NMS: Развивая концепции, впервые предложенные в YOLOv10, YOLO26 изначально работает без NMS. Это обеспечивает плавный инференс RTDETRv2 без огромных требований Transformer к памяти.
  • Оптимизатор MuSGD: Гибридный оптимизатор MuSGD, вдохновленный инновациями в обучении больших языковых моделей и объединяющий SGD и Muon, стабилизирует процесс обучения и значительно ускоряет сходимость.
  • До 43% более быстрый инференс на CPU: За счет стратегического удаления модуля Distribution Focal Loss (DFL) YOLO26 специально оптимизирована для периферийных вычислений и маломощных устройств, что делает ее значительно быстрее на CPU по сравнению с предыдущими версиями, такими как YOLO11.
  • ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание небольших объектов, устраняя распространенную проблему в аэрофотосъемке и робототехнических приложениях.

Непревзойденная универсальность и экосистема#

Помимо чистой производительности, Ultralytics Platform предлагает комплексную экосистему полного цикла — от нуля до продакшена. В отличие от статичных академических репозиториев, модели Ultralytics активно поддерживаются и обеспечивают бесшовную работу с несколькими задачами через единый интуитивно понятный API. Будь то сегментация экземпляров, отслеживание поз с помощью оценки позы или работа с повернутыми объектами через ориентированные ограничивающие рамки (OBB), рабочий процесс остается одинаковым.

Кроме того, модели Ultralytics известны низкими требованиями к памяти как во время обучения, так и во время инференса, позволяя исследователям использовать большие размеры батчей на потребительском оборудовании — это разительно контрастирует с высокой ресурсоемкостью архитектур на базе Transformer.

Пример кода для обучения#

Мощь экосистемы Ultralytics лучше всего демонстрирует ее простота. Для обучения современной модели YOLO26 требуется всего несколько строк кода, которые полностью скрывают сложности загрузки данных и настройки гиперпараметров.

from ultralytics import YOLO

# Initialize the natively NMS-free YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the standard COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16)

# Validate the model's performance seamlessly
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")

# Export to ONNX or TensorRT for rapid deployment
model.export(format="engine", device=0)

Применение в реальных условиях и оптимальные сценарии использования#

Выбор подходящей архитектуры полностью зависит от ограничений развертывания и доступного оборудования.

Высокоточная облачная обработка#

Если твое приложение работает на высокопроизводительных серверных GPU и приоритетом является максимальная точность — например, при анализе плотных сцен с толпами людей или обработке медицинских изображений высокого разрешения, — мощные механизмы attention модели RTDETRv2 могут быть весьма эффективны.

Устаревшее развертывание на периферийных устройствах#

Для развертывания на старых мобильных телефонах или сильно ограниченных микроконтроллерах, где минимальное количество FLOPs является обязательным условием, сверхлегкая YOLOX-Nano по-прежнему остается жизнеспособным запасным вариантом благодаря простой архитектуре CNN.

Современный стандарт: AIoT и робототехника#

Для подавляющего большинства современных сценариев — от инфраструктуры умных городов и аналитики розничной торговли до автономной навигации — Ultralytics YOLO26 является очевидным выбором. Инференс на CPU на 43% быстрее делает модель непревзойденной для периферийных вычислений, а архитектура без NMS гарантирует низкую и стабильную задержку. В сочетании с подробной документацией и активной поддержкой сообщества экосистемы Ultralytics это позволяет командам быстрее, чем когда-либо, переходить от разметки набора данных к глобальному развертыванию.

Оптимизируй свой рабочий процесс

Готов поднять свои проекты в области компьютерного зрения на новый уровень? Изучи широкие возможности Ultralytics Platform, чтобы без лишних усилий управлять данными, обучать модели в облаке и развертывать интеллектуальные приложения в масштабах.

Если ты хочешь изучить другие архитектуры в экосистеме Ultralytics, обрати внимание на YOLOv8 благодаря глубокой интеграции с сообществом или на YOLOv5 благодаря непревзойденной стабильности в устаревших конвейерах. Однако для расширения границ возможного в 2026 году YOLO26 остается отраслевым стандартом.

Комментарии