RTDETRv2 и YOLOX#
Ландшафт компьютерного зрения стремительно развивается, предоставляя разработчикам и исследователям широкий выбор архитектур для создания систем на основе компьютерного зрения. Двумя заметными вехами на этом пути стали RTDETRv2 на базе Transformer и YOLOX на базе CNN. Хотя обе модели внесли значительный вклад в область обнаружения объектов в реальном времени, они представляют принципиально разные подходы к решению задач визуального распознавания.
В этом подробном руководстве рассматриваются архитектурные особенности, показатели производительности и оптимальные сценарии развертывания обеих моделей. Кроме того, мы изучим, как современные альтернативы, такие как передовой Ultralytics YOLO26, развивают эти основы, обеспечивая более высокую точность, эффективность и удобство использования.
RTDETRv2: Transformer-модели обнаружения в реальном времени#
RTDETRv2, представленный как преемник оригинального RT-DETR, использует архитектуру Transformer для высокопроизводительного обнаружения объектов в реальном времени. За счет отказа от подавления немаксимумов (NMS) он упрощает конвейер инференса.
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Ссылки: Статья на Arxiv, Официальный GitHub, Документация
Архитектура и дизайн#
RTDETRv2 активно использует механизмы self-attention, присущие Transformer, что позволяет модели захватывать глобальный контекст всего изображения. Такое целостное понимание позволяет ей напрямую предсказывать ограничивающие рамки и вероятности классов. В модели реализованы многоуровневые признаки обнаружения, улучшающие распознавание небольших объектов в сложных сценах.
Хотя Transformer отлично захватывают глобальный контекст, их механизмы self-attention масштабируются квадратично относительно длины последовательности, что часто приводит к значительно более высокому потреблению памяти CUDA во время обучения по сравнению с традиционными CNN.
Преимущества и недостатки#
Главное преимущество RTDETRv2 заключается в его изначально сквозной архитектуре. Отказываясь от NMS, модель избегает скачков задержки, часто связанных с плотными перекрывающимися предсказаниями. Однако значительная вычислительная нагрузка блоков Transformer означает, что для обучения и развертывания требуются существенные ресурсы GPU. Поэтому модель хуже подходит для периферийных устройств с ограниченными ресурсами и устаревшего мобильного оборудования.
YOLOX: развитие CNN без anchor-боксов#
Созданная для преодоления разрыва между академическими исследованиями и промышленным применением, YOLOX привнесла в популярное семейство моделей YOLO раздельную голову и дизайн без anchor-боксов.
- Авторы: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li и Jian Sun
- Организация: Megvii
- Дата: 18 июля 2021 г.
- Ссылки: Статья на Arxiv, Официальный GitHub, Документация
Архитектура и дизайн#
YOLOX отходит от традиционных детекторов на основе anchor-боксов, напрямую предсказывая расположение объектов без заранее заданных anchor-боксов. Это упрощает архитектуру сети и уменьшает количество эвристических параметров настройки, необходимых для оптимальной производительности. Кроме того, YOLOX использует раздельную голову, отделяющую задачи классификации и регрессии, что ускоряет сходимость во время обучения.
Преимущества и недостатки#
Архитектура YOLOX без anchor-боксов делает модель хорошо адаптируемой к различным задачам компьютерного зрения и упрощает обучение на пользовательских наборах данных. Облегченные варианты, такие как YOLOX-Nano, хорошо подходят для развертывания на микроконтроллерах и маломощных IoT-устройствах. Однако, поскольку YOLOX появилась до распространения детекторов без NMS, она по-прежнему использует традиционную постобработку, которая может усложнять развертывание и увеличивать задержку в плотных сценах.
Сравнение производительности и метрик#
При сравнении этих моделей важно оценить их скорость, точность и эффективность использования параметров, чтобы определить наиболее подходящий вариант для твоего конкретного сценария. В таблице ниже приведены показатели моделей разных размеров на стандартном наборе данных COCO.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
Как видно из данных, RTDETRv2 достигает более высокой максимальной точности (54.3 mAP) в своей крупнейшей версии по сравнению с YOLOXx. Однако YOLOX предлагает значительно меньшие и более быстрые варианты, такие как YOLOXs, у которых меньше параметров и выше скорость инференса на GPU NVIDIA T4.
Преимущество Ultralytics: встречай YOLO26#
Хотя RTDETRv2 и YOLOX обладают уникальными преимуществами, современным разработчикам часто требуется единое решение, сочетающее лучшее из обоих подходов — высокую точность, молниеносный инференс и доступную экосистему. Недавно выпущенная Ultralytics YOLO26 представляет вершину этой эволюции.
Ключевые инновации YOLO26#
- Сквозная архитектура без NMS: Развивая концепции, впервые предложенные в YOLOv10, YOLO26 изначально работает без NMS. Это обеспечивает плавный инференс RTDETRv2 без огромных требований Transformer к памяти.
- Оптимизатор MuSGD: Гибридный оптимизатор MuSGD, вдохновленный инновациями в обучении больших языковых моделей и объединяющий SGD и Muon, стабилизирует процесс обучения и значительно ускоряет сходимость.
- До 43% более быстрый инференс на CPU: За счет стратегического удаления модуля Distribution Focal Loss (DFL) YOLO26 специально оптимизирована для периферийных вычислений и маломощных устройств, что делает ее значительно быстрее на CPU по сравнению с предыдущими версиями, такими как YOLO11.
- ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание небольших объектов, устраняя распространенную проблему в аэрофотосъемке и робототехнических приложениях.
Непревзойденная универсальность и экосистема#
Помимо чистой производительности, Ultralytics Platform предлагает комплексную экосистему полного цикла — от нуля до продакшена. В отличие от статичных академических репозиториев, модели Ultralytics активно поддерживаются и обеспечивают бесшовную работу с несколькими задачами через единый интуитивно понятный API. Будь то сегментация экземпляров, отслеживание поз с помощью оценки позы или работа с повернутыми объектами через ориентированные ограничивающие рамки (OBB), рабочий процесс остается одинаковым.
Кроме того, модели Ultralytics известны низкими требованиями к памяти как во время обучения, так и во время инференса, позволяя исследователям использовать большие размеры батчей на потребительском оборудовании — это разительно контрастирует с высокой ресурсоемкостью архитектур на базе Transformer.
Пример кода для обучения#
Мощь экосистемы Ultralytics лучше всего демонстрирует ее простота. Для обучения современной модели YOLO26 требуется всего несколько строк кода, которые полностью скрывают сложности загрузки данных и настройки гиперпараметров.
from ultralytics import YOLO
# Initialize the natively NMS-free YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the standard COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16)
# Validate the model's performance seamlessly
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")
# Export to ONNX or TensorRT for rapid deployment
model.export(format="engine", device=0)Применение в реальных условиях и оптимальные сценарии использования#
Выбор подходящей архитектуры полностью зависит от ограничений развертывания и доступного оборудования.
Высокоточная облачная обработка#
Если твое приложение работает на высокопроизводительных серверных GPU и приоритетом является максимальная точность — например, при анализе плотных сцен с толпами людей или обработке медицинских изображений высокого разрешения, — мощные механизмы attention модели RTDETRv2 могут быть весьма эффективны.
Устаревшее развертывание на периферийных устройствах#
Для развертывания на старых мобильных телефонах или сильно ограниченных микроконтроллерах, где минимальное количество FLOPs является обязательным условием, сверхлегкая YOLOX-Nano по-прежнему остается жизнеспособным запасным вариантом благодаря простой архитектуре CNN.
Современный стандарт: AIoT и робототехника#
Для подавляющего большинства современных сценариев — от инфраструктуры умных городов и аналитики розничной торговли до автономной навигации — Ultralytics YOLO26 является очевидным выбором. Инференс на CPU на 43% быстрее делает модель непревзойденной для периферийных вычислений, а архитектура без NMS гарантирует низкую и стабильную задержку. В сочетании с подробной документацией и активной поддержкой сообщества экосистемы Ultralytics это позволяет командам быстрее, чем когда-либо, переходить от разметки набора данных к глобальному развертыванию.
Готов поднять свои проекты в области компьютерного зрения на новый уровень? Изучи широкие возможности Ultralytics Platform, чтобы без лишних усилий управлять данными, обучать модели в облаке и развертывать интеллектуальные приложения в масштабах.
Если ты хочешь изучить другие архитектуры в экосистеме Ultralytics, обрати внимание на YOLOv8 благодаря глубокой интеграции с сообществом или на YOLOv5 благодаря непревзойденной стабильности в устаревших конвейерах. Однако для расширения границ возможного в 2026 году YOLO26 остается отраслевым стандартом.