YOLO11 и RTDETRv2#
Сфера компьютерного зрения стремительно расширяется, предлагая разработчикам множество вариантов для создания надежных приложений на основе компьютерного зрения. В области обнаружения объектов в реальном времени дискуссия о сверточных нейронных сетях (CNNs) и визуальных Transformer-моделях (ViTs) становится как никогда актуальной. В этом техническом сравнении рассматриваются две ведущие архитектуры: YOLO11, представляющая вершину высокооптимизированных CNN-фреймворков, и RTDETRv2, мощная версия семейства Detection Transformer.
Анализируя их архитектуры, показатели производительности и оптимальные сценарии развертывания, это руководство призвано помочь инженерам по машинному обучению принимать взвешенные решения. Хотя обе модели расширяют границы точности, модели Ultralytics YOLO обычно обеспечивают более удачный баланс скорости, поддержки экосистемы и простоты использования в реальных production-системах.
YOLO11: эталон универсальности в реальных сценариях#
Созданная Ultralytics, модель YOLO11 опирается на многолетние фундаментальные исследования и обеспечивает высокую скорость, точность и исключительную универсальность. Она изначально поддерживает обнаружение объектов, сегментацию экземпляров, классификацию изображений, оценку позы и извлечение ориентированных ограничивающих рамок (OBB).
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2024-09-27
- GitHub: Репозиторий Ultralytics
- Документация: Документация по YOLO11
Архитектура и преимущества#
YOLO11 оснащена усовершенствованной основой CNN и передовыми пространственными пирамидами признаков, что делает её исключительно эффективной с точки зрения ресурсов. Она отлично работает в условиях жестких аппаратных ограничений, обеспечивая минимальный объем памяти как при обучении, так и при инференсе. Платформа Ultralytics обеспечивает встроенную поддержку YOLO11, позволяя упростить мониторинг моделей, разметку данных и облачное обучение без необходимости объединять разрозненные инструменты MLOps.
Для разработчиков, ориентированных на периферийные вычисления, YOLO11 отличается сверхнизкой задержкой. Благодаря легковесности она эффективно работает на устройствах от Raspberry Pi до обычных мобильных телефонов, что делает ее стандартом для умной розничной торговли, контроля качества на производстве и автоматизированного управления дорожным движением.
RTDETRv2: Transformer-модели реального времени от Baidu#
RTDETRv2 (Detection Transformer реального времени, версия 2) — это результат работы Baidu над тем, чтобы архитектуры на основе Transformer стали пригодны для задач реального времени. Модель развивает оригинальную RT-DETR, используя подход «bag-of-freebies» для повышения базовой точности без увеличения задержки инференса.
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Репозиторий RTDETRv2
- Документация: README RTDETRv2
Архитектура и преимущества#
В отличие от традиционных CNN, RTDETRv2 использует архитектуру энкодер–декодер с механизмами self-attention, что позволяет модели учитывать глобальный контекст всего изображения. Это особенно полезно в переполненных сценах, где часто возникают перекрытия объектов. RTDETRv2 устраняет необходимость в подавлении немаксимумов (NMS) на этапе постобработки, используя вместо этого венгерское сопоставление во время обучения для однозначного двудольного сопоставления.
Однако Transformer-модели общеизвестно требовательны к VRAM и памяти CUDA. Обучение RTDETRv2 с нуля или дообучение на пользовательских наборах данных часто требует значительных кластеров высокопроизводительных GPU, что может стать препятствием для небольших гибких команд по сравнению с низкими требованиями к памяти при обучении моделей Ultralytics.
Анализ производительности и метрик#
При оценке этих моделей на стандартном наборе данных COCO видны четкие компромиссы между количеством параметров, FLOPs и абсолютной точностью.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Разбор результатов#
Как видно из таблицы, YOLO11 обеспечивает впечатляющее соотношение производительности и размера. YOLO11x достигает более высокого значения mAPval (54.7) по сравнению с RTDETRv2-x (54.3), используя при этом значительно меньше параметров (56.9M против 76M) и гораздо меньше вычислительных FLOPs (194.9B против 259B).
Кроме того, скорость инференса YOLO11 на T4 TensorRT исключительно высока. YOLO11s выполняет инференс всего за 2.5 мс, тогда как самая маленькая RTDETRv2-s — за 5.03 мс. Это делает YOLO11 очевидным выбором для высокоскоростных потоков видеоаналитики в реальном времени, где время обработки кадра является главным узким местом.
Хотя RTDETRv2 достигает отличной точности благодаря своим attention-слоям, эти механизмы масштабируются квадратично относительно разрешения изображения, что приводит к более высокому потреблению VRAM как во время обучения, так и при инференсе. YOLO11 обходит это ограничение благодаря сверхэффективным сверточным блокам.
Экосистема обучения и удобство использования#
Ключевое преимущество использования модели Ultralytics заключается в окружающей ее экосистеме. Обучение RTDETRv2 часто связано с работой со сложными репозиториями исследовательского уровня, настройкой многочисленных весов функции потерь для двудольного сопоставления и управлением значительными накладными расходами памяти.
Ultralytics, напротив, уделяет большое внимание удобству работы разработчиков. Унифицированный API Python скрывает шаблонный код, бесшовно интегрируется с такими инструментами, как Weights & Biases, для отслеживания экспериментов и автоматически выполняет аугментацию данных.
Вот насколько просто обучить и экспортировать модель с помощью пакета ultralytics:
from ultralytics import YOLO
# Initialize YOLO11 model with pre-trained weights
model = YOLO("yolo11n.pt")
# Train the model efficiently on a local GPU or cloud instance
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Utilize CUDA GPU
)
# Export the trained model to ONNX for widespread deployment
export_path = model.export(format="onnx")После обучения экспорт модели YOLO11 в такие форматы, как ONNX, OpenVINO или CoreML, выполняется одной командой, благодаря чему твой пайплайн компьютерного зрения легко масштабируется на различные аппаратные бэкенды.
Помни, что RTDETRv2 специализируется исключительно на обнаружении ограничивающих рамок, тогда как архитектура YOLO11 изначально поддерживает оценку позы и сегментацию экземпляров, позволяя объединить несколько задач компьютерного зрения в одном семействе моделей.
Варианты применения и рекомендации#
Выбор между YOLO11 и RT-DETR зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда выбирать YOLO11#
YOLO11 — отличный выбор для:
- Промышленного развертывания на периферийных устройствах: коммерческих приложений на таких устройствах, как Raspberry Pi или NVIDIA Jetson, где особенно важны надежность и активная поддержка.
- Многоцелевых приложений компьютерного зрения: проектов, которым в рамках единого унифицированного фреймворка требуются детектирование, сегментация, оценка позы и OBB.
- Быстрого прототипирования и развертывания: команд, которым нужно быстро перейти от сбора данных к промышленной эксплуатации с помощью оптимизированного Ultralytics Python API.
Когда стоит выбрать RT-DETR#
RT-DETR рекомендуется для:
- Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
- Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Будущее: возможности YOLO26#
Хотя YOLO11 остается отличным выбором для production, командам, которым нужны самые передовые решения, стоит обратить особое внимание на YOLO26. Выпущенная в январе 2026 года, YOLO26 устраняет архитектурный разрыв, напрямую внедряя в свое ядро сквозную конструкцию без NMS (впервые предложенную в YOLOv10), полностью устраняя задержку постобработки и сложность логики развертывания.
YOLO26 также представляет несколько революционных возможностей:
- Оптимизатор MuSGD: вдохновленный методами обучения LLM от Kimi K2 компании Moonshot AI, этот гибрид SGD и Muon обеспечивает исключительно стабильное обучение и значительно более быструю сходимость.
- Удаление DFL: Distribution Focal Loss удалена для более чистого и упрощенного процесса экспорта, что существенно улучшает совместимость со слабыми периферийными устройствами.
- ProgLoss + STAL: эти продвинутые функции потерь заметно улучшают распознавание малоразмерных объектов — критически важное требование для наблюдения с дронов, мониторинга сельскохозяйственных угодий и периферийных IoT-сенсоров.
- До 43% более быстрый инференс на CPU: для развертываний без выделенных GPU YOLO26 специально оптимизирована для выполнения на CPU и значительно превосходит предыдущие поколения.
Тем, кто хочет изучить более широкий спектр архитектур, документация Ultralytics также предлагает сведения о YOLOv8, широко используемой YOLOv5 и специализированных моделях, таких как YOLO-World, для задач обнаружения объектов с открытым словарем. В конечном счете, независимо от того, что для тебя важнее — проверенная стабильность YOLO11 или прорывные инновации YOLO26, — экосистема Ultralytics предоставляет выдающиеся инструменты для воплощения решений в области компьютерного зрения.