YOLO Vision 2026:

YOLO11 против RTDETRv2#

Сфера компьютерного зрения быстро расширяется, предлагая разработчикам огромное количество вариантов для создания надежных приложений на основе визуальных данных. В области детектирования объектов в реальном времени дискуссия между сверточными нейронными сетями (CNN) и трансформерами зрения (ViT) стала как никогда актуальной. В этом техническом сравнении мы подробно рассмотрим две ведущие архитектуры: YOLO11, представляющую вершину высокооптимизированных фреймворков CNN, и RTDETRv2, мощную итерацию семейства Detection Transformer.

Анализируя их архитектуры, показатели производительности и идеальные сценарии развертывания, это руководство призвано помочь инженерам по машиностроению принимать обоснованные решения. В то время как обе модели раздвигают границы точности, модели Ultralytics YOLO обычно предлагают превосходный баланс скорости, поддержки экосистемы и простоты использования для реального производства.

YOLO11: Эталон универсальности для реальных задач#

Представленная Ultralytics, YOLO11 опирается на годы фундаментальных исследований, чтобы предоставить модель, которая является быстрой, точной и невероятно универсальной. Она спроектирована так, чтобы легко справляться с обнаружением объектов, сегментацией экземпляров, классификацией изображений, оценкой позы и извлечением ориентированных ограничивающих рамок (OBB) в нативном режиме.

Узнай больше о YOLO11

Архитектура и преимущества#

YOLO11 оснащена усовершенствованным бэкбоном CNN и передовыми пространственными пирамидами признаков, что делает ее исключительно эффективной с точки зрения ресурсов. Она преуспевает в средах с жесткими аппаратными ограничениями, обеспечивая минимальный объем памяти как во время обучения, так и во время инференса. Платформа Ultralytics обеспечивает встроенную поддержку YOLO11, позволяя упорядочить мониторинг моделей, аннотирование данных и облачное обучение без необходимости объединять разрозненные инструменты MLOps.

Для разработчиков, ориентирующихся на периферийные вычисления, YOLO11 может похвастаться сверхнизкой задержкой. Ее легковесный характер позволяет ей эффективно работать на устройствах от Raspberry Pi до потребительских мобильных телефонов, что делает ее стандартом для умной розничной торговли, контроля качества на производстве и автоматизированного управления дорожным движением.

RTDETRv2: трансформеры реального времени от Baidu#

RTDETRv2 (Real-Time Detection Transformer version 2) представляет собой попытку Baidu сделать архитектуры на основе трансформеров пригодными для задач реального времени. Она основывается на оригинальной RT-DETR, используя подход «набора бесплатных улучшений» (bag-of-freebies) для повышения базовой точности без увеличения задержки инференса.

Узнай больше о RTDETR

Архитектура и преимущества#

В отличие от традиционных CNN, RTDETRv2 использует архитектуру энкодер-декодер с механизмами self-attention, что позволяет захватывать глобальный контекст изображения. Это особенно полезно в сценах с высокой плотностью объектов, где часто возникают перекрытия. RTDETRv2 исключает необходимость в подавлении немаксимумов (NMS) при постобработке, полагаясь на венгерский алгоритм сопоставления (Hungarian matching) во время обучения для взаимно-однозначного двудольного сопоставления.

Тем не менее, модели на основе трансформеров известны своей требовательностью к памяти VRAM и CUDA. Обучение RTDETRv2 с нуля или дообучение на пользовательских наборах данных часто требует значительных высокопроизводительных кластеров GPU, что может стать препятствием для небольших гибких команд по сравнению с легковесным объемом обучения моделей Ultralytics.

Анализ производительности и метрик#

Оценивая эти модели на стандартном наборе данных COCO, мы наблюдаем четкие компромиссы между параметрами, FLOPs и исходной точностью.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Разбор результатов#

Как видно из таблицы, YOLO11 обеспечивает невероятное соотношение производительности и размера. Модель YOLO11x достигает более высокого значения mAPval (54.7) по сравнению с RTDETRv2-x (54.3), используя при этом значительно меньше параметров (56.9 млн против 76 млн) и гораздо меньше вычислительных FLOPs (194.9 млрд против 259 млрд).

Более того, скорость инференса YOLO11 на T4 TensorRT исключительно высока. YOLO11s выполняет инференс всего за 2.5 мс, в то время как самая маленькая RTDETRv2-s занимает 5.03 мс. Это делает YOLO11 окончательным выбором для высокоскоростных потоков видеоаналитики в реальном времени, где время обработки кадров является основным узким местом.

Цена трансформеров

Хотя RTDETRv2 достигает отличной точности благодаря своим слоям внимания, эти механизмы масштабируются квадратично относительно разрешения изображения, что ведет к более высокому потреблению VRAM как во время обучения, так и при инференсе. YOLO11 обходит эту проблему за счет своих сверхэффективных сверточных блоков.

Экосистема обучения и удобство использования#

Основное преимущество использования модели Ultralytics заключается в окружающей ее экосистеме. Обучение RTDETRv2 часто связано с необходимостью навигации по сложным исследовательским репозиториям, настройкой запутанных весов функции потерь двудольного сопоставления и управлением значительными накладными расходами памяти.

И наоборот, Ultralytics уделяет большое внимание опыту разработчиков. Единый Python API абстрагирует шаблонный код, легко интегрируясь с такими инструментами, как Weights & Biases для отслеживания экспериментов, и автоматически обрабатывает аугментацию данных.

Вот как просто обучить и экспортировать модель с помощью пакета ultralytics:

from ultralytics import YOLO

# Initialize YOLO11 model with pre-trained weights
model = YOLO("yolo11n.pt")

# Train the model efficiently on a local GPU or cloud instance
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Utilize CUDA GPU
)

# Export the trained model to ONNX for widespread deployment
export_path = model.export(format="onnx")

После обучения экспорт модели YOLO11 в такие форматы, как ONNX, OpenVINO или CoreML, требует всего одной команды, что гарантирует беспрепятственное масштабирование вашего конвейера компьютерного зрения на различных аппаратных бэкэндах.

Многозадачные возможности

Помните, что в то время как RTDETRv2 фокусируется исключительно на обнаружении ограничивающих рамок, архитектура YOLO11 изначально поддерживает оценку позы и сегментацию экземпляров, позволяя объединить несколько задач компьютерного зрения в одно семейство моделей.

Сценарии использования и рекомендации#

Выбор между YOLO11 и RT-DETR зависит от специфических требований твоего проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда выбирать YOLO11#

YOLO11 — отличный выбор для:

  • Развертывание на периферийных устройствах для продакшена: Коммерческие приложения на таких устройствах, как Raspberry Pi или NVIDIA Jetson, где надежность и активное обслуживание имеют первостепенное значение.
  • Многозадачные приложения компьютерного зрения: Проекты, требующие обнаружения, сегментации, оценки позы и OBB в рамках единого универсального фреймворка.
  • Быстрое прототипирование и развертывание: Команды, которым необходимо быстро перейти от сбора данных к продакшену с помощью удобного Ultralytics Python API.

Когда выбирать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
  • Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
  • Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Взгляд в будущее: мощь YOLO26#

Хотя YOLO11 является отличным выбором для производства, команды, ищущие абсолютные передовые технологии, должны серьезно рассмотреть YOLO26. Выпущенный в январе 2026 года, YOLO26 преодолевает архитектурный разрыв, внедряя End-to-End NMS-Free Design (впервые появившийся в YOLOv10) непосредственно в свое ядро, полностью устраняя задержки пост-обработки и сложность логики развертывания.

YOLO26 также представляет несколько революционных функций:

  • Оптимизатор MuSGD: вдохновленный методами обучения LLM от Moonshot AI (Kimi K2), этот гибрид SGD и Muon обеспечивает невероятно стабильное обучение и значительно более быструю сходимость.
  • Удаление DFL: Distribution Focal Loss был убран для более чистого и упрощенного процесса экспорта, что радикально повышает совместимость с маломощными периферийными устройствами.
  • ProgLoss + STAL: Эти продвинутые функции потерь обеспечивают заметные улучшения в распознавании мелких объектов, что является критически важным требованием для наблюдения с дронов, сельскохозяйственного мониторинга и периферийных датчиков IoT.
  • Инференс на CPU до 43% быстрее: для развертываний, где нет выделенных GPU, YOLO26 специально оптимизирована для выполнения на CPU, значительно превосходя предыдущие поколения.

Узнай больше о YOLO26

Для тех, кто заинтересован в изучении более широкого спектра архитектур, документация Ultralytics также предоставляет информацию о YOLOv8, широко распространенной YOLOv5 и специализированных моделях, таких как YOLO-World для приложений обнаружения с открытым словарем. В конечном итоге, независимо от того, отдаете ли вы приоритет проверенной стабильности YOLO11 или прорывным инновациям YOLO26, экосистема Ultralytics предоставляет непревзойденные инструменты для воплощения ваших решений компьютерного зрения в жизнь.

Комментарии