YOLO Vision 2026:

RTDETRv2 против YOLOv10#

Эволюция computer vision во многом определялась непрерывным стремлением к балансу между скоростью и точностью. Традиционно конвейеры object detection реального времени полагались на Non-Maximum Suppression (NMS) в качестве шага постобработки для фильтрации перекрывающихся ограничивающих прямоугольников. Однако NMS создает узкие места в задержке и требует сложной настройки гиперпараметров. Недавно появились два принципиально разных архитектурных подхода для решения этой проблемы нативно: модели на базе Transformer, такие как RTDETRv2, и модели на базе CNN, такие как YOLOv10.

В этом руководстве представлен исчерпывающий технический анализ этих двух моделей, включая их архитектуры, показатели производительности и идеальные сценарии использования, а также показано, как последние инновации в Ultralytics ecosystem предлагают лучшее решение для современного развертывания.

RTDETRv2: Трансформеры для детектирования в реальном времени#

RTDETRv2 опирается на оригинальную архитектуру RT-DETR, стремясь объединить понимание глобального контекста Vision Transformers с требованиями к скорости в реальном времени, которые традиционно доминировали в моделях YOLO.

Основные характеристики:

Архитектура и методологии обучения#

RTDETRv2 использует сквозную архитектуру трансформера, которая изначально позволяет обходиться без NMS. Она улучшает своего предшественника за счет подхода «Bag-of-Freebies», оптимизируя стратегию обучения и добавляя возможности многомасштабного обнаружения. Модель использует CNN-основу для извлечения feature maps (визуальных деталей, таких как границы и текстуры), которые затем обрабатываются структурой кодировщика-декодера трансформера. Это позволяет модели одновременно анализировать контекст всего изображения, что делает ее крайне эффективной для понимания сложных сцен с плотным размещением или перекрытием объектов.

Сильные и слабые стороны#

Преимущества:

  • Глобальный контекст: attention mechanism позволяет модели преуспевать в сложных и загроможденных средах.
  • Без NMS: Напрямую предсказывает координаты объектов, упрощая конвейер развертывания.
  • Высокая точность: Обеспечивает отличную mean average precision (mAP) на датасете COCO.

Недостатки:

  • Ресурсоемкость: Архитектуры Transformer обычно требуют значительно больше памяти CUDA во время обучения по сравнению с CNN, из-за чего их тонкая настройка на стандартном оборудовании обходится дорого.
  • Вариативность скорости инференса: Несмотря на высокую скорость, тяжелые вычисления внимания могут приводить к снижению FPS in computer vision на периферийных устройствах, не имеющих выделенных ИИ-ускорителей.

Узнай больше о RTDETRv2

YOLOv10: Детектирование объектов в реальном времени из конца в конец#

YOLOv10 знаменует собой важный сдвиг в линейке YOLO object detection, напрямую устраняя давнюю проблему узкого места NMS в рамках концепции CNN.

Основные характеристики:

Архитектура и методологии обучения#

Основная инновация YOLOv10 заключается в последовательном двойном назначении для обучения без NMS. В процессе обучения используются две головы обнаружения: одна с назначением «один-ко-многим» (как в традиционных YOLO) для обеспечения богатых сигналов контроля, и другая с назначением «один-к-одному» для исключения необходимости в NMS. Во время вывода используется только голова «один-к-одному», что приводит к сквозному (end-to-end) процессу. Кроме того, авторы применили стратегию проектирования моделей, основанную на целостной эффективности и точности, всесторонне оптимизировав различные компоненты для снижения вычислительной избыточности.

Сильные и слабые стороны#

Преимущества:

  • Экстремальная скорость: За счет удаления NMS и оптимизации архитектуры YOLOv10 достигает невероятно низкой inference latency.
  • Эффективность: Требует меньше параметров и FLOPs для достижения сопоставимой с другими моделями точности, что делает ее идеальной для ограниченных сред.
  • Развертывание без NMS: Упрощает интеграцию в периферийные приложения, такие как smart surveillance.

Недостатки:

  • Концепция первого поколения: Будучи первой моделью YOLO, реализовавшей эту специфическую архитектуру без NMS, она заложила основу, но оставила пространство для многозадачной универсальности и оптимизации, появившихся в последующих моделях, таких как YOLO11 и YOLO26.

Узнай больше о YOLOv10

Сравнение производительности#

При оценке моделей для продакшена критически важно сбалансировать точность и вычислительные затраты. В приведенной ниже таблице выделены компромиссы в производительности между различными размерами RTDETRv2 и YOLOv10.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Хотя RTDETRv2 предлагает высокую точность, YOLOv10 демонстрирует заметное преимущество в задержке и эффективности использования параметров, особенно в меньших вариантах (Nano и Small), что делает ее крайне привлекательной для приложений edge computing and AIoT.

Выбор правильного масштаба

Если ты выполняешь развертывание на графических процессорах серверного класса, где batch size и VRAM менее ограничены, более крупные модели (например, -x или -l) максимизируют точность. Для периферийных устройств, таких как Raspberry Pi или мобильные телефоны, отдавай предпочтение вариантам nano (-n) или small (-s), чтобы поддерживать кадровую частоту в реальном времени.

Сценарии использования и рекомендации#

Выбор между RT-DETR и YOLOv10 зависит от специфических требований твоего проекта, ограничений развертывания и предпочтений в экосистеме.

Когда выбирать RT-DETR#

RT-DETR — отличный выбор для:

  • Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
  • Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
  • Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.

Когда стоит выбрать YOLOv10#

YOLOv10 рекомендуется для:

  • Детекции в реальном времени без NMS: Приложения, которым полезна сквозная (end-to-end) детекция без использования Non-Maximum Suppression, что снижает сложность развертывания.
  • Сбалансированного соотношения скорости и точности: Проекты, требующие оптимального баланса между скоростью вывода и точностью детекции для различных масштабов моделей.
  • Приложения с постоянной задержкой: Сценарии развертывания, где предсказуемое время вывода критически важно, например, в robotics или автономных системах.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Преимущество Ultralytics: представляем YOLO26#

Хотя и RTDETRv2, и YOLOv10 предлагают впечатляющие академические достижения, их развертывание в реальных сценариях требует надежной и поддерживаемой программной экосистемы. Ultralytics Platform обеспечивает непревзойденный опыт разработки, сочетая простоту использования, обширную документацию и мощные инструменты для data annotation и развертывания.

Для разработчиков, стремящихся к абсолютному уровню технологий в 2026 году, Ultralytics YOLO26 является главным выбором. Она объединяет лучшие идеи обеих архитектур и при этом предлагает прорывные улучшения:

  • Сквозной дизайн без NMS: Опираясь на концепцию, предложенную в YOLOv10, YOLO26 нативно исключает постобработку NMS, что приводит к более быстрой, простой логике развертывания и нулевой вариативности задержки.
  • Удаление DFL: Удалив Distribution Focal Loss, YOLO26 упрощает экспорт модели и значительно улучшает совместимость с периферийными и маломощными устройствами.
  • Оптимизатор MuSGD: Гибрид SGD и Muon (вдохновленный инновациями в обучении LLM), этот новый оптимизатор обеспечивает более стабильное обучение и значительно более быструю сходимость по сравнению с традиционными методами.
  • До 43% быстрее вывод на CPU: Тщательно оптимизировано для сред без выделенных GPU, делая высокопроизводительный AI для зрения доступным каждому.
  • ProgLoss + STAL: Эти передовые функции потерь обеспечивают заметные улучшения в распознавании мелких объектов, что критически важно для applications using drones и датчиков IoT.
  • Непревзойденная универсальность: В отличие от моделей, ограниченных ограничивающими прямоугольниками, YOLO26 поддерживает полный набор задач, включая instance segmentation, pose estimation, image classification и OBB detection, дополненные специфическими улучшениями задач, такими как Residual Log-Likelihood Estimation (RLE) для оценки поз (Pose).

Узнай больше о YOLO26

Бесшовная реализация с помощью Python#

Обучение и развертывание этих моделей с использованием Ultralytics Python API спроектированы максимально простыми. Требования к памяти во время обучения заметно ниже по сравнению с тяжелыми трансформаторными архитектурами, что позволяет обучать мощные модели на стандартном оборудовании.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 model (recommended)
# Alternatively, load a YOLOv10 model using YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Easily export to various formats for edge deployment
model.export(format="onnx", simplify=True)

Реализуешь ли ты security alarm systems или проводишь medical image analysis, выбор модели, поддерживаемой активным сообществом Ultralytics, гарантирует наличие у тебя необходимых инструментов, руководств по hyperparameter tuning и регулярных обновлений для достижения успеха. В то время как YOLOv10 и RTDETRv2 проложили путь для архитектур без NMS, YOLO26 доводит эту формулу до совершенства, предлагая лучший баланс производительности, универсальности и готовности к продакшену.

Комментарии