Ultralytics YOLO27:

RTDETRv2 и YOLOv10#

Развитие компьютерного зрения во многом определялось постоянным стремлением сбалансировать скорость и точность. Традиционно конвейеры обнаружения объектов в реальном времени использовали подавление немаксимумов (NMS) на этапе постобработки для фильтрации перекрывающихся ограничивающих рамок. Однако NMS создает узкие места, увеличивающие задержку, и усложняет настройку гиперпараметров. Недавно появились два разных архитектурных подхода, позволяющих решить эту проблему нативно: модели на основе Transformer, такие как RTDETRv2, и модели на основе CNN, такие как YOLOv10.

В этом руководстве приводится подробное техническое сравнение этих двух моделей: рассматриваются их архитектуры, показатели производительности и оптимальные варианты применения, а также показывается, как новейшие инновации экосистемы Ultralytics предлагают оптимальное решение для современного развертывания.

RTDETRv2: Transformer-модели обнаружения в реальном времени#

RTDETRv2 развивает исходную архитектуру RT-DETR, стремясь объединить понимание глобального контекста, свойственное Vision Transformer, со скоростью работы в реальном времени, которой традиционно славятся модели YOLO.

Ключевые характеристики:

Архитектура и методики обучения#

RTDETRv2 использует сквозную архитектуру Transformer, которая изначально не требует NMS. По сравнению с предшественником модель улучшена за счет подхода «Bag-of-Freebies», оптимизации стратегии обучения и добавления возможностей многомасштабного обнаружения. Модель использует CNN-бэкбон для извлечения карт признаков (визуальных деталей, таких как границы и текстуры), которые затем обрабатываются структурой кодировщика-декодировщика Transformer. Благодаря этому модель может одновременно анализировать контекст всего изображения, что делает ее особенно эффективной при работе со сложными сценами, где объекты расположены плотно или перекрываются.

Преимущества и недостатки#

Преимущества:

  • Глобальный контекст: Механизм внимания позволяет модели превосходно работать в сложных, загроможденных сценах.
  • Без NMS: Модель напрямую предсказывает координаты объектов, упрощая конвейер развертывания.
  • Высокая точность: Модель достигает отличного значения средней точности (mAP) на наборе данных COCO.

Недостатки:

  • Высокие требования к ресурсам: Архитектуры Transformer обычно требуют значительно больше памяти CUDA во время обучения по сравнению с CNN, поэтому их тонкая настройка на стандартном оборудовании обходится дорого.
  • Переменная скорость инференса: Хотя модель работает быстро, ресурсоемкие вычисления внимания могут приводить к более низкому значению FPS в компьютерном зрении на периферийных устройствах без специализированных AI-ускорителей.

Узнай больше о RTDETRv2

YOLOv10: обнаружение объектов в реальном времени от начала до конца#

YOLOv10 знаменует собой серьезный поворот в направлении обнаружения объектов YOLO, напрямую устраняя давнее узкое место, связанное с NMS, в рамках CNN-архитектуры.

Ключевые характеристики:

Архитектура и методики обучения#

Ключевая инновация YOLOv10 — согласованные двойные назначения для обучения без NMS. Во время обучения используются две головы обнаружения: одна с назначением «один-ко-многим» (как в традиционных моделях YOLO) для предоставления богатых обучающих сигналов, а другая — с назначением «один-к-одному» для устранения необходимости в NMS. Во время инференса используется только голова с назначением «один-к-одному», что обеспечивает сквозной процесс. Кроме того, авторы применили целостную стратегию проектирования моделей, ориентированную на эффективность и точность, комплексно оптимизировав различные компоненты для сокращения вычислительной избыточности.

Преимущества и недостатки#

Преимущества:

  • Экстремальная скорость: Благодаря удалению NMS и оптимизации архитектуры YOLOv10 обеспечивает исключительно низкую задержку инференса.
  • Эффективность: Для достижения сопоставимой с другими моделями точности требуется меньше параметров и FLOPs, что делает модель особенно подходящей для сред с ограниченными ресурсами.
  • Развертывание без NMS: Упрощает интеграцию в периферийные приложения, такие как интеллектуальное видеонаблюдение.

Недостатки:

  • Концепция первого поколения: Как первая модель YOLO с такой архитектурой без NMS, она заложила основу, но оставила возможности для дальнейшего развития универсальности в многозадачных сценариях и оптимизации, реализованных в последующих моделях, таких как YOLO11 и YOLO26.

Узнай больше о YOLOv10

Сравнение производительности#

При оценке моделей для промышленной эксплуатации критически важно сбалансировать точность и вычислительные затраты. В таблице ниже показан компромисс между производительностью различных вариантов RTDETRv2 и YOLOv10.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Хотя RTDETRv2 обеспечивает стабильную точность, YOLOv10 демонстрирует заметное преимущество по задержке и эффективности использования параметров, особенно в небольших вариантах (Nano и Small), что делает модель особенно привлекательной для приложений периферийных вычислений и AIoT.

Выбор подходящего масштаба

Если ты развертываешь модель на серверных GPU, где размер батча и VRAM не являются серьезными ограничениями, более крупные модели (например, -x или -l) обеспечат максимальную точность. Для периферийных устройств, таких как Raspberry Pi или мобильные телефоны, выбирай варианты Nano (-n) или Small (-s), чтобы сохранять частоту кадров в реальном времени.

Варианты применения и рекомендации#

Выбор между RT-DETR и YOLOv10 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать RT-DETR#

RT-DETR — подходящий выбор для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда выбирать YOLOv10#

YOLOv10 рекомендуется для:

  • Обнаружения объектов в реальном времени без NMS: приложений, которым полезно сквозное обнаружение без подавления немаксимумов, что снижает сложность развертывания.
  • Сбалансированного соотношения скорости и точности: проектов, требующих удачного баланса между скоростью инференса и точностью обнаружения для моделей разных размеров.
  • Приложений со стабильной задержкой: сценариев развертывания, где критически важны предсказуемые времена инференса, например в робототехнике или автономных системах.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Преимущество Ultralytics: знакомство с YOLO26#

Хотя RTDETRv2 и YOLOv10 предлагают впечатляющие академические достижения, их использование в реальных сценариях требует надежной, хорошо поддерживаемой программной экосистемы. Платформа Ultralytics обеспечивает исключительный опыт для разработчиков, объединяя простоту использования, обширную документацию и мощные инструменты для аннотирования данных и развертывания.

Для разработчиков, которым в 2026 году нужен абсолютный передний край технологий, Ultralytics YOLO26 — оптимальная рекомендация. Она объединяет лучшие идеи обеих архитектур и предлагает революционные улучшения:

  • Сквозная архитектура без NMS: Развивая концепцию, впервые реализованную в YOLOv10, YOLO26 нативно устраняет постобработку NMS, обеспечивая более быстрое и простое развертывание, а также нулевую вариативность задержки.
  • Удаление DFL: Удаление функции потерь Distribution Focal Loss упрощает экспорт модели и значительно улучшает совместимость с периферийными устройствами и устройствами с низким энергопотреблением.
  • Оптимизатор MuSGD: Этот новый оптимизатор, представляющий собой гибрид SGD и Muon (вдохновленный инновациями в обучении LLM), обеспечивает более стабильное обучение и значительно более быструю сходимость по сравнению с традиционными методами.
  • До 43% более быстрый инференс на CPU: Тщательно оптимизирован для сред без выделенных GPU, делая высокопроизводительный AI для компьютерного зрения доступнее.
  • ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание небольших объектов, что особенно важно для приложений с использованием дронов и IoT-сенсоров.
  • Непревзойденная универсальность: В отличие от моделей, ограниченных ограничивающими рамками, YOLO26 поддерживает полный набор задач, включая сегментацию экземпляров, оценку позы, классификацию изображений и обнаружение OBB, а также специализированные улучшения, такие как оценка остаточного логарифмического правдоподобия (RLE) для позы.

Простая реализация с Python#

Обучение и развертывание этих моделей с помощью Python API Ultralytics разработано так, чтобы проходить без лишних сложностей. Во время обучения требования к памяти заметно ниже, чем у архитектур с большим количеством Transformer-компонентов, что позволяет тебе обучать мощные модели на стандартном оборудовании.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 model (recommended)
# Alternatively, load a YOLOv10 model using YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Easily export to various formats for edge deployment
model.export(format="onnx", simplify=True)

Будь то реализация систем охранной сигнализации или проведение анализа медицинских изображений, выбор модели с поддержкой активного сообщества Ultralytics гарантирует доступ к инструментам, руководствам по настройке гиперпараметров и постоянным обновлениям, необходимым для успеха. YOLOv10 и RTDETRv2 проложили путь для архитектур без NMS, а YOLO26 доводит эту формулу до совершенства, предлагая оптимальный баланс производительности, универсальности и готовности к промышленной эксплуатации.

Комментарии