Ultralytics YOLO27:
Get Started

DAMO-YOLO и RTDETRv2#

Стремительное развитие компьютерного зрения привело к появлению множества архитектур, призванных сбалансировать скорость, точность и вычислительную эффективность. Среди моделей, предлагающих уникальные решения этих задач, выделяются DAMO-YOLO и RTDETRv2. Обе модели предназначены для передового инференса в реальном времени, но их архитектурные подходы принципиально различаются.

В этом подробном руководстве рассматриваются технические характеристики, архитектурные нововведения и практические сценарии использования обеих моделей. Также в нём показано, как современные решения, такие как платформа Ultralytics и передовая YOLO26, задали новые отраслевые стандарты развёртывания и простоты использования.

Обзор моделей#

Знакомство с DAMO-YOLO#

DAMO-YOLO разработали исследователи Alibaba Group. Эта модель обеспечивает быстрое и точное обнаружение объектов и во многом опирается на поиск архитектуры нейронных сетей (NAS). Вместо традиционных базовых сетей, спроектированных вручную, в ней используются структуры, созданные с помощью NAS и оптимизированные для низкой задержки. Кроме того, в модели применяются эффективная RepGFPN (обобщённая пирамидальная сеть признаков с перепараметризацией) и архитектура ZeroHead, упрощающие объединение признаков и предсказание ограничивающих рамок.

Основные сведения о модели:

Узнай больше о DAMO-YOLO

Знакомство с RTDETRv2#

RTDETRv2 от Baidu — значительный шаг вперёд в области трансформеров для обнаружения объектов в реальном времени. В отличие от традиционных свёрточных нейронных сетей (CNNs), использующих якорные рамки и подавление немаксимумов (NMS), RTDETRv2 использует механизмы self-attention, чтобы учитывать контекст всего изображения. Модель сразу выдаёт ограничивающие рамки, полностью исключая этап постобработки с NMS. В ней также применяется стратегия обучения «набор бесплатных преимуществ», повышающая базовую точность без увеличения задержки инференса.

Основные сведения о модели:

Узнай больше о RTDETRv2

Трансформеры в компьютерном зрении и ИИ

Трансформерам требуются более значительные вычислительные ресурсы, но способность обрабатывать глобальный контекст делает их очень эффективными для понимания сложных сцен — это одно из главных преимуществ RTDETRv2.

Сравнение производительности#

При оценке этих моделей для развёртывания в реальных условиях важно учитывать такие параметры, как средняя точность (mAP), скорость инференса и объём занимаемой памяти. Моделям на основе Transformer, таким как RTDETRv2, обычно требуется больше памяти CUDA при обучении и инференсе, чем компактным CNN, например DAMO-YOLO.

Ниже приведено подробное сравнение их метрик производительности.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Оптимальные сценарии применения#

Преимущества DAMO-YOLO: Благодаря оптимизированной с помощью NAS базовой сети и особенно малому количеству параметров в компактных вариантах, таких как DAMO-YOLOt, модель хорошо подходит для развёртывания на устройствах с ограниченными ресурсами. Если ты создаёшь решения для встраиваемых устройств и используешь среды выполнения, такие как ONNX, или специализированные движки TensorRT для периферийных вычислений, DAMO-YOLO обеспечит высокую скорость отклика.

Преимущества RTDETRv2: RTDETRv2 отлично подходит для сценариев, где доступны серверные GPU и особенно важно учитывать глобальный контекст изображения. Архитектура Transformer позволяет модели естественным образом разрешать перекрывающиеся ограничивающие рамки без NMS, что делает её надёжным решением для управления большими скоплениями людей и сложного отслеживания объектов, когда важны пространственные отношения между удалёнными объектами.

Преимущества Ultralytics: знакомство с YOLO26#

DAMO-YOLO и RTDETRv2 — важные достижения академической науки, но превратить эти модели в масштабируемые готовые к эксплуатации приложения может быть непросто. Разработчики часто сталкиваются с фрагментированными кодовыми базами, отсутствием поддержки многозадачного обучения и сложными процессами развёртывания.

Именно здесь экосистема Ultralytics особенно выделяется. Уделяя особое внимание простоте использования, хорошо поддерживаемому API Python и непревзойдённой универсальности, Ultralytics помогает разработчикам тратить меньше времени на отладку и больше — на создание продуктов.

Недавно выпущенная модель Ultralytics YOLO26 выводит эти преимущества на новый уровень и предлагает решения, превосходящие DAMO-YOLO и RTDETRv2:

  • Сквозная архитектура без NMS: Впервые реализованная в YOLOv10, YOLO26 предлагает опциональную сквозную голову (nms=False). Это устраняет постобработку NMS, ускоряя и значительно упрощая развертывание по сравнению с традиционными CNN и сохраняя преимущества прямого вывода, характерные для RTDETRv2.
  • До 43% быстрее инференс на CPU: YOLO26n работает на CPU с ONNX до 43% быстрее, чем YOLO11n, и тщательно оптимизирован для периферийных ИИ-устройств без дискретных GPU. Благодаря этому модель значительно лучше подходит для приложений IoT, чем требовательные к памяти трансформеры.
  • Оптимизатор MuSGD: Этот гибрид SGD и Muon, вдохновлённый Kimi K2 от Moonshot AI, переносит инновации в обучении больших языковых моделей (LLM) в компьютерное зрение, обеспечивая исключительно стабильное обучение и более быструю сходимость.
  • ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание мелких объектов — область, в которой моделям традиционно сложно добиться успеха. Это особенно важно для аэрофотосъёмки и применения дронов.
  • Удаление DFL: Distribution Focal Loss удалена, чтобы упростить форматы экспорта и улучшить совместимость с маломощными периферийными устройствами.
  • Непревзойдённая универсальность: В отличие от конкурирующих моделей, предназначенных только для детекции, YOLO26 включает специализированные улучшения для разных задач: например, специальную функцию потерь угла для ориентированных ограничивающих рамок (OBB), функцию потерь семантической сегментации для попиксельной точности и оценку остаточного логарифмического правдоподобия (RLE) для оценки позы.
Эффективное использование памяти имеет значение

Обучение моделей на основе трансформеров, таких как RTDETRv2, требует огромных объёмов памяти CUDA и часто вынуждает использовать дорогостоящие конфигурации с несколькими GPU. Модели Ultralytics YOLO требуют значительно меньше памяти как во время обучения, так и при инференсе, делая разработку ИИ доступнее для исследователей и энтузиастов.

Пример кода: унифицированный API Ultralytics#

Одно из главных преимуществ экосистемы Ultralytics — унифицированный API. Ты можешь без проблем загружать, обучать и проверять различные модели — в том числе реализацию RT-DETR на PyTorch и самые современные модели YOLO — не меняя свой рабочий процесс.

from ultralytics import RTDETR, YOLO

# Загрузить модель RT-DETR
model_rtdetr = RTDETR("rtdetr-l.pt")

# Загрузи передовую модель YOLO26
model_yolo = YOLO("yolo26n.pt")

# Выполни инференс изображения с помощью простого унифицированного интерфейса
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Отображение обнаруженных объектов
results_yolo[0].show()

Эта простота распространяется и на обучение на пользовательском наборе данных, и на экспорт. С помощью пакета Ultralytics для Python разработчики могут одной командой отправлять обученные веса на платформы для развёртывания, например CoreML или OpenVINO.

Заключение и дальнейшее изучение#

И DAMO-YOLO, и RTDETRv2, несомненно, расширили границы возможностей детекции объектов в реальном времени. DAMO-YOLO использует тщательно оптимизированные автоматически найденные структуры сети для повышения эффективности, а RTDETRv2 демонстрирует, что трансформеры могут конкурировать в задачах реального времени, устраняя традиционные узкие места, например NMS.

Однако разработчикам, которым нужен оптимальный баланс производительности, подробной документации и готовности к промышленному использованию, по-прежнему стоит выбирать модели Ultralytics YOLO. С выходом YOLO26 пользователи получают опциональную сквозную детекцию, подобную трансформерной, эффективность обучения, вдохновлённую LLM, и непревзойдённую скорость на CPU — всё это в интуитивно понятной и надёжной экосистеме.

Если ты выбираешь модели для следующего проекта, тебе также могут быть полезны наши сравнения EfficientDet и RT-DETR, обзор предыдущего поколения YOLO11 или разбор академических базовых моделей, например YOLOX. Начни разработку уже сегодня — изучи краткое руководство Ultralytics.

Комментарии