Ultralytics YOLO27:

DAMO-YOLO и RTDETRv2#

Стремительно развивающаяся область компьютерного зрения породила впечатляющее множество архитектур, призванных сбалансировать скорость, точность и вычислительную эффективность. Две заметные модели, предложившие уникальные подходы к решению этих задач, — DAMO-YOLO и RTDETRv2. Хотя обе модели ориентированы на передовые решения для вывода в реальном времени, их архитектурные принципы кардинально различаются.

В этом подробном руководстве рассматриваются технические характеристики, архитектурные инновации и практические варианты использования обеих моделей, а также то, как современные решения, такие как Ultralytics Platform и передовая модель YOLO26, изменили отраслевые стандарты развертывания и удобства использования.

Обзор моделей#

Знакомство с DAMO-YOLO#

Разработанная исследователями Alibaba Group, DAMO-YOLO представляет быстрый и точный метод обнаружения объектов, в значительной степени опирающийся на поиск нейронной архитектуры (NAS). Традиционные каркасы сети заменены структурами, сгенерированными с помощью NAS и рассчитанными на низкую задержку. Кроме того, модель использует эффективную RepGFPN (обобщённую пирамиду признаков с параметризацией) и конструкцию ZeroHead для оптимизации агрегации признаков и предсказания ограничивающих рамок.

Ключевые сведения о модели:

Узнай больше о DAMO-YOLO

Знакомство с RTDETRv2#

RTDETRv2 от Baidu представляет собой значительный шаг вперёд для трансформеров обнаружения в реальном времени. В отличие от традиционных сверточных нейронных сетей (CNN), использующих anchor boxes и подавление немаксимумов (NMS), RTDETRv2 применяет механизмы self-attention для контекстного анализа всего изображения. Модель напрямую выдаёт ограничивающие рамки, полностью минуя этап постобработки NMS. В ней реализована стратегия обучения «набора бесплатных улучшений», повышающая базовую точность без увеличения задержки вывода.

Ключевые сведения о модели:

Узнай больше о RTDETRv2

Использование Transformer в компьютерном зрении

Хотя Transformer требуют больше вычислительных ресурсов, их способность обрабатывать глобальный контекст делает их чрезвычайно эффективными для понимания сложных сцен, что является одним из главных преимуществ RTDETRv2.

Сравнение производительности#

При оценке этих моделей для развертывания в реальных условиях критически важны такие параметры, как средняя точность (mAP), скорость вывода и объём занимаемой памяти. Модели на основе Transformer, такие как RTDETRv2, обычно требуют больше памяти CUDA во время обучения и вывода по сравнению с лёгкими CNN, такими как DAMO-YOLO.

Ниже приведено подробное сравнение показателей их производительности.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Идеальные сценарии использования#

Преимущества DAMO-YOLO: Благодаря оптимизированному с помощью NAS каркасу сети и исключительно малому числу параметров в небольших вариантах, таких как DAMO-YOLOt, модель отлично подходит для развертывания на устройствах с жёсткими ограничениями ресурсов. Если ты создаёшь решения для встраиваемых устройств с использованием сред выполнения, таких как ONNX, или специализированных движков TensorRT для периферийных вычислений, DAMO-YOLO предоставляет высокоотзывчивую платформу.

Преимущества RTDETRv2: RTDETRv2 особенно эффективна в сценариях, где доступны серверные GPU, а глобальный контекст изображения имеет первостепенное значение. Её архитектура на основе Transformer позволяет естественным образом разрешать перекрывающиеся ограничивающие рамки без NMS, что делает модель надёжным выбором для управления потоками людей или сложного отслеживания объектов, где критически важны пространственные взаимосвязи между удалёнными объектами.

Преимущество Ultralytics: знакомство с YOLO26#

Хотя DAMO-YOLO и RTDETRv2 представляют собой значительные академические достижения, перенос этих моделей в масштабируемые приложения, готовые к промышленной эксплуатации, может быть сложным. Разработчики часто сталкиваются с разрозненными кодовыми базами, отсутствием поддержки многозадачного обучения и сложными конвейерами развертывания.

Именно здесь экосистема Ultralytics действительно выделяется. Благодаря приоритету удобства использования, качественно поддерживаемому API Python и непревзойдённой универсальности Ultralytics помогает разработчикам тратить меньше времени на отладку и больше — на создание решений.

Недавно выпущенная модель Ultralytics YOLO26 выводит эти преимущества на новый уровень, предлагая прорывные возможности, превосходящие DAMO-YOLO и RTDETRv2:

  • Сквозная архитектура без NMS: Впервые реализованная в YOLOv10, YOLO26 изначально является сквозной моделью. Это полностью устраняет постобработку NMS, ускоряя и значительно упрощая развертывание по сравнению с традиционными CNN, при этом сохраняя преимущества прямого вывода RTDETRv2.
  • До 43% более быстрый вывод на CPU: Модель тщательно оптимизирована для периферийных устройств ИИ без дискретных GPU, что делает её гораздо более подходящим выбором для приложений IoT по сравнению с трансформерами, требующими много памяти.
  • Оптимизатор MuSGD: Этот гибрид SGD и Muon, вдохновлённый Kimi K2 от Moonshot AI, переносит инновации в обучении больших языковых моделей (LLM) в компьютерное зрение, обеспечивая исключительно стабильное обучение и более быструю сходимость.
  • ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание небольших объектов — область, в которой модели традиционно испытывают трудности. Это особенно важно для аэрофотосъёмки и приложений с дронами.
  • Удаление DFL: Distribution Focal Loss удалена для упрощения форматов экспорта и повышения совместимости с периферийными устройствами с низким энергопотреблением.
  • Непревзойдённая универсальность: В отличие от конкурирующих моделей, строго ограниченных обнаружением объектов, YOLO26 включает специализированные улучшения для разных задач, например специальную функцию потерь угла для ориентированных ограничивающих рамок (OBB), функцию потерь семантической сегментации для попиксельной точности и Residual Log-Likelihood Estimation (RLE) для оценки позы.
Эффективное использование памяти имеет значение

Обучение моделей на основе Transformer, таких как RTDETRv2, требует выделения огромного объёма памяти CUDA и часто делает необходимыми дорогостоящие конфигурации с несколькими GPU. Модели Ultralytics YOLO требуют значительно меньше памяти как во время обучения, так и во время вывода, делая разработку ИИ доступнее для исследователей и энтузиастов.

Пример кода: унифицированный API Ultralytics#

Одно из главных преимуществ экосистемы Ultralytics — это ее унифицированный API. Ты можешь бесшовно загружать, обучать и валидировать различные модели, включая реализацию RT-DETR на PyTorch и современные модели YOLO, не меняя свой рабочий процесс.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the detected objects
results_yolo[0].show()

Эта простота распространяется и на обучение на пользовательских наборах данных, и на экспорт. Используя пакет Ultralytics для Python, разработчики могут легко отправлять обученные веса на платформы развертывания, такие как CoreML или OpenVINO, с помощью одной команды.

Заключение и дальнейшее изучение#

DAMO-YOLO и RTDETRv2, безусловно, расширили границы возможного в обнаружении объектов в реальном времени. DAMO-YOLO предоставляет высокооптимизированные структуры сетей, автоматически найденные с помощью поиска архитектуры, для максимальной эффективности, тогда как RTDETRv2 доказывает, что Transformer могут конкурировать в области реального времени, устраняя традиционные узкие места, такие как NMS.

Однако для разработчиков, которым нужен оптимальный баланс производительности, подробной документации и готовности к промышленной эксплуатации, модели Ultralytics YOLO остаются золотым стандартом. С появлением YOLO26 пользователи получают обнаружение объектов сквозным способом, подобное Transformer, эффективность обучения в духе LLM и непревзойдённую скорость на CPU — всё это в рамках интуитивно понятной и надёжной экосистемы.

Если ты оцениваешь модели для своего следующего проекта, тебе также может быть полезно прочитать наши сравнения EfficientDet vs RT-DETR, изучить предыдущее поколение YOLO11 или ознакомиться с академическими базовыми моделями, такими как YOLOX. Начни создавать уже сегодня, изучив руководство по быстрому старту Ultralytics.

Комментарии