Ultralytics YOLO27:
Get Started

YOLO11 и RTDETRv2#

Область компьютерного зрения стремительно расширилась, и теперь разработчикам доступно множество вариантов для создания надёжных приложений на основе компьютерного зрения. В сфере обнаружения объектов в реальном времени всё чаще обсуждают свёрточные нейронные сети (CNN) и визуальные трансформеры (ViTs). В этом техническом сравнении рассматриваются две ведущие архитектуры: YOLO11, воплощающая высший уровень оптимизации свёрточных нейронных сетей, и RTDETRv2 — мощная версия семейства Detection Transformer.

Анализ архитектур, показателей производительности и оптимальных сценариев развёртывания поможет инженерам по машинному обучению принимать обоснованные решения. Обе модели расширяют границы точности, но модели Ultralytics YOLO обычно обеспечивают более удачный баланс скорости, поддержки экосистемы и удобства использования в реальных производственных системах.

YOLO11: эталон универсальности в реальных условиях#

Представленная компанией Ultralytics, YOLO11 опирается на многолетние фундаментальные исследования и сочетает высокую скорость, точность и невероятную универсальность. Она изначально создана для решения самых разных задач: обнаружения объектов, сегментации экземпляров, классификации изображений, оценки позы и извлечения ориентированных ограничивающих рамок (OBB).

Архитектура и сильные стороны#

В YOLO11 используются усовершенствованная основа свёрточной нейронной сети и передовые пространственные пирамиды признаков, благодаря чему модель исключительно эффективно расходует ресурсы. Она отлично работает в условиях строгих аппаратных ограничений и потребляет минимум памяти как при обучении, так и при выводе. Платформа Ultralytics изначально поддерживает YOLO11 и упрощает мониторинг моделей, разметку данных и обучение в облаке без необходимости объединять разрозненные инструменты MLOps.

Для разработчиков, работающих с периферийными вычислениями, YOLO11 обеспечивает сверхнизкую задержку. Благодаря малому размеру модель эффективно работает на самых разных устройствах — от Raspberry Pi до обычных смартфонов, — что делает её стандартным решением для умной розницы, контроля качества производства и автоматизированного управления дорожным движением.

RTDETRv2: трансформеры реального времени от Baidu#

RTDETRv2 (Detection Transformer реального времени версии 2) — это попытка Baidu сделать архитектуры на основе трансформеров пригодными для задач реального времени. Модель развивает оригинальную RT-DETR, используя подход «набора бесплатных улучшений» для повышения базовой точности без увеличения задержки вывода.

Узнай больше о RTDETRv2

Архитектура и сильные стороны#

В отличие от традиционных CNN, RTDETRv2 использует архитектуру энкодера-декодера с механизмами самовнимания, позволяющими учитывать глобальный контекст изображения. Это особенно полезно в переполненных сценах, где часто встречаются перекрытия объектов. При постобработке RTDETRv2 не использует подавление немаксимумов (NMS), а вместо этого применяет венгерский алгоритм сопоставления во время обучения для взаимно-однозначного двудольного сопоставления.

Однако модели на основе трансформеров известны высоким потреблением видеопамяти и памяти CUDA. Обучение RTDETRv2 с нуля или дообучение на пользовательских наборах данных часто требует крупных кластеров мощных GPU, что может стать препятствием для небольших гибких команд по сравнению с низким потреблением памяти при обучении моделей Ultralytics.

Анализ производительности и показателей#

При оценке этих моделей на стандартном наборе данных COCO видны явные компромиссы между количеством параметров, FLOPs и точностью.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Разбор результатов#

Как видно из таблицы, YOLO11 обеспечивает впечатляющее соотношение производительности и размера. YOLO11x достигает более высокого значения mAPval (54.7), чем RTDETRv2-x (54.3), используя при этом значительно меньше параметров (56.9M против 76M) и гораздо меньше вычислительных FLOPs (195.3B против 259B).

Кроме того, скорость вывода YOLO11 на T4 с TensorRT исключительно высока. YOLO11s выполняет вывод всего за 2.5 мс, тогда как самой компактной RTDETRv2-s требуется 5.03 мс. Это делает YOLO11 очевидным выбором для высокоскоростной видеоаналитики в реальном времени, где основным ограничением является время обработки кадра.

Цена трансформеров

Хотя RTDETRv2 достигает высокой точности благодаря слоям внимания, вычислительная сложность этих механизмов растёт квадратично с разрешением изображения, что увеличивает потребление видеопамяти как при обучении, так и при выводе. YOLO11 избегает этой проблемы благодаря сверхэффективным свёрточным блокам.

Экосистема обучения и удобство использования#

Главное преимущество моделей Ultralytics — развитая экосистема. Обучение RTDETRv2 часто требует работы со сложными исследовательскими репозиториями, настройки непростых весов функции потерь для двудольного сопоставления и управления значительными затратами памяти.

В свою очередь, Ultralytics уделяет особое внимание удобству для разработчиков. Единый API Python избавляет от шаблонного кода, легко интегрируется с такими инструментами, как Weights & Biases, для отслеживания экспериментов и автоматически выполняет аугментацию данных.

Вот насколько просто обучить и экспортировать модель с помощью пакета ultralytics:

from ultralytics import YOLO

# Инициализируй модель YOLO11 с предобученными весами
model = YOLO("yolo11n.pt")

# Эффективно обучи модель на локальном GPU или в облаке
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Используй GPU CUDA
)

# Экспортируй обученную модель в ONNX для широкого развёртывания
export_path = model.export(format="onnx")

После обучения для экспорта модели YOLO11 в такие форматы, как ONNX, OpenVINO или CoreML, нужна всего одна команда. Благодаря этому ты без труда масштабируешь конвейер компьютерного зрения на разные аппаратные платформы.

Возможности решения нескольких задач

Помни: RTDETRv2 предназначена исключительно для обнаружения объектов по ограничивающим рамкам, а архитектура YOLO11 изначально поддерживает сегментацию экземпляров и оценку позы, позволяя объединить несколько задач компьютерного зрения в одном семействе моделей.

Сценарии использования и рекомендации#

Выбор между YOLO11 и RT-DETR зависит от требований твоего проекта, ограничений развёртывания и предпочтений в отношении экосистемы.

Когда выбирать YOLO11#

YOLO11 — отличный выбор для следующих задач:

  • Промышленное развертывание на периферийных устройствах: коммерческие приложения на устройствах вроде Raspberry Pi или NVIDIA Jetson, где особенно важны надёжность и активная поддержка.
  • Многозадачные приложения компьютерного зрения: проекты, в которых в рамках единого фреймворка требуются обнаружение объектов, сегментация, оценка позы и OBB.
  • Быстрое прототипирование и развертывание: команды, которым нужно быстро пройти путь от сбора данных до промышленной эксплуатации с помощью удобного Python API Ultralytics.

Когда выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
  • Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:

  • Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
  • Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
  • Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.

Взгляд в будущее: возможности YOLO26#

YOLO11 — отличный выбор для производства, но командам, которым нужны самые передовые решения, стоит серьёзно рассмотреть YOLO26. Выпущенная в январе 2026 года, YOLO26 устраняет архитектурный разрыв: в её основу встроена необязательная голова сквозного вывода без NMS (nms=False), впервые представленная в YOLOv10. Это устраняет задержки постобработки NMS и сложность логики развёртывания.

В YOLO26 также появилось несколько революционных возможностей:

  • Оптимизатор MuSGD: Этот гибрид SGD и Muon, вдохновлённый методами обучения LLM на примере Kimi K2 от Moonshot AI, обеспечивает невероятно стабильное обучение и значительно ускоряет сходимость.
  • Удаление DFL: Distribution Focal Loss удалена, что упрощает экспорт и значительно повышает совместимость с маломощными периферийными устройствами.
  • ProgLoss + STAL: Эти усовершенствованные функции потерь заметно повышают точность распознавания мелких объектов — это критически важно для наблюдения с дронов, мониторинга сельского хозяйства и периферийных датчиков интернета вещей.
  • Вывод на CPU до 43% быстрее: Для развёртывания без выделенных GPU YOLO26 специально оптимизирована для работы на CPU и значительно превосходит модели предыдущих поколений.

Если ты хочешь ознакомиться с более широким выбором архитектур, документация Ultralytics также рассказывает о YOLOv8, широко используемой YOLOv5 и специализированных моделях, таких как YOLO-World, предназначенной для обнаружения объектов с открытым словарём. Независимо от того, что для тебя важнее — проверенная стабильность YOLO11 или прорывные инновации YOLO26, — экосистема Ultralytics предлагает непревзойдённые инструменты для воплощения решений в области компьютерного зрения.

Комментарии