YOLO11 и RTDETRv2#
Область компьютерного зрения стремительно расширилась, и теперь разработчикам доступно множество вариантов для создания надёжных приложений на основе компьютерного зрения. В сфере обнаружения объектов в реальном времени всё чаще обсуждают свёрточные нейронные сети (CNN) и визуальные трансформеры (ViTs). В этом техническом сравнении рассматриваются две ведущие архитектуры: YOLO11, воплощающая высший уровень оптимизации свёрточных нейронных сетей, и RTDETRv2 — мощная версия семейства Detection Transformer.
Анализ архитектур, показателей производительности и оптимальных сценариев развёртывания поможет инженерам по машинному обучению принимать обоснованные решения. Обе модели расширяют границы точности, но модели Ultralytics YOLO обычно обеспечивают более удачный баланс скорости, поддержки экосистемы и удобства использования в реальных производственных системах.
YOLO11: эталон универсальности в реальных условиях#
Представленная компанией Ultralytics, YOLO11 опирается на многолетние фундаментальные исследования и сочетает высокую скорость, точность и невероятную универсальность. Она изначально создана для решения самых разных задач: обнаружения объектов, сегментации экземпляров, классификации изображений, оценки позы и извлечения ориентированных ограничивающих рамок (OBB).
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2024-09-27
- GitHub: Репозиторий Ultralytics
- Документация: Документация YOLO11
Архитектура и сильные стороны#
В YOLO11 используются усовершенствованная основа свёрточной нейронной сети и передовые пространственные пирамиды признаков, благодаря чему модель исключительно эффективно расходует ресурсы. Она отлично работает в условиях строгих аппаратных ограничений и потребляет минимум памяти как при обучении, так и при выводе. Платформа Ultralytics изначально поддерживает YOLO11 и упрощает мониторинг моделей, разметку данных и обучение в облаке без необходимости объединять разрозненные инструменты MLOps.
Для разработчиков, работающих с периферийными вычислениями, YOLO11 обеспечивает сверхнизкую задержку. Благодаря малому размеру модель эффективно работает на самых разных устройствах — от Raspberry Pi до обычных смартфонов, — что делает её стандартным решением для умной розницы, контроля качества производства и автоматизированного управления дорожным движением.
RTDETRv2: трансформеры реального времени от Baidu#
RTDETRv2 (Detection Transformer реального времени версии 2) — это попытка Baidu сделать архитектуры на основе трансформеров пригодными для задач реального времени. Модель развивает оригинальную RT-DETR, используя подход «набора бесплатных улучшений» для повышения базовой точности без увеличения задержки вывода.
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Репозиторий RTDETRv2
- Документация: README RTDETRv2
Архитектура и сильные стороны#
В отличие от традиционных CNN, RTDETRv2 использует архитектуру энкодера-декодера с механизмами самовнимания, позволяющими учитывать глобальный контекст изображения. Это особенно полезно в переполненных сценах, где часто встречаются перекрытия объектов. При постобработке RTDETRv2 не использует подавление немаксимумов (NMS), а вместо этого применяет венгерский алгоритм сопоставления во время обучения для взаимно-однозначного двудольного сопоставления.
Однако модели на основе трансформеров известны высоким потреблением видеопамяти и памяти CUDA. Обучение RTDETRv2 с нуля или дообучение на пользовательских наборах данных часто требует крупных кластеров мощных GPU, что может стать препятствием для небольших гибких команд по сравнению с низким потреблением памяти при обучении моделей Ultralytics.
Анализ производительности и показателей#
При оценке этих моделей на стандартном наборе данных COCO видны явные компромиссы между количеством параметров, FLOPs и точностью.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Разбор результатов#
Как видно из таблицы, YOLO11 обеспечивает впечатляющее соотношение производительности и размера. YOLO11x достигает более высокого значения mAPval (54.7), чем RTDETRv2-x (54.3), используя при этом значительно меньше параметров (56.9M против 76M) и гораздо меньше вычислительных FLOPs (195.3B против 259B).
Кроме того, скорость вывода YOLO11 на T4 с TensorRT исключительно высока. YOLO11s выполняет вывод всего за 2.5 мс, тогда как самой компактной RTDETRv2-s требуется 5.03 мс. Это делает YOLO11 очевидным выбором для высокоскоростной видеоаналитики в реальном времени, где основным ограничением является время обработки кадра.
Хотя RTDETRv2 достигает высокой точности благодаря слоям внимания, вычислительная сложность этих механизмов растёт квадратично с разрешением изображения, что увеличивает потребление видеопамяти как при обучении, так и при выводе. YOLO11 избегает этой проблемы благодаря сверхэффективным свёрточным блокам.
Экосистема обучения и удобство использования#
Главное преимущество моделей Ultralytics — развитая экосистема. Обучение RTDETRv2 часто требует работы со сложными исследовательскими репозиториями, настройки непростых весов функции потерь для двудольного сопоставления и управления значительными затратами памяти.
В свою очередь, Ultralytics уделяет особое внимание удобству для разработчиков. Единый API Python избавляет от шаблонного кода, легко интегрируется с такими инструментами, как Weights & Biases, для отслеживания экспериментов и автоматически выполняет аугментацию данных.
Вот насколько просто обучить и экспортировать модель с помощью пакета ultralytics:
from ultralytics import YOLO
# Инициализируй модель YOLO11 с предобученными весами
model = YOLO("yolo11n.pt")
# Эффективно обучи модель на локальном GPU или в облаке
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Используй GPU CUDA
)
# Экспортируй обученную модель в ONNX для широкого развёртывания
export_path = model.export(format="onnx")После обучения для экспорта модели YOLO11 в такие форматы, как ONNX, OpenVINO или CoreML, нужна всего одна команда. Благодаря этому ты без труда масштабируешь конвейер компьютерного зрения на разные аппаратные платформы.
Помни: RTDETRv2 предназначена исключительно для обнаружения объектов по ограничивающим рамкам, а архитектура YOLO11 изначально поддерживает сегментацию экземпляров и оценку позы, позволяя объединить несколько задач компьютерного зрения в одном семействе моделей.
Сценарии использования и рекомендации#
Выбор между YOLO11 и RT-DETR зависит от требований твоего проекта, ограничений развёртывания и предпочтений в отношении экосистемы.
Когда выбирать YOLO11#
YOLO11 — отличный выбор для следующих задач:
- Промышленное развертывание на периферийных устройствах: коммерческие приложения на устройствах вроде Raspberry Pi или NVIDIA Jetson, где особенно важны надёжность и активная поддержка.
- Многозадачные приложения компьютерного зрения: проекты, в которых в рамках единого фреймворка требуются обнаружение объектов, сегментация, оценка позы и OBB.
- Быстрое прототипирование и развертывание: команды, которым нужно быстро пройти путь от сбора данных до промышленной эксплуатации с помощью удобного Python API Ultralytics.
Когда выбрать RT-DETR#
RT-DETR рекомендуется для:
- Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
- Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Взгляд в будущее: возможности YOLO26#
YOLO11 — отличный выбор для производства, но командам, которым нужны самые передовые решения, стоит серьёзно рассмотреть YOLO26. Выпущенная в январе 2026 года, YOLO26 устраняет архитектурный разрыв: в её основу встроена необязательная голова сквозного вывода без NMS (nms=False), впервые представленная в YOLOv10. Это устраняет задержки постобработки NMS и сложность логики развёртывания.
В YOLO26 также появилось несколько революционных возможностей:
- Оптимизатор MuSGD: Этот гибрид SGD и Muon, вдохновлённый методами обучения LLM на примере Kimi K2 от Moonshot AI, обеспечивает невероятно стабильное обучение и значительно ускоряет сходимость.
- Удаление DFL: Distribution Focal Loss удалена, что упрощает экспорт и значительно повышает совместимость с маломощными периферийными устройствами.
- ProgLoss + STAL: Эти усовершенствованные функции потерь заметно повышают точность распознавания мелких объектов — это критически важно для наблюдения с дронов, мониторинга сельского хозяйства и периферийных датчиков интернета вещей.
- Вывод на CPU до 43% быстрее: Для развёртывания без выделенных GPU YOLO26 специально оптимизирована для работы на CPU и значительно превосходит модели предыдущих поколений.
Если ты хочешь ознакомиться с более широким выбором архитектур, документация Ultralytics также рассказывает о YOLOv8, широко используемой YOLOv5 и специализированных моделях, таких как YOLO-World, предназначенной для обнаружения объектов с открытым словарём. Независимо от того, что для тебя важнее — проверенная стабильность YOLO11 или прорывные инновации YOLO26, — экосистема Ultralytics предлагает непревзойдённые инструменты для воплощения решений в области компьютерного зрения.