Ultralytics YOLO27:

RTDETRv2 и YOLO11#

Ландшафт компьютерного зрения постоянно меняется: новые архитектуры расширяют границы возможного на периферийных устройствах и облачных серверах. Двумя наиболее заметными претендентами в области обнаружения объектов в реальном времени сегодня являются RTDETRv2 и YOLO11. Хотя обе модели демонстрируют исключительную производительность, они воплощают принципиально разные архитектурные подходы: подход на основе Transformer и высокооптимизированную сверточную нейронную сеть (CNN).

В этом подробном техническом сравнении мы рассмотрим архитектуры, показатели производительности, методики обучения и оптимальные варианты использования обеих моделей, чтобы ты мог принять обоснованное решение для своего следующего приложения искусственного интеллекта.

RTDETRv2: претендент на основе Transformer#

Представленная как развитие оригинального Transformer для обнаружения объектов в реальном времени, RTDETRv2 использует механизмы внимания для обработки визуальных данных. Рассматривая фрагменты изображения как последовательности, модель формирует глобальное понимание контекста изображения, что особенно полезно для обнаружения сильно перекрывающихся объектов в сложных сценах.

Сведения о модели:

Преимущества и недостатки архитектуры#

Главная инновация RTDETRv2 — архитектура без NMS с обработкой от начала до конца. За счет отказа от подавления немаксимумов (NMS) она упрощает конвейер постобработки. Кроме того, возможности многоуровневого извлечения признаков были улучшены по сравнению с оригинальной моделью RT-DETR, что позволяет ей эффективнее распознавать объекты разного размера.

Однако из-за использования Transformer RTDETRv2 обычно требует значительно больше памяти во время обучения. Transformer, как правило, медленнее сходятся и требуют существенно больше памяти CUDA по сравнению с традиционными CNN, что делает их менее доступными для исследователей, работающих на потребительском оборудовании или разворачивающих модели в ограниченных средах периферийного ИИ.

Ultralytics YOLO11: вершина эффективности CNN#

Опираясь на многолетние фундаментальные исследования, Ultralytics выпустила YOLO11 как масштабный шаг вперед в развитии YOLO. Модель совершенствует архитектуру CNN, обеспечивая беспрецедентные скорость и точность, сохраняя при этом гибкость и удобную для разработчиков экосистему, к которой привыкло сообщество.

Сведения о модели:

Преимущества Ultralytics#

YOLO11 особенно выделяется своим балансом производительности. Модель обеспечивает исключительный компромисс между скоростью и точностью, что делает ее чрезвычайно универсальной для разнообразных сценариев развертывания в реальном мире — от крупных кластеров облачных вычислений до легких мобильных устройств.

Кроме того, модели Ultralytics YOLO известны меньшим потреблением памяти во время обучения и инференса. В отличие от моделей на основе Transformer, которые легко могут исчерпать VRAM, YOLO11 позволяет использовать большие размеры пакетов на стандартных GPU. Более того, YOLO11 не ограничивается простым обнаружением объектов: модель отличается впечатляющей универсальностью и изначально поддерживает сегментацию экземпляров, классификацию изображений, оценку позы и ориентированные ограничивающие рамки (OBB).

Сравнение производительности и метрик#

При сравнении абсолютных показателей становится очевидно, что, хотя RTDETRv2 обеспечивает впечатляющую точность, YOLO11 предлагает гораздо более детальный выбор размеров моделей и более высокую скорость инференса, особенно на TensorRT.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Как видно из таблицы, модель YOLO11x достигает более высокого показателя mAPval — 54,7 %, используя меньше FLOPs (194,9B против 259B) и обеспечивая более быстрый инференс на TensorRT (11,3 мс против 15,03 мс) по сравнению с вариантом RTDETRv2-x. Варианты YOLO11 nano и small предлагают непревзойденные легковесные решения для устройств с ограниченными ресурсами, таких как Raspberry Pi.

Экосистема, простота использования и обучение#

Определяющая характеристика моделей Ultralytics — оптимизированный пользовательский интерфейс. Пакет ultralytics для Python предоставляет единый интуитивно понятный API, который берет на себя всю сложную работу по аугментации данных, распределенному обучению и экспорту моделей. В то время как исследовательский репозиторий RTDETRv2 требует значительного количества шаблонного кода и настроек, Ultralytics предлагает конвейер «от нуля до героя».

Интересно, что экосистема Ultralytics настолько надежна, что изначально поддерживает запуск моделей RT-DETR вместе с моделями YOLO! Это позволяет тебе использовать хорошо поддерживаемую экосистему Ultralytics, включая интеграции с Weights & Biases и Comet ML, для удобного отслеживания экспериментов.

from ultralytics import RTDETR, YOLO

# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")

# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")
Оптимизируй свой рабочий процесс

Эффективность обучения имеет первостепенное значение в машинном обучении. Модели Ultralytics используют предварительно обученные веса и быстро сходятся. Чтобы управлять наборами данных, запусками обучения и конечными точками развертывания без написания кода, изучи платформу Ultralytics для интегрированного взаимодействия с MLOps.

Практические применения#

Выбор между этими архитектурами часто сводится к конкретным ограничениям развертывания твоего проекта.

Где RTDETRv2 особенно эффективна: Бэкенд Transformer в RTDETRv2 очень эффективен в сценариях с плотными, сильно перекрывающимися объектами, когда требуется глобальный контекст. Модель часто оценивают в академических исследованиях и приложениях, где вычислительный бюджет менее важен, чем непосредственное отображение взаимосвязей на основе внимания.

Где YOLO11 превосходит конкурентов: YOLO11 — бесспорный чемпион практического развертывания в реальном мире. Минимальное потребление памяти и молниеносная скорость инференса делают модель идеальной для:

  • Умное производство: обнаружения дефектов в реальном времени на производственных линиях с использованием промышленных ПК.
  • Сельское хозяйство: развертывания на дронах для мониторинга состояния сельскохозяйственных культур в реальном времени и роботизированной уборки урожая.
  • Аналитика в розничной торговле: одновременной обработки потоков с нескольких камер для управления очередями и отслеживания запасов без необходимости в огромных серверных фермах.

Варианты применения и рекомендации#

Выбор между RT-DETR и YOLO11 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать RT-DETR#

RT-DETR — подходящий выбор для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда выбирать YOLO11#

YOLO11 рекомендуется для:

  • Промышленного развертывания на периферийных устройствах: коммерческих приложений на таких устройствах, как Raspberry Pi или NVIDIA Jetson, где особенно важны надежность и активная поддержка.
  • Многоцелевых приложений компьютерного зрения: проектов, которым в рамках единого унифицированного фреймворка требуются детектирование, сегментация, оценка позы и OBB.
  • Быстрого прототипирования и развертывания: команд, которым нужно быстро перейти от сбора данных к промышленной эксплуатации с помощью оптимизированного Ultralytics Python API.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Взгляд в будущее: появление YOLO26#

Если ты начинаешь новый проект, тебе также стоит рассмотреть следующее поколение ИИ для компьютерного зрения: Ultralytics YOLO26. Выпущенная в январе 2026 года, YOLO26 объединяет лучшие стороны обоих подходов. Она представляет дизайн без NMS с обработкой от начала до конца (впервые реализованный в YOLOv10), полностью устраняя задержку постобработки, как RTDETRv2, но обеспечивая непревзойденную скорость CNN.

YOLO26 использует оптимизатор MuSGD, вдохновленный инновациями в обучении LLM, для невероятно стабильной и быстрой сходимости, а также обеспечивает до 43 % более быстрый инференс на CPU за счет удаления Distribution Focal Loss (DFL). Благодаря специализированным функциям потерь ProgLoss + STAL, значительно улучшающим распознавание небольших объектов, YOLO26 является оптимальной рекомендацией для любого современного конвейера компьютерного зрения.

Выберешь ли ты YOLO11 за проверенную универсальность, RTDETRv2 за механизмы внимания или передовую YOLO26 за максимальную производительность на периферийных устройствах — в документации Ultralytics есть все ресурсы, необходимые для успеха в твоем проекте компьютерного зрения.

Комментарии