YOLO Vision 2026:

RTDETRv2 против YOLO11#

Ландшафт компьютерного зрения постоянно развивается, и новые архитектуры расширяют границы возможного на периферийных устройствах и облачных серверах. Два наиболее заметных претендента в текущем пространстве детектирования объектов в реальном времени — это RTDETRv2 и YOLO11. Хотя обе модели обеспечивают исключительную производительность, они представляют фундаментально разные архитектурные философии: подход на основе Transformer против высокооптимизированной сверточной нейронной сети (CNN).

В этом комплексном техническом сравнении мы изучим архитектуры, показатели производительности, методологии обучения и идеальные сценарии использования для обеих моделей, чтобы помочь тебе принять обоснованное решение для твоего следующего приложения с искусственным интеллектом.

RTDETRv2: претендент на основе Transformer#

Представленная как эволюция оригинального Real-Time Detection Transformer, модель RTDETRv2 использует механизмы внимания для обработки визуальных данных. Рассматривая патчи изображения как последовательности, она достигает глобального понимания контекста изображения, что крайне полезно для детектирования сильно перекрывающихся объектов в сложных сценах.

Детали модели:

Архитектурные сильные и слабые стороны#

Главная инновация RTDETRv2 — это сквозная архитектура без NMS. Исключая подавление ненужных максимумов (NMS), она упрощает конвейер постобработки. Кроме того, по сравнению с оригинальной моделью RT-DETR, у нее были улучшены возможности извлечения многомасштабных признаков, что позволяет лучше распознавать объекты разного размера.

Тем не менее, поскольку RTDETRv2 опирается на архитектуру Transformer, при обучении ей обычно требуются значительно большие объемы памяти. Трансформеры, как правило, медленнее сходятся и требуют существенно больше памяти CUDA по сравнению с традиционными CNN, что делает их менее доступными для исследователей, работающих на потребительском «железе» или развертывающих модели в ограниченных средах edge AI.

Узнай больше о RTDETR

Ultralytics YOLO11: вершина эффективности CNN#

Основываясь на годах фундаментальных исследований, Ultralytics выпустила YOLO11 как огромный шаг вперед в линейке YOLO. Она совершенствует архитектуру CNN для достижения беспрецедентной скорости и точности, сохраняя гибкость и удобную для разработчиков экосистему, которую ожидает сообщество.

Детали модели:

Преимущество Ultralytics#

YOLO11 сияет своим балансом производительности. Модель достигает исключительного компромисса между скоростью и точностью, что делает ее исключительно универсальной для самых разных сценариев реального развертывания: от массивных кластеров облачных вычислений до легких мобильных устройств.

Более того, модели Ultralytics YOLO славятся меньшим потреблением памяти при обучении и инференсе. В отличие от моделей Transformer, которые легко могут исчерпать VRAM, YOLO11 позволяет использовать большие размеры батчей на стандартных GPU. Более того, YOLO11 не ограничивается простым детектированием объектов; она может похвастаться невероятной универсальностью, предлагая встроенную поддержку сегментации экземпляров, классификации изображений, оценки позы и ориентированных ограничивающих рамок (OBB).

Узнай больше о YOLO11

Сравнение производительности и метрик#

При сравнении «сырых» цифр становится очевидно, что хотя RTDETRv2 достигает впечатляющей точности, YOLO11 предлагает гораздо более детальный выбор размеров моделей с превосходной скоростью вывода, особенно на TensorRT.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Как видно из таблицы, модель YOLO11x достигает превосходного показателя mAPval в 54,7%, используя при этом меньше FLOP (194,9B против 259B) и обеспечивая более быстрый инференс на TensorRT (11,3мс против 15,03мс) по сравнению с вариантом RTDETRv2-x. Нано- и малые варианты YOLO11 предоставляют непревзойденные легковесные опции для ограниченных устройств вроде Raspberry Pi.

Экосистема, простота использования и обучение#

Отличительной чертой моделей Ultralytics является удобный и плавный пользовательский опыт. Python-пакет ultralytics предоставляет унифицированный интуитивно понятный API, который берет на себя всю тяжелую работу по аугментации данных, распределенному обучению и экспорту моделей. В то время как исследовательский репозиторий RTDETRv2 требует значительного объема шаблонного кода и конфигурации, Ultralytics предоставляет пайплайн «с нуля до героя».

Интересно, что экосистема Ultralytics настолько надежна, что изначально поддерживает запуск моделей RT-DETR параллельно с моделями YOLO! Это позволяет тебе задействовать хорошо поддерживаемую экосистему Ultralytics, включая интеграции с Weights & Biases и Comet ML, для легкого отслеживания экспериментов.

from ultralytics import RTDETR, YOLO

# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")

# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")
Оптимизируй свой рабочий процесс

Эффективность обучения имеет первостепенное значение в машинном обучении. В моделях Ultralytics используются предобученные веса, которые быстро сходятся. Чтобы управлять своими датасетами, обучающими запусками и эндпоинтами развертывания без написания кода, изучи платформу Ultralytics для полноценной работы с MLOps.

Применение в реальных условиях#

Выбор между этими архитектурами часто сводится к конкретным ограничениям развертывания твоего проекта.

В чем превосходит RTDETRv2: Трансформерный бэкенд RTDETRv2 очень эффективен в сценариях с плотными, сильно перекрывающимися объектами, где требуется глобальный контекст. Она часто оценивается в академических исследованиях и приложениях, где вычислительный бюджет менее важен, чем построение отношений на основе внимания.

Где доминирует YOLO11: YOLO11 — бесспорный чемпион практического развертывания в реальном мире. Минимальный объем занимаемой памяти и молниеносная скорость вывода делают её идеальной для:

  • Умное производство: Запуск детекции дефектов в реальном времени на производственных линиях с использованием промышленных ПК.
  • Сельское хозяйство: Развертывание на дронах для мониторинга здоровья культур в реальном времени и автоматизированной робототехники для сбора урожая.
  • Ритейл-аналитика: Одновременная обработка потоков с нескольких камер для управления очередями и отслеживания инвентаря без необходимости развертывания огромных ферм серверов.

Сценарии использования и рекомендации#

Выбор между RT-DETR и YOLO11 зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в экосистеме.

Когда выбирать RT-DETR#

RT-DETR — отличный выбор для:

  • Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
  • Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
  • Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.

Когда выбирать YOLO11#

YOLO11 рекомендуется для:

  • Развертывание на периферийных устройствах для продакшена: Коммерческие приложения на таких устройствах, как Raspberry Pi или NVIDIA Jetson, где надежность и активное обслуживание имеют первостепенное значение.
  • Многозадачные приложения компьютерного зрения: Проекты, требующие обнаружения, сегментации, оценки позы и OBB в рамках единого универсального фреймворка.
  • Быстрое прототипирование и развертывание: Команды, которым необходимо быстро перейти от сбора данных к продакшену с помощью удобного Ultralytics Python API.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Взгляд в будущее: появление YOLO26#

Если ты начинаешь новый проект, тебе также стоит рассмотреть компьютерное зрение следующего поколения: Ultralytics YOLO26. Выпущенная в январе 2026 года, YOLO26 объединяет в себе лучшее из обоих миров. Она представляет сквозной дизайн без NMS (впервые опробованный в YOLOv10), полностью устраняя задержки постобработки прямо как RTDETRv2, но с непревзойденной скоростью CNN.

YOLO26 оснащена оптимизатором MuSGD (вдохновленным инновациями в обучении LLM) для невероятно стабильной и быстрой сходимости, а также обеспечивает до 43% более быстрый вывод на CPU за счет удаления функции потерь Distribution Focal Loss (DFL). Благодаря специализированным функциям потерь ProgLoss + STAL, значительно улучшающим распознавание мелких объектов, YOLO26 является окончательной рекомендацией для любого современного конвейера компьютерного зрения.

Независимо от того, выберешь ли ты YOLO11 за ее проверенную универсальность, RTDETRv2 за механизмы внимания или ультрасовременную YOLO26 для максимальной производительности на периферийных устройствах, документация Ultralytics предоставляет все ресурсы, необходимые для успеха в твоем пути в области компьютерного зрения.

Комментарии