YOLOv8 и RTDETRv2#
Сфера компьютерного зрения постоянно развивается: новые архитектуры расширяют границы возможностей обнаружения объектов в реальном времени. Большое внимание привлекли две модели — Ultralytics YOLOv8 и RTDETRv2 от Baidu. В этом руководстве подробно сравниваются технические характеристики этих мощных моделей, их архитектура, показатели производительности и оптимальные сценарии развертывания.
Обзор YOLOv8#
Ultralytics YOLOv8 — важная веха в развитии семейства моделей YOLO (You Only Look Once). Она опирается на многолетние фундаментальные исследования и обеспечивает высокую скорость, точность и простоту использования для самых разных задач.
Основные характеристики:
- Авторы: Glenn Jocher, Ayush Chaurasia и Jing Qiu
- Организация: Ultralytics
- Дата: 10 января 2023 года
- GitHub: Репозиторий Ultralytics
- Документация: Документация YOLOv8
Архитектура и сильные стороны#
В YOLOv8 используется упрощенная архитектура, оптимизирующая извлечение признаков и регрессию ограничивающих рамок. Это детектор без якорей, что упрощает голову предсказаний и сокращает число настроек гиперпараметров, необходимых при обучении. Такая архитектура обеспечивает превосходный баланс производительности между скоростью инференса и средней точностью (mAP), благодаря чему модель отлично подходит для развертывания в реальных условиях — как на периферийных устройствах, так и на облачных серверах.
Кроме того, во время обучения YOLOv8 требует значительно меньше памяти, чем архитектуры на основе Transformer. Это позволяет разработчикам обучать модели на обычных потребительских GPU, не сталкиваясь с ошибками нехватки памяти.
Универсальность#
Одно из главных преимуществ YOLOv8 — универсальность, доступная из коробки. В то время как многие модели специализируются только на ограничивающих рамках, YOLOv8 изначально поддерживает обнаружение объектов, сегментацию экземпляров, классификацию изображений, оценку позы и обнаружение повернутых ограничивающих рамок (OBB).
Обзор RTDETRv2#
RTDETRv2 (Real-Time Detection Transformer version 2) развивает исходную RT-DETR и призвана применять мощные механизмы внимания Vision Transformer для обнаружения объектов в реальном времени.
Основные характеристики:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Репозиторий RT-DETR
- Документация: README RTDETRv2
Архитектура и сильные стороны#
В RTDETRv2 используется гибридная архитектура, сочетающая основу сверточной нейронной сети (CNN) со структурой кодировщика-декодировщика Transformer. Это позволяет модели выявлять сложные пространственные связи и глобальный контекст с помощью механизмов самовнимания. Благодаря использованию набора стратегий обучения «bag-of-freebies» RTDETRv2 демонстрирует конкурентоспособные значения mAP на стандартных тестовых наборах данных, например на наборе данных COCO.
Недостатки#
Несмотря на высокую точность, архитектура RTDETRv2 на основе Transformer потребляет больше памяти и обучается медленнее, чем чистые архитектуры CNN. Transformer по своей природе требуют больше VRAM, поэтому их сложно обучать на оборудовании с ограниченными ресурсами. Кроме того, RTDETRv2 хорошо справляется с обнаружением объектов, но ей не хватает многозадачной универсальности экосистемы Ultralytics, например поддержки оценки позы и сегментации.
Сравнение производительности#
При выборе модели для производственной среды крайне важно найти компромисс между размером модели, скоростью инференса и точностью. В таблице ниже непосредственно сравниваются варианты YOLOv8 и RTDETRv2.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Сценарии использования и рекомендации#
Выбор между YOLOv8 и RT-DETR зависит от конкретных требований проекта, ограничений на развертывание и предпочтений в отношении экосистемы.
Когда выбрать YOLOv8#
YOLOv8 — хороший выбор для:
- Универсальное решение для нескольких задач: проекты, которым нужна проверенная модель для обнаружения объектов, сегментации, классификации и оценки позы в экосистеме Ultralytics.
- Уже работающие системы: существующие промышленные среды, построенные на архитектуре YOLOv8 и использующие стабильные, тщательно проверенные конвейеры развертывания.
- Широкая поддержка сообщества и экосистемы: приложения, которым помогают многочисленные руководства по YOLOv8, сторонние интеграции и активное сообщество.
Когда выбрать RT-DETR#
RT-DETR рекомендуется для:
- Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
- Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Преимущества Ultralytics#
При выборе модели важны не только метрики: окружающая её программная экосистема имеет решающее значение для продуктивности разработчиков. Экосистема Ultralytics известна простотой использования и предоставляет единый API Python, который упрощает весь жизненный цикл машинного обучения.
Ultralytics избавляет от сложного шаблонного кода — от управления наборами данных до распределённого обучения. Разработчикам доступны предварительно обученные веса и простая интеграция с такими платформами, как Hugging Face, и инструментами мониторинга. Эта хорошо поддерживаемая экосистема гарантирует активную разработку, частые обновления и надёжную поддержку сообщества.
Кроме того, эффективность обучения — отличительная черта моделей Ultralytics YOLO. Они оптимизированы для быстрой сходимости и меньшего потребления памяти во время обучения, что значительно ускоряет циклы экспериментов по сравнению с детекторами на базе Transformer, такими как RTDETRv2.
Взгляд в будущее: возможности YOLO26#
YOLOv8 по-прежнему остаётся мощной моделью, однако разработчикам, которым нужны самые передовые решения, стоит перейти на YOLO26, выпущенную в январе 2026 года. YOLO26 задаёт новые стандарты благодаря нескольким революционным нововведениям:
- Сквозная архитектура без NMS: опциональная голова one-to-one YOLO26 (
nms=False) устраняет постобработку с подавлением немаксимумов (NMS), ускоряя и делая более детерминированными рабочие процессы развертывания. - Удаление DFL: удаление Distribution Focal Loss упрощает модель и повышает её совместимость с периферийными устройствами и устройствами с низким энергопотреблением.
- Оптимизатор MuSGD: оптимизатор MuSGD объединяет инновации из обучения LLM, обеспечивая более стабильное обучение и быструю сходимость.
- Инференс на CPU до 43% быстрее: модель значительно оптимизирована для сред без выделенных GPU.
- ProgLoss + STAL: Progressive Loss и Small-Target-Aware Label Assignment заметно улучшают распознавание мелких объектов, что особенно важно для аэрофотосъёмки и робототехники.
Среди других современных моделей из линейки Ultralytics стоит рассмотреть YOLO11, которая обеспечивает надёжную производительность в устаревших проектах, хотя для всех новых развертываний рекомендуется YOLO26.
Пример кода: обучение и инференс#
Благодаря простоте API Ultralytics для загрузки, обучения и развертывания моделей достаточно всего нескольких строк кода на Python. Перед запуском примера ниже установи PyTorch.
from ultralytics import YOLO
# Загружаем предварительно обученную небольшую модель YOLOv8
model = YOLO("yolov8s.pt")
# Обучи модель на собственном датасете
# Экономное использование памяти при обучении позволяет увеличить размер батча
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)
# Запусти инференс на тестовом изображении
results = model("https://ultralytics.com/images/bus.jpg")
# Отобрази результаты
results[0].show()
# Простой экспорт для развертывания на периферийных устройствах
export_path = model.export(format="onnx")Ultralytics поддерживает экспорт в один клик во множество форматов, включая ONNX, TensorRT и CoreML, упрощая варианты развертывания моделей на различных аппаратных архитектурах.
Заключение#
YOLOv8 и RTDETRv2 предлагают эффективные возможности для обнаружения объектов в реальном времени. RTDETRv2 демонстрирует, как Transformer позволяет учитывать глобальный контекст, поэтому модель подходит для сложных задач пространственного анализа, где скорость инференса и потребление памяти не являются основными ограничениями.
Однако разработчикам, для которых особенно важен баланс скорости, точности и эффективности использования ресурсов, лучше подойдут модели Ultralytics YOLO. Лёгкая YOLOv8, исключительная простота использования, универсальность при решении различных задач компьютерного зрения и активная экосистема с открытым исходным кодом делают её оптимальным решением для масштабируемых производственных сред. Для максимальной производительности на периферийных устройствах новая YOLO26 обеспечивает непревзойдённую эффективность без NMS и продолжает задавать стандарты отрасли.