Ultralytics YOLO27:
Get Started

YOLOv8 и RTDETRv2#

Сфера компьютерного зрения постоянно развивается: новые архитектуры расширяют границы возможностей обнаружения объектов в реальном времени. Большое внимание привлекли две модели — Ultralytics YOLOv8 и RTDETRv2 от Baidu. В этом руководстве подробно сравниваются технические характеристики этих мощных моделей, их архитектура, показатели производительности и оптимальные сценарии развертывания.

Обзор YOLOv8#

Ultralytics YOLOv8 — важная веха в развитии семейства моделей YOLO (You Only Look Once). Она опирается на многолетние фундаментальные исследования и обеспечивает высокую скорость, точность и простоту использования для самых разных задач.

Основные характеристики:

Архитектура и сильные стороны#

В YOLOv8 используется упрощенная архитектура, оптимизирующая извлечение признаков и регрессию ограничивающих рамок. Это детектор без якорей, что упрощает голову предсказаний и сокращает число настроек гиперпараметров, необходимых при обучении. Такая архитектура обеспечивает превосходный баланс производительности между скоростью инференса и средней точностью (mAP), благодаря чему модель отлично подходит для развертывания в реальных условиях — как на периферийных устройствах, так и на облачных серверах.

Кроме того, во время обучения YOLOv8 требует значительно меньше памяти, чем архитектуры на основе Transformer. Это позволяет разработчикам обучать модели на обычных потребительских GPU, не сталкиваясь с ошибками нехватки памяти.

Универсальность#

Одно из главных преимуществ YOLOv8 — универсальность, доступная из коробки. В то время как многие модели специализируются только на ограничивающих рамках, YOLOv8 изначально поддерживает обнаружение объектов, сегментацию экземпляров, классификацию изображений, оценку позы и обнаружение повернутых ограничивающих рамок (OBB).

Обзор RTDETRv2#

RTDETRv2 (Real-Time Detection Transformer version 2) развивает исходную RT-DETR и призвана применять мощные механизмы внимания Vision Transformer для обнаружения объектов в реальном времени.

Основные характеристики:

Архитектура и сильные стороны#

В RTDETRv2 используется гибридная архитектура, сочетающая основу сверточной нейронной сети (CNN) со структурой кодировщика-декодировщика Transformer. Это позволяет модели выявлять сложные пространственные связи и глобальный контекст с помощью механизмов самовнимания. Благодаря использованию набора стратегий обучения «bag-of-freebies» RTDETRv2 демонстрирует конкурентоспособные значения mAP на стандартных тестовых наборах данных, например на наборе данных COCO.

Недостатки#

Несмотря на высокую точность, архитектура RTDETRv2 на основе Transformer потребляет больше памяти и обучается медленнее, чем чистые архитектуры CNN. Transformer по своей природе требуют больше VRAM, поэтому их сложно обучать на оборудовании с ограниченными ресурсами. Кроме того, RTDETRv2 хорошо справляется с обнаружением объектов, но ей не хватает многозадачной универсальности экосистемы Ultralytics, например поддержки оценки позы и сегментации.

Подробнее о RTDETRv2

Сравнение производительности#

При выборе модели для производственной среды крайне важно найти компромисс между размером модели, скоростью инференса и точностью. В таблице ниже непосредственно сравниваются варианты YOLOv8 и RTDETRv2.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Оборудование и метрики

Инференс на CPU выполнялся с использованием ONNX, а скорость на GPU проверялась с помощью TensorRT на NVIDIA T4 GPU.

Сценарии использования и рекомендации#

Выбор между YOLOv8 и RT-DETR зависит от конкретных требований проекта, ограничений на развертывание и предпочтений в отношении экосистемы.

Когда выбрать YOLOv8#

YOLOv8 — хороший выбор для:

  • Универсальное решение для нескольких задач: проекты, которым нужна проверенная модель для обнаружения объектов, сегментации, классификации и оценки позы в экосистеме Ultralytics.
  • Уже работающие системы: существующие промышленные среды, построенные на архитектуре YOLOv8 и использующие стабильные, тщательно проверенные конвейеры развертывания.
  • Широкая поддержка сообщества и экосистемы: приложения, которым помогают многочисленные руководства по YOLOv8, сторонние интеграции и активное сообщество.

Когда выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
  • Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:

  • Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
  • Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
  • Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.

Преимущества Ultralytics#

При выборе модели важны не только метрики: окружающая её программная экосистема имеет решающее значение для продуктивности разработчиков. Экосистема Ultralytics известна простотой использования и предоставляет единый API Python, который упрощает весь жизненный цикл машинного обучения.

Ultralytics избавляет от сложного шаблонного кода — от управления наборами данных до распределённого обучения. Разработчикам доступны предварительно обученные веса и простая интеграция с такими платформами, как Hugging Face, и инструментами мониторинга. Эта хорошо поддерживаемая экосистема гарантирует активную разработку, частые обновления и надёжную поддержку сообщества.

Кроме того, эффективность обучения — отличительная черта моделей Ultralytics YOLO. Они оптимизированы для быстрой сходимости и меньшего потребления памяти во время обучения, что значительно ускоряет циклы экспериментов по сравнению с детекторами на базе Transformer, такими как RTDETRv2.

Взгляд в будущее: возможности YOLO26#

YOLOv8 по-прежнему остаётся мощной моделью, однако разработчикам, которым нужны самые передовые решения, стоит перейти на YOLO26, выпущенную в январе 2026 года. YOLO26 задаёт новые стандарты благодаря нескольким революционным нововведениям:

  • Сквозная архитектура без NMS: опциональная голова one-to-one YOLO26 (nms=False) устраняет постобработку с подавлением немаксимумов (NMS), ускоряя и делая более детерминированными рабочие процессы развертывания.
  • Удаление DFL: удаление Distribution Focal Loss упрощает модель и повышает её совместимость с периферийными устройствами и устройствами с низким энергопотреблением.
  • Оптимизатор MuSGD: оптимизатор MuSGD объединяет инновации из обучения LLM, обеспечивая более стабильное обучение и быструю сходимость.
  • Инференс на CPU до 43% быстрее: модель значительно оптимизирована для сред без выделенных GPU.
  • ProgLoss + STAL: Progressive Loss и Small-Target-Aware Label Assignment заметно улучшают распознавание мелких объектов, что особенно важно для аэрофотосъёмки и робототехники.

Среди других современных моделей из линейки Ultralytics стоит рассмотреть YOLO11, которая обеспечивает надёжную производительность в устаревших проектах, хотя для всех новых развертываний рекомендуется YOLO26.

Пример кода: обучение и инференс#

Благодаря простоте API Ultralytics для загрузки, обучения и развертывания моделей достаточно всего нескольких строк кода на Python. Перед запуском примера ниже установи PyTorch.

from ultralytics import YOLO

# Загружаем предварительно обученную небольшую модель YOLOv8
model = YOLO("yolov8s.pt")

# Обучи модель на собственном датасете
# Экономное использование памяти при обучении позволяет увеличить размер батча
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)

# Запусти инференс на тестовом изображении
results = model("https://ultralytics.com/images/bus.jpg")

# Отобрази результаты
results[0].show()

# Простой экспорт для развертывания на периферийных устройствах
export_path = model.export(format="onnx")
Готово к развертыванию

Ultralytics поддерживает экспорт в один клик во множество форматов, включая ONNX, TensorRT и CoreML, упрощая варианты развертывания моделей на различных аппаратных архитектурах.

Заключение#

YOLOv8 и RTDETRv2 предлагают эффективные возможности для обнаружения объектов в реальном времени. RTDETRv2 демонстрирует, как Transformer позволяет учитывать глобальный контекст, поэтому модель подходит для сложных задач пространственного анализа, где скорость инференса и потребление памяти не являются основными ограничениями.

Однако разработчикам, для которых особенно важен баланс скорости, точности и эффективности использования ресурсов, лучше подойдут модели Ultralytics YOLO. Лёгкая YOLOv8, исключительная простота использования, универсальность при решении различных задач компьютерного зрения и активная экосистема с открытым исходным кодом делают её оптимальным решением для масштабируемых производственных сред. Для максимальной производительности на периферийных устройствах новая YOLO26 обеспечивает непревзойдённую эффективность без NMS и продолжает задавать стандарты отрасли.

Комментарии