Ultralytics YOLO27:

YOLOv7 и RTDETRv2#

Ландшафт компьютерного зрения продолжает стремительно развиваться под сильным влиянием конкуренции между сверточными нейронными сетями (CNNs) и трансформерами для компьютерного зрения (ViTs). В этом техническом сравнении подробно рассматриваются две мощные архитектуры: YOLOv7 — высокооптимизированный детектор объектов на базе CNN, и RTDETRv2 — современный трансформер для обнаружения объектов в реальном времени.

Анализируя архитектурные различия, показатели производительности и оптимальные сценарии развертывания, разработчики могут принимать обоснованные решения при интеграции этих моделей ИИ для компьютерного зрения в производственные конвейеры.

YOLOv7: CNN-архитектура с набором бесплатных улучшений#

YOLOv7 представила несколько кардинально меняющих подход структурных оптимизаций для традиционного семейства YOLO, расширив возможности обнаружения объектов в реальном времени с помощью набора «бесплатных улучшений, доступных при обучении».

Ключевые характеристики:

Архитектура и преимущества#

В основе YOLOv7 лежит архитектура расширенной сети агрегации эффективных слоев (E-ELAN). Эта структурная конструкция позволяет модели изучать более разнообразные признаки, не разрушая исходный путь распространения градиента. Кроме того, в ней используются запланированные репараметризованные свертки, которые повышают скорость вывода без снижения точности. Подход с набором бесплатных улучшений, доступных при обучении, позволяет достичь впечатляющего компромисса между скоростью и точностью, что делает модель особенно подходящей для задач обнаружения объектов в реальном времени на серверных GPU.

YOLOv7 также отличается высокой универсальностью. Помимо стандартного обнаружения объектов по ограничивающим рамкам, репозиторий предлагает ветки для оценки позы и сегментации экземпляров, демонстрируя адаптивность модели.

Ограничения#

Как и многие устаревшие CNN-модели, YOLOv7 использует подавление немаксимумов (NMS) для постобработки. NMS вносит переменную задержку, особенно в сценах с высокой плотностью объектов, что может осложнять обеспечение строгих гарантий работы в реальном времени на периферийных устройствах.

Узнай больше о YOLOv7

RTDETRv2: развитие трансформеров для работы в реальном времени#

RTDETRv2 развивает исходную платформу RT-DETR, дополнительно показывая, что трансформеры могут конкурировать с архитектурами YOLO по задержке в реальном времени, сохраняя высокую пространственную точность.

Ключевые характеристики:

  • Авторы: Вэньюй Люй (Wenyu Lv), Иань Чжао (Yian Zhao), Циньяо Ччан (Qinyao Chang), Куй Хуан (Kui Huang), Гуаньчжун Ван (Guanzhong Wang), И Лю (Yi Liu)
  • Организация: Baidu
  • Дата: 2024-07-24
  • Arxiv: https://arxiv.org/abs/2407.17140
  • GitHub: lyuwenyu/RT-DETR

Архитектура и преимущества#

RTDETRv2 представляет собой значительный шаг вперед для трансформеров компьютерного зрения. Модель использует гибкий процесс выбора запросов и эффективный гибридный кодировщик для быстрой обработки многоуровневых признаков. Благодаря новому набору «бесплатных улучшений», специально разработанному для трансформеров обнаружения (DETRs), она расширяет возможности пространственного анализа. Поскольку модель изначально не использует NMS, она обеспечивает детерминированное время вывода — критически важную особенность для строгих требований приложений умного города и автономного вождения.

Ограничения#

Несмотря на свои улучшения, RTDETRv2 сохраняет традиционные недостатки архитектур на базе трансформеров. Для обучения и вывода ей требуется значительно больше памяти CUDA по сравнению с CNN. Кроме того, сходимость при обучении заметно дольше, поэтому необходимы большие объемы качественных аннотированных данных, например датасет COCO, и значительные вычислительные ресурсы.

Узнай больше о RTDETRv2

Сравнение производительности#

При сравнении этих моделей необходимо учитывать целостную картину, включающую точность, фактическую скорость вывода и вычислительные затраты. Ниже приведена таблица прямого сравнения.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Интерпретация результатов тестирования

Хотя RTDETRv2-x заявляет абсолютное максимальное значение mAPval — 54,3%, ей требуется колоссальные 259 миллиардов FLOPs. Архитектуры YOLOv7, напротив, обеспечивают отличную базовую производительность, но страдают от накладных расходов устаревшего NMS, которые не полностью отражаются в метриках чистой задержки сети.

Преимущество Ultralytics: экосистема и развитие#

Хотя YOLOv7 и RTDETRv2 предлагают широкие возможности, их развертывание в производственных средах часто выявляет организационные сложности. Именно здесь особенно сильна экосистема Ultralytics. Разработанная для бесшовной интеграции от начала до конца, платформа Ultralytics предоставляет разработчикам единый API, скрывающий типичные сложности конвейеров компьютерного зрения.

Непревзойденная универсальность и эффективность использования памяти#

В отличие от жестко заданных моделей на базе трансформеров, потребляющих огромные объемы VRAM, модели Ultralytics YOLO сохраняют высокую эффективность использования памяти. Это обеспечивает быстрое обучение моделей на доступном оборудовании. Экосистема изначально поддерживает несколько задач компьютерного зрения из единой кодовой базы, включая классификацию изображений и обнаружение ориентированных ограничивающих рамок (OBB), предлагая гибкость, которой RTDETRv2 пока не обладает.

Бесшовное развёртывание#

Переход от исследований к производственной эксплуатации требует надежных вариантов развертывания. API Ultralytics изначально поддерживает экспорт моделей одним нажатием в отраслевые стандартные форматы. Независимо от того, используешь ли ты ONNX для кроссплатформенной совместимости или TensorRT для максимального ускорения на GPU, конвейер полностью автоматизирован и надежен.

Главное обновление: Ultralytics YOLO26#

Для разработчиков, выбирающих между YOLOv7 и RTDETRv2, оптимальным путем вперед на самом деле является новый стандарт ИИ для компьютерного зрения: Ultralytics YOLO26. Выпущенная в январе 2026 года, YOLO26 объединяет скорость CNN и продвинутую способность трансформеров к анализу, полностью устраняя их соответствующие недостатки.

YOLO26 предлагает революционные инновации, адаптированные как для серверного, так и для периферийного развертывания:

  • Сквозная архитектура без NMS: впервые представленная в YOLOv10, YOLO26 изначально устраняет постобработку NMS. Это обеспечивает детерминированную задержку RTDETRv2 без существенных вычислительных накладных расходов трансформера.
  • Оптимизатор MuSGD: вдохновленный методами обучения больших языковых моделей, такими как Kimi K2 от Moonshot AI, YOLO26 использует комбинацию SGD и Muon. Это обеспечивает беспрецедентную стабильность обучения и значительно более быструю сходимость по сравнению со стандартными реализациями AdamW, применяемыми в ViTs.
  • ProgLoss + STAL: эти продвинутые функции потерь заметно улучшают распознавание небольших объектов, напрямую конкурируя с преимуществами RTDETRv2 в обработке многоуровневых признаков, что особенно важно для роботизированной автоматизации.
  • Оптимизация для периферийных устройств и удаление DFL: удаление распределенной фокальной функции потерь (DFL) упрощает выходную головку, обеспечивая до 43% более быстрый вывод на CPU и делая модель значительно более пригодной для развертывания на периферийных устройствах, чем тяжелые модели на базе трансформеров.

Пример обучения с Ultralytics#

Простота Python API Ultralytics позволяет обучить современную модель YOLO26 всего несколькими строками кода:

from ultralytics import YOLO

# Load the highly efficient YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
# The framework automatically manages data augmentation and hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Effortlessly export to TensorRT for deployment
model.export(format="engine", dynamic=True)

Идеальные сценарии использования#

Выбор подходящей архитектуры во многом зависит от ограничений развертывания и доступности оборудования:

Когда стоит рассмотреть YOLOv7:

  • Устаревшие исследовательские проекты, в которых YOLOv7 является устоявшейся базовой моделью.
  • Среды с обильными ресурсами для ускорения на GPU, где приемлема нестабильность задержки NMS.

Когда стоит выбрать RTDETRv2:

  • Высокопроизводительные серверные развертывания, требующие максимально возможного значения mAP.
  • Сценарии, в которых строго необходимо детерминированное время вывода (без NMS), при условии наличия достаточного объема VRAM для поддержки трансформерного backbone.

Когда стоит выбрать Ultralytics YOLO26:

  • Почти всегда. Она обеспечивает детерминированность RTDETRv2 без NMS, превосходит YOLOv7 по скорости и точности, использует значительно меньше VRAM и полностью интегрирована в Ultralytics Platform, обеспечивая удобное управление датасетами, обучение и развертывание.
Изучить другие модели

Интересно, как показывают себя другие архитектуры? Изучи наши подробные обзоры предыдущих поколений, таких как YOLO11 и YOLOv8, или узнай, как использовать настройку гиперпараметров, чтобы максимизировать точность своего проекта.

Комментарии