RTDETRv2 против YOLOv7#
Сфера computer vision значительно расширилась за последние несколько лет благодаря постоянным инновациям как в сверточных нейронных сетях (CNN), так и в визуальных трансформерах (ViT). Выбор правильной архитектуры для развертывания требует понимания тонких компромиссов между скоростью, точностью и вычислительными затратами. В этом руководстве рассматриваются технические различия между двумя высоко оцененными архитектурами: RTDETRv2 и YOLOv7, а также подчеркиваются современные достижения, доступные в более новом решении Ultralytics YOLO26.
RTDETRv2: Трансформерный подход к детекции в реальном времени#
RTDETRv2 (Real-Time Detection Transformer version 2) опирается на фундамент своего предшественника, доказывая, что архитектуры на основе трансформеров могут эффективно конкурировать в сценариях реального времени без использования традиционных этапов постобработки.
Авторы: Вэньюй Люй, Иянь Чжао, Циняо Ччан, Куй Хуан, Гуаньчжун Ван и И Лю
Организация: Baidu
Дата: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: Репозиторий RTDETRv2
Архитектурные особенности#
RTDETRv2 использует гибридный энкодер и архитектуру transformer decoder. Используя механизмы самовнимания, модель обрабатывает все изображение целиком, что позволяет ей лучше понимать сложные пространственные связи по сравнению со строго локализованными сверточными ядрами. Одной из ее наиболее характерных особенностей является нативная конструкция без NMS. Исключая подавление не максимальных значений (NMS), RTDETRv2 устраняет распространенное узкое место, которое создает переменную inference latency во время развертывания.
Преимущества и ограничения#
Основная сила RTDETRv2 заключается в способности работать с плотными, перекрывающимися объектами в сложных сценах. Глобальный контекст, обеспечиваемый слоями внимания трансформера, делает её высокоточной, особенно в сценариях, где часты перекрытия.
Однако это влечет за собой вычислительные затраты. Модели-трансформеры традиционно требуют больше памяти при обучении и инференсе по сравнению с CNN. Кроме того, RTDETRv2 обычно требует больше эпох для сходимости во время distributed training, что приводит к более длительным циклам итераций для разработчиков, настраивающих пользовательские датасеты.
YOLOv7: Базовая CNN для скорости#
Выпущенная за год до RTDETRv2, YOLOv7 представила несколько структурных оптимизаций для классического фреймворка YOLO, установив высокий стандарт для детекторов реального времени на основе CNN на момент своей публикации.
Авторы: Цзянь-Яо Ван, Алексей Бочковский и Хонг-Юань Марк Ляо
Организация: Институт информационных наук, Academia Sinica, Тайвань
Дата: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: Репозиторий YOLOv7
Архитектурные особенности#
Архитектура YOLOv7 построена на концепции расширенной эффективной сети агрегации слоев (E-ELAN). Этот подход оптимизирует путь градиентов, позволяя модели обучаться более эффективно без значительного увеличения вычислительной сложности. Авторы также представили «обучаемый набор бесплатных улучшений» (trainable bag-of-freebies) — набор методов, которые улучшают model accuracy во время обучения, не влияя на скорость инференса на периферийных устройствах.
Преимущества и ограничения#
YOLOv7 остается очень мощной моделью для стандартных задач object detection, обеспечивая отличную скорость обработки на потребительских GPU. Ее природа CNN означает, что она обычно требует меньше памяти CUDA во время обучения по сравнению с моделями на основе трансформеров, такими как RTDETRv2.
Несмотря на эти преимущества, YOLOv7 по-прежнему полагается на NMS для постобработки. В средах с высокой плотностью предсказаний шаг NMS может вызывать колебания времени обработки, что затрудняет соблюдение строгих гарантий реального времени. Кроме того, по сравнению с современными фреймворками, процесс обработки разнообразных задач, таких как instance segmentation и pose estimation, может быть фрагментирован.
Сравнение производительности#
Оценка этих моделей требует рассмотрения тонкого баланса между средней точностью в ракурсе среднего значения (mAP), количеством параметров и скоростью инференса.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Хотя RTDETRv2-x достигает наивысшего mAP, она также обладает наибольшим количеством параметров и FLOPs. Меньшие варианты, такие как RTDETRv2-s, предлагают конкурентоспособную скорость на TensorRT, но пользователям, работающим в средах с низким энергопотреблением без выделенных GPU, необходимо тщательно оценивать возможности инференса на CPU.
Современное решение: знакомься, YOLO26#
Хотя RTDETRv2 и YOLOv7 сыграли ключевую роль в расширении границ computer vision applications, ландшафт ИИ развивается быстро. Выпущенная в январе 2026 года модель YOLO26 объединяет лучшие аспекты эффективности CNN и архитектур трансформерного типа без NMS.
Для разработчиков и исследователей, создающих новые системы, интегрированная Ultralytics Platform и экосистема Python предоставляют унифицированный интерфейс, который значительно снижает технический долг.
Ключевые инновации в YOLO26#
- Сквозной дизайн без NMS: YOLO26 является нативно сквозным, исключая постобработку NMS для более быстрого и простого развертывания. Этот прорывной подход был впервые применен в YOLOv10, обеспечивая стабильную задержку независимо от плотности объектов.
- Ускорение инференса на CPU до 43%: Специально оптимизировано для edge computing и устройств без GPU, что делает решение гораздо более универсальным для полевых развертываний по сравнению с тяжелыми моделями-трансформерами.
- Оптимизатор MuSGD: Гибрид SGD и Muon (вдохновленный Kimi K2 от Moonshot AI), привносящий инновации в обучении LLM в компьютерное зрение для более стабильного обучения и быстрой сходимости.
- Удаление DFL: Функция потерь Distribution Focal Loss была удалена, что привело к упрощению вычислительного графа для более плавной экспортной миграции на встроенные NPU и в окружения TensorRT.
- ProgLoss + STAL: Улучшенные функции потерь обеспечивают заметное повышение качества распознавания мелких объектов, что критически важно для robotics, интернета вещей (IoT) и анализа аэрофотоснимков.
- Улучшения для конкретных задач: YOLO26 предназначена не только для детекции. Она включает многомасштабные прототипы для сегментации, оценку остаточного логарифма правдоподобия (RLE) для трекинга поз и специализированную функцию потерь по углам, решающую проблемы границ oriented bounding box (OBB).
Оптимизированный опыт разработчика#
Истинное преимущество выбора модели Ultralytics, такой как YOLO26 (или очень популярной YOLO11), заключается в поддерживаемой экосистеме. Обучение пользовательского датасета требует минимального количества шаблонного кода:
from ultralytics import YOLO
# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)Идеальные варианты использования и приложения#
Выбор между этими архитектурами сильно зависит от целевого оборудования и конкретных операционных требований.
Когда стоит рассмотреть RTDETRv2#
RTDETRv2 крайне эффективна в средах server-side processing, оснащенных мощными графическими процессорами. Ее механизм глобального внимания делает модель подходящей для понимания сложных сцен, таких как мониторинг сильно заполненных мероприятий или специализированная медицинская визуализация, где пересекающиеся признаки требуют глубокого контекстного анализа.
Когда стоит рассмотреть YOLOv7#
YOLOv7 часто сохраняется в академических исследованиях как базовая модель для сравнения. Она также встречается в старых промышленных развертываниях, где существующие пайплайны жестко запрограммированы под конкретные версии PyTorch и не требуют гибкости для решения нескольких задач, как новые фреймворки.
Почему YOLO26 — рекомендуемый стандарт#
Для современной инфраструктуры smart city, drone navigation и высокоскоростного производства YOLO26 предлагает непревзойденный баланс. Меньшие требования к памяти делают hyperparameter tuning и обучение доступными на потребительском оборудовании, в то время как инференс без NMS обеспечивает быстрое выполнение на ограниченных периферийных устройствах вроде Raspberry Pi или NVIDIA Jetson.
Интересно, как эти модели соотносятся с другими архитектурами? Ознакомьтесь с нашими подробными руководствами по YOLO11 vs. RTDETR и YOLOv8 vs. YOLOv7, чтобы подобрать идеальный вариант для вашего проекта в области компьютерного зрения.