RTDETRv2 против YOLOv7#
Сфера computer vision значительно расширилась за последние несколько лет благодаря постоянным инновациям как в сверточных нейронных сетях (CNN), так и в трансформерах зрения (ViT). Выбор правильной архитектуры для развертывания требует понимания тонких компромиссов между скоростью, точностью и вычислительными затратами. В этом руководстве рассматриваются технические различия между двумя высоко ценимыми архитектурами: RTDETRv2 и YOLOv7, а также освещаются современные достижения, доступные в новейшей модели Ultralytics YOLO26.
RTDETRv2: Трансформерный подход к детекции в реальном времени#
RTDETRv2 (Real-Time Detection Transformer version 2) опирается на фундамент своего предшественника, доказывая, что архитектуры на основе трансформеров могут эффективно конкурировать в сценариях реального времени без использования традиционных этапов постобработки.
Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
Организация: Baidu
Дата: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: Репозиторий RTDETRv2
Архитектурные особенности#
RTDETRv2 использует гибридный энкодер и архитектуру decoder трансформера. Задействуя механизмы self-attention, модель обрабатывает всё изображение в целом, что позволяет ей лучше понимать сложные пространственные взаимосвязи по сравнению со строго локализованными свёрточными ядрами. Одной из её самых характерных особенностей является изначально свободная от NMS архитектура. Устраняя Non-Maximum Suppression (NMS), RTDETRv2 убирает распространённое узкое место, создающее переменную задержку инференса во время деплоя.
Преимущества и ограничения#
Основная сила RTDETRv2 заключается в способности работать с плотными, перекрывающимися объектами в сложных сценах. Глобальный контекст, обеспечиваемый слоями внимания трансформера, делает её высокоточной, особенно в сценариях, где часты перекрытия.
Однако за это приходится платить вычислительными затратами. Модели на базе Transformer традиционно требуют большего объёма памяти при обучении и инференсе по сравнению со сверточными нейросетями (CNN). Кроме того, RTDETRv2 обычно требует больше эпох для сходимости при распределенном обучении, что ведет к более долгим циклам итераций для разработчиков, настраивающих кастомные датасеты.
YOLOv7: Базовая CNN для скорости#
Выпущенная за год до RTDETRv2, YOLOv7 представила несколько структурных оптимизаций для классического фреймворка YOLO, установив высокий стандарт для детекторов реального времени на основе CNN на момент своей публикации.
Авторы: Chien-Yao Wang, Alexey Bochkovskiy и Hong-Yuan Mark Liao
Организация: Institute of Information Science, Academia Sinica, Taiwan
Дата: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: Репозиторий YOLOv7
Архитектурные особенности#
Архитектура YOLOv7 построена вокруг концепции Extended Efficient Layer Aggregation Network (E-ELAN). Этот подход оптимизирует градиентный путь, позволяя модели обучаться эффективнее без существенного роста вычислительной сложности. Авторы также внедрили «trainable bag-of-freebies» — набор методов, улучшающих точность модели в процессе обучения без влияния на скорость инференса на периферийных устройствах.
Преимущества и ограничения#
YOLOv7 остается высокоэффективной моделью для стандартных задач object detection, предлагая отличную скорость обработки на потребительских GPU. Её природа CNN означает, что она обычно требует меньше CUDA-памяти во время обучения по сравнению с трансформерными моделями, такими как RTDETRv2.
Несмотря на эти преимущества, YOLOv7 все еще полагается на NMS для постобработки. В средах с высокой плотностью предсказаний этап NMS может вызывать колебания времени обработки, что затрудняет соблюдение строгих гарантий реального времени. Кроме того, по сравнению с современными фреймворками, процесс обработки разнообразных задач, таких как instance segmentation и pose estimation, может быть фрагментированным.
Сравнение производительности#
Оценка этих моделей требует рассмотрения тонкого баланса между средним значением средней точности (mAP), количеством параметров и скоростью инференса.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Хотя RTDETRv2-x достигает наивысшего mAP, она также обладает наибольшим количеством параметров и FLOPs. Меньшие варианты, такие как RTDETRv2-s, предлагают конкурентоспособную скорость на TensorRT, но пользователям, работающим в средах с низким энергопотреблением без выделенных GPU, необходимо тщательно оценивать возможности инференса на CPU.
Современное решение: знакомься, YOLO26#
Хотя RTDETRv2 и YOLOv7 сыграли ключевую роль в расширении границ computer vision applications, ландшафт ИИ стремительно меняется. Выпущенная в январе 2026 года, YOLO26 синтезирует лучшие аспекты как эффективности CNN, так и архитектур трансформерного типа без NMS.
Для разработчиков и исследователей, создающих новые системы, интегрированная Ultralytics Platform и экосистема Python обеспечивают единый опыт, который значительно сокращает технический долг.
Ключевые инновации в YOLO26#
- End-to-End дизайн без NMS: YOLO26 является natively end-to-end, устраняя необходимость в постобработке NMS для более быстрого и простого развертывания. Этот революционный подход был впервые внедрен в YOLOv10, обеспечивая стабильную задержку независимо от плотности объектов.
- Инференс на CPU быстрее до 43%: Специально оптимизировано для периферийных вычислений и устройств без GPU, что делает решение гораздо более универсальным для развертывания "в поле", чем тяжелые модели на базе трансформеров.
- Оптимизатор MuSGD: Гибрид SGD и Muon (вдохновленный Kimi K2 от Moonshot AI), привносящий инновации в обучении LLM в компьютерное зрение для более стабильного обучения и быстрой сходимости.
- Удаление DFL: Distribution Focal Loss была удалена, что привело к упрощению вычислительного графа для более плавного экспорта в встроенные NPU и среды TensorRT.
- ProgLoss + STAL: Улучшенные функции потерь дают заметные улучшения в распознавании мелких объектов, что критически важно для робототехники, Интернета вещей (IoT) и анализа аэрофотоснимков.
- Улучшения для конкретных задач: YOLO26 предназначена не только для детекции. Она оснащена мультимасштабными прототипами для сегментации, Residual Log-Likelihood Estimation (RLE) для отслеживания поз и специализированной функцией потерь по углу, решающей проблемы границ oriented bounding box (OBB).
Оптимизированный опыт разработчика#
Истинное преимущество выбора модели Ultralytics, такой как YOLO26 (или очень популярной YOLO11) — это хорошо поддерживаемая экосистема. Обучение на кастомном датасете требует минимального количества шаблонного кода:
from ultralytics import YOLO
# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)Идеальные варианты использования и приложения#
Выбор между этими архитектурами сильно зависит от целевого оборудования и конкретных операционных требований.
Когда стоит рассмотреть RTDETRv2#
RTDETRv2 крайне эффективна в средах server-side processing, оснащенных мощными GPU. Её механизм глобального внимания делает её подходящей для понимания сложных сцен, таких как мониторинг мест с высокой плотностью людей или специализированная медицинская визуализация, где перекрывающиеся признаки требуют глубокого контекстуального анализа.
Когда стоит рассмотреть YOLOv7#
YOLOv7 часто сохраняется в академических исследованиях как базовая модель для сравнения. Она также встречается в старых промышленных развертываниях, где существующие пайплайны жестко запрограммированы под конкретные версии PyTorch и не требуют гибкости для решения нескольких задач, как новые фреймворки.
Почему YOLO26 — рекомендуемый стандарт#
Для современной инфраструктуры умного города, навигации дронов и высокоскоростного производства YOLO26 предлагает непревзойденный баланс. Меньшие требования к памяти делают настройку гиперпараметров и обучение доступными на потребительском «железе», в то время как ее инференс без NMS обеспечивает быстрое выполнение на ограниченных по ресурсам краевых устройствах, таких как Raspberry Pi или NVIDIA Jetson.
Интересуешься, как эти модели соотносятся с другими архитектурами? Ознакомься с нашими подробными руководствами по YOLO11 vs. RTDETR и YOLOv8 vs. YOLOv7, чтобы подобрать идеальный вариант для своего проекта в области ИИ зрения.