RTDETRv2 и YOLOv7#
За последние несколько лет область компьютерного зрения стремительно расширилась благодаря постоянным инновациям в области сверточных нейронных сетей (CNNs) и трансформеров зрения (ViTs). Чтобы выбрать подходящую архитектуру для своего развертывания, необходимо понимать тонкие компромиссы между скоростью, точностью и вычислительными затратами. В этом руководстве рассматриваются технические различия между двумя высоко評価енными архитектурами — RTDETRv2 и YOLOv7, а также современные возможности, доступные в более новой модели Ultralytics YOLO26.
RTDETRv2: трансформерный подход к обнаружению объектов в реальном времени#
RTDETRv2 (трансформер обнаружения объектов в реальном времени, версия 2) развивает основу своего предшественника и доказывает, что архитектуры на базе трансформеров могут эффективно работать в сценариях реального времени без традиционных этапов постобработки.
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: Репозиторий RTDETRv2
Архитектурные особенности#
RTDETRv2 использует гибридную архитектуру с энкодером и декодером-трансформером. Благодаря механизмам self-attention модель целостно обрабатывает всё изображение, что позволяет ей лучше понимать сложные пространственные взаимосвязи, чем строго локализованным сверточным ядрам. Одна из её ключевых особенностей — нативная архитектура без NMS. Отказ от подавления немаксимумов (NMS) устраняет распространенное узкое место, вызывающее переменную задержку инференса при развертывании.
Преимущества и ограничения#
Главное преимущество RTDETRv2 — способность работать с плотными перекрывающимися объектами в сложных сценах. Глобальный контекст, обеспечиваемый слоями внимания трансформера, делает модель очень точной, особенно в сценариях с частыми перекрытиями объектов.
Однако это требует дополнительных вычислительных ресурсов. По сравнению с CNN модели-трансформеры обычно требуют больше памяти во время обучения и инференса. Кроме того, RTDETRv2, как правило, требует больше эпох для сходимости при распределенном обучении, что приводит к более длительным циклам итераций для разработчиков, настраивающих пользовательские датасеты.
YOLOv7: базовая CNN-модель для высокой скорости#
Выпущенная за год до RTDETRv2, YOLOv7 представила несколько структурных оптимизаций классического фреймворка YOLO и на момент публикации установила высокую планку для детекторов реального времени на базе CNN.
- Авторы: Chien-Yao Wang, Alexey Bochkovskiy и Hong-Yuan Mark Liao
- Организация: Институт информационных наук, Academia Sinica, Тайвань
- Дата: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: Репозиторий YOLOv7
Архитектурные особенности#
Архитектура YOLOv7 построена вокруг концепции сети расширенной эффективной агрегации слоёв (E-ELAN). Этот подход оптимизирует путь распространения градиента, позволяя модели эффективнее обучаться без существенного увеличения вычислительной сложности. Авторы также представили «обучаемый набор бесплатных улучшений» — набор методов, повышающих точность модели во время обучения без влияния на скорость инференса на периферийных устройствах.
Преимущества и ограничения#
YOLOv7 остается высокоэффективной моделью для стандартных задач обнаружения объектов, обеспечивая отличную скорость обработки на пользовательских GPU. Благодаря природе CNN модель обычно требует меньше памяти CUDA во время обучения по сравнению с моделями на базе трансформеров, такими как RTDETRv2.
Несмотря на эти преимущества, YOLOv7 по-прежнему использует NMS для постобработки. В средах с высокой плотностью прогнозов этап NMS может вызывать колебания времени обработки, что затрудняет обеспечение строгих гарантий работы в реальном времени. Кроме того, по сравнению с современными фреймворками обработка различных задач, таких как сегментация экземпляров и оценка позы, может быть фрагментированной.
Сравнение производительности#
Для оценки этих моделей необходимо учитывать тонкий баланс между средней точностью (mAP), количеством параметров и скоростью инференса.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
RTDETRv2-x достигает наивысшего значения mAP, но также имеет наибольшее количество параметров и FLOPs. Меньшие варианты, такие как RTDETRv2-s, обеспечивают конкурентоспособную скорость на TensorRT, однако пользователям, ориентированным на среды с низким энергопотреблением и без выделенных GPU, необходимо тщательно оценивать возможности инференса на CPU.
Современное решение: встречайте YOLO26#
Хотя RTDETRv2 и YOLOv7 сыграли важную роль в расширении возможностей приложений компьютерного зрения, ландшафт ИИ быстро меняется. Выпущенная в январе 2026 года модель YOLO26 объединяет лучшие черты эффективности CNN и архитектур без NMS, подобных трансформерам.
Для разработчиков и исследователей, создающих новые системы, интегрированные платформа Ultralytics и экосистема Python обеспечивают единый опыт, значительно сокращая технический долг.
Ключевые инновации YOLO26#
- Сквозная архитектура без NMS: YOLO26 изначально работает по принципу end-to-end, устраняя постобработку NMS для более быстрого и простого развертывания. Этот прорывной подход впервые был представлен в YOLOv10, обеспечивая стабильную задержку независимо от плотности объектов.
- До 43% более быстрый инференс на CPU: модель специально оптимизирована для периферийных вычислений и устройств без GPU, что делает её гораздо более универсальной для эксплуатации в полевых условиях, чем тяжелые модели-трансформеры.
- Оптимизатор MuSGD: гибрид SGD и Muon (вдохновлен Kimi K2 от Moonshot AI), переносящий инновации в обучении LLM в область компьютерного зрения для более стабильного обучения и быстрой сходимости.
- Удаление DFL: Distribution Focal Loss удалена, что приводит к упрощению вычислительного графа и облегчает экспорт на встроенные NPU и в среды TensorRT.
- ProgLoss + STAL: улучшенные функции потерь заметно повышают качество распознавания небольших объектов, что особенно важно для робототехники, IoT и анализа аэрофотоснимков.
- Улучшения для конкретных задач: YOLO26 предназначена не только для обнаружения объектов. Она использует многомасштабные прототипы для сегментации, Residual Log-Likelihood Estimation (RLE) для отслеживания позы и специализированную функцию потерь угла для решения проблем границ ориентированного ограничивающего прямоугольника (OBB).
Оптимизированный опыт разработчика#
Главное преимущество выбора модели Ultralytics, такой как YOLO26 (или очень популярной YOLO11), — хорошо поддерживаемая экосистема. Для обучения на пользовательском датасете требуется минимум шаблонного кода:
from ultralytics import YOLO
# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)Оптимальные сценарии и области применения#
Выбор между этими архитектурами в значительной степени зависит от целевого оборудования и конкретных эксплуатационных требований.
Когда стоит выбрать RTDETRv2#
RTDETRv2 особенно эффективна в средах с обработкой на сервере, оснащенных мощными GPU. Механизм глобального внимания делает её подходящей для понимания сложных сцен, например при мониторинге многолюдных мероприятий или в специализированной медицинской визуализации, где перекрывающиеся признаки требуют глубокого контекстного анализа.
Когда стоит рассмотреть YOLOv7#
YOLOv7 часто используется в академических исследованиях как базовая модель для сравнения. Её также можно встретить в старых промышленных развертываниях, где существующие конвейеры жестко привязаны к определенным версиям PyTorch и не требуют многозадачной гибкости современных фреймворков.
Почему YOLO26 — рекомендуемый стандарт#
Для современной инфраструктуры умных городов, навигации дронов и высокоскоростного производства YOLO26 обеспечивает непревзойденный баланс. Более низкие требования к памяти делают настройку гиперпараметров и обучение доступными на пользовательском оборудовании, а инференс без NMS обеспечивает быстрое выполнение на периферийных устройствах с ограниченными ресурсами, таких как Raspberry Pi или NVIDIA Jetson.
Интересуешься, как эти модели соотносятся с другими архитектурами? Ознакомься с нашими подробными руководствами по YOLO11 vs. RT-DETR и YOLOv8 vs. YOLOv7, чтобы подобрать идеальный вариант для своего проекта компьютерного зрения.