Ultralytics YOLO27:
Get Started

RTDETRv2 и YOLOv7#

За последние несколько лет сфера компьютерного зрения значительно расширилась благодаря постоянным инновациям в свёрточных нейронных сетях (CNN) и vision Transformer (ViT). Чтобы выбрать подходящую для развёртывания архитектуру, нужно разобраться в тонком балансе скорости, точности и вычислительных затрат. В этом руководстве рассматриваются технические различия между двумя высоко оценёнными архитектурами — RTDETRv2 и YOLOv7, а также современные улучшения, доступные в более новой модели Ultralytics YOLO26.

RTDETRv2: подход Transformer к обнаружению объектов в реальном времени#

RTDETRv2 развивает идеи предшественника и доказывает, что архитектуры на основе Transformer способны эффективно работать в реальном времени без традиционных этапов постобработки.

Основные особенности архитектуры#

В RTDETRv2 используется гибридный кодировщик и архитектура декодировщика Transformer. Благодаря механизмам самовнимания модель обрабатывает изображение целиком и лучше распознаёт сложные пространственные взаимосвязи, чем строго локализованные свёрточные ядра. Одна из её ключевых особенностей — изначально безъякорная конструкция без NMS. Устраняя подавление немаксимумов (NMS), RTDETRv2 избавляется от распространённого узкого места, которое вызывает колебания задержки инференса при развёртывании.

Сильные стороны и ограничения#

Главное достоинство RTDETRv2 — способность обрабатывать плотные скопления перекрывающихся объектов в сложных сценах. Глобальный контекст, который обеспечивают слои внимания Transformer, позволяет модели добиваться высокой точности, особенно в ситуациях с частым перекрытием объектов.

Однако за это приходится платить вычислительными ресурсами. По сравнению с CNN моделям Transformer обычно требуется больше памяти для обучения и инференса. Кроме того, RTDETRv2, как правило, нужно больше эпох для схождения при распределённом обучении, поэтому циклы итераций при настройке собственных наборов данных становятся дольше.

Узнай больше о RTDETRv2

YOLOv7: базовая CNN-модель для высокой скорости#

Выпущенная за два года до RTDETRv2, YOLOv7 внесла несколько структурных улучшений в классическую архитектуру YOLO и на момент публикации задала высокую планку для детекторов на основе CNN, работающих в реальном времени.

Основные особенности архитектуры#

Архитектура YOLOv7 построена на концепции расширенной эффективной сети агрегации слоёв (E-ELAN). Этот подход оптимизирует путь градиента, помогая модели эффективнее обучаться без существенного увеличения вычислительной сложности. Авторы также представили «обучаемый набор бесплатных улучшений» — методы, повышающие точность модели во время обучения без снижения скорости инференса на периферийных устройствах.

Сильные стороны и ограничения#

YOLOv7 по-прежнему хорошо справляется со стандартными задачами обнаружения объектов, обеспечивая высокую скорость обработки на потребительских GPU. Благодаря архитектуре CNN для обучения модели обычно требуется меньше памяти CUDA, чем моделям на основе Transformer, например RTDETRv2.

Несмотря на эти преимущества, YOLOv7 по-прежнему использует NMS для постобработки. В условиях высокой плотности предсказаний этап NMS может вызывать колебания времени обработки, затрудняя строгую гарантию работы в реальном времени. Кроме того, по сравнению с современными платформами поддержка различных задач, таких как сегментация экземпляров и оценка позы, может быть разрозненной.

Узнай больше о YOLOv7

Сравнение производительности#

Чтобы оценить эти модели, нужно учитывать тонкий баланс между средней точностью (mAP), количеством параметров и скоростью инференса.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Анализ производительности

RTDETRv2-x достигает наивысшего mAP, но у неё также больше всего параметров и FLOPs. Меньшие варианты, например RTDETRv2-s, обеспечивают конкурентную скорость на TensorRT, однако пользователям, которым нужны маломощные среды без выделенных GPU, следует тщательно проверить возможности инференса на CPU.

Современное решение: встречай YOLO26#

RTDETRv2 и YOLOv7 сыграли важную роль в развитии приложений компьютерного зрения, но сфера ИИ быстро меняется. Выпущенная в январе 2026 года YOLO26 объединяет лучшие стороны эффективности CNN и архитектур, подобных Transformer, которые не используют NMS.

Разработчикам и исследователям, создающим новые системы, интегрированная платформа Ultralytics и экосистема Python предоставляют единую среду и значительно сокращают объём технического долга.

Основные нововведения YOLO26#

  • Сквозная архитектура без NMS: YOLO26 изначально работает сквозным образом и пропускает постобработку NMS благодаря опциональной голове один-к-одному (nms=False), что упрощает развёртывание и ускоряет его. Этот прорыв впервые воплотили в YOLOv10, обеспечив стабильную задержку независимо от плотности объектов.
  • Инференс на CPU до 43% быстрее: модель специально оптимизирована для периферийных вычислений и устройств без GPU, что делает её гораздо более универсальной при развёртывании в полевых условиях, чем ресурсоёмкие модели Transformer.
  • Оптимизатор MuSGD: гибрид SGD и Muon, вдохновлённый Kimi K2 от Moonshot AI, переносит достижения в обучении LLM в компьютерное зрение, обеспечивая более стабильное обучение и быстрое схождение.
  • Удаление DFL: Distribution Focal Loss удалена, что упрощает вычислительный граф и обеспечивает более удобный экспорт во встроенные NPU и среды TensorRT.
  • ProgLoss + STAL: улучшенные функции потерь заметно повышают качество распознавания мелких объектов, что особенно важно для робототехники, IoT и анализа аэрофотоснимков.
  • Улучшения для отдельных задач: YOLO26 предназначена не только для обнаружения объектов. В ней предусмотрены многомасштабные прототипы для сегментации, оценка остаточного логарифмического правдоподобия (RLE) для оценки позы и специализированная функция потерь угла, устраняющая проблемы границ ориентированных ограничивающих рамок (OBB).

Упрощённая работа разработчика#

Главное преимущество выбора модели Ultralytics, например YOLO26 (или популярной YOLO11), — хорошо поддерживаемая экосистема. Для обучения на собственном наборе данных требуется минимум шаблонного кода:

from ultralytics import YOLO

# Инициализируй современную модель YOLO26
model = YOLO("yolo26s.pt")

# Обучи модель на датасете COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Простой экспорт для развертывания на периферийных устройствах
model.export(format="onnx", dynamic=True)

Оптимальные сценарии применения#

Выбор между этими архитектурами во многом зависит от целевого оборудования и конкретных эксплуатационных требований.

Когда стоит выбрать RTDETRv2#

RTDETRv2 отлично подходит для сред с мощными GPU, где используется обработка на сервере. Благодаря механизму глобального внимания модель подходит для анализа сложных сцен, например мониторинга мероприятий с большим скоплением людей или специализированной медицинской визуализации, где перекрывающиеся признаки требуют глубокого контекстного анализа.

Когда стоит выбрать YOLOv7#

YOLOv7 часто используют в устаревших академических исследованиях как базовую модель для сравнения. Её также можно встретить в старых промышленных системах, где существующие конвейеры жёстко привязаны к определённым версиям PyTorch и не требуют поддержки нескольких задач, доступной в новых платформах.

Для современной инфраструктуры умных городов, навигации дронов и высокоскоростного производства YOLO26 предлагает непревзойдённый баланс. Благодаря низкому потреблению памяти настройка гиперпараметров и обучение доступны на потребительском оборудовании, а инференс без NMS обеспечивает быструю работу на периферийных устройствах с ограниченными ресурсами, например Raspberry Pi или NVIDIA Jetson.

Другие сравнения

Хочешь узнать, как эти модели выглядят на фоне других архитектур? Изучи наши подробные руководства по моделям YOLO11 и RT-DETR и YOLOv8 и YOLOv7, чтобы подобрать оптимальный вариант для проекта в области компьютерного зрения.

Комментарии