Ultralytics YOLO27:

RTDETRv2 и YOLOv7#

За последние несколько лет область компьютерного зрения стремительно расширилась благодаря постоянным инновациям в области сверточных нейронных сетей (CNNs) и трансформеров зрения (ViTs). Чтобы выбрать подходящую архитектуру для своего развертывания, необходимо понимать тонкие компромиссы между скоростью, точностью и вычислительными затратами. В этом руководстве рассматриваются технические различия между двумя высоко評価енными архитектурами — RTDETRv2 и YOLOv7, а также современные возможности, доступные в более новой модели Ultralytics YOLO26.

RTDETRv2: трансформерный подход к обнаружению объектов в реальном времени#

RTDETRv2 (трансформер обнаружения объектов в реальном времени, версия 2) развивает основу своего предшественника и доказывает, что архитектуры на базе трансформеров могут эффективно работать в сценариях реального времени без традиционных этапов постобработки.

Архитектурные особенности#

RTDETRv2 использует гибридную архитектуру с энкодером и декодером-трансформером. Благодаря механизмам self-attention модель целостно обрабатывает всё изображение, что позволяет ей лучше понимать сложные пространственные взаимосвязи, чем строго локализованным сверточным ядрам. Одна из её ключевых особенностей — нативная архитектура без NMS. Отказ от подавления немаксимумов (NMS) устраняет распространенное узкое место, вызывающее переменную задержку инференса при развертывании.

Преимущества и ограничения#

Главное преимущество RTDETRv2 — способность работать с плотными перекрывающимися объектами в сложных сценах. Глобальный контекст, обеспечиваемый слоями внимания трансформера, делает модель очень точной, особенно в сценариях с частыми перекрытиями объектов.

Однако это требует дополнительных вычислительных ресурсов. По сравнению с CNN модели-трансформеры обычно требуют больше памяти во время обучения и инференса. Кроме того, RTDETRv2, как правило, требует больше эпох для сходимости при распределенном обучении, что приводит к более длительным циклам итераций для разработчиков, настраивающих пользовательские датасеты.

Узнай больше о RTDETRv2

YOLOv7: базовая CNN-модель для высокой скорости#

Выпущенная за год до RTDETRv2, YOLOv7 представила несколько структурных оптимизаций классического фреймворка YOLO и на момент публикации установила высокую планку для детекторов реального времени на базе CNN.

Архитектурные особенности#

Архитектура YOLOv7 построена вокруг концепции сети расширенной эффективной агрегации слоёв (E-ELAN). Этот подход оптимизирует путь распространения градиента, позволяя модели эффективнее обучаться без существенного увеличения вычислительной сложности. Авторы также представили «обучаемый набор бесплатных улучшений» — набор методов, повышающих точность модели во время обучения без влияния на скорость инференса на периферийных устройствах.

Преимущества и ограничения#

YOLOv7 остается высокоэффективной моделью для стандартных задач обнаружения объектов, обеспечивая отличную скорость обработки на пользовательских GPU. Благодаря природе CNN модель обычно требует меньше памяти CUDA во время обучения по сравнению с моделями на базе трансформеров, такими как RTDETRv2.

Несмотря на эти преимущества, YOLOv7 по-прежнему использует NMS для постобработки. В средах с высокой плотностью прогнозов этап NMS может вызывать колебания времени обработки, что затрудняет обеспечение строгих гарантий работы в реальном времени. Кроме того, по сравнению с современными фреймворками обработка различных задач, таких как сегментация экземпляров и оценка позы, может быть фрагментированной.

Узнай больше о YOLOv7

Сравнение производительности#

Для оценки этих моделей необходимо учитывать тонкий баланс между средней точностью (mAP), количеством параметров и скоростью инференса.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Контекст производительности

RTDETRv2-x достигает наивысшего значения mAP, но также имеет наибольшее количество параметров и FLOPs. Меньшие варианты, такие как RTDETRv2-s, обеспечивают конкурентоспособную скорость на TensorRT, однако пользователям, ориентированным на среды с низким энергопотреблением и без выделенных GPU, необходимо тщательно оценивать возможности инференса на CPU.

Современное решение: встречайте YOLO26#

Хотя RTDETRv2 и YOLOv7 сыграли важную роль в расширении возможностей приложений компьютерного зрения, ландшафт ИИ быстро меняется. Выпущенная в январе 2026 года модель YOLO26 объединяет лучшие черты эффективности CNN и архитектур без NMS, подобных трансформерам.

Для разработчиков и исследователей, создающих новые системы, интегрированные платформа Ultralytics и экосистема Python обеспечивают единый опыт, значительно сокращая технический долг.

Ключевые инновации YOLO26#

  • Сквозная архитектура без NMS: YOLO26 изначально работает по принципу end-to-end, устраняя постобработку NMS для более быстрого и простого развертывания. Этот прорывной подход впервые был представлен в YOLOv10, обеспечивая стабильную задержку независимо от плотности объектов.
  • До 43% более быстрый инференс на CPU: модель специально оптимизирована для периферийных вычислений и устройств без GPU, что делает её гораздо более универсальной для эксплуатации в полевых условиях, чем тяжелые модели-трансформеры.
  • Оптимизатор MuSGD: гибрид SGD и Muon (вдохновлен Kimi K2 от Moonshot AI), переносящий инновации в обучении LLM в область компьютерного зрения для более стабильного обучения и быстрой сходимости.
  • Удаление DFL: Distribution Focal Loss удалена, что приводит к упрощению вычислительного графа и облегчает экспорт на встроенные NPU и в среды TensorRT.
  • ProgLoss + STAL: улучшенные функции потерь заметно повышают качество распознавания небольших объектов, что особенно важно для робототехники, IoT и анализа аэрофотоснимков.
  • Улучшения для конкретных задач: YOLO26 предназначена не только для обнаружения объектов. Она использует многомасштабные прототипы для сегментации, Residual Log-Likelihood Estimation (RLE) для отслеживания позы и специализированную функцию потерь угла для решения проблем границ ориентированного ограничивающего прямоугольника (OBB).

Оптимизированный опыт разработчика#

Главное преимущество выбора модели Ultralytics, такой как YOLO26 (или очень популярной YOLO11), — хорошо поддерживаемая экосистема. Для обучения на пользовательском датасете требуется минимум шаблонного кода:

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)

Оптимальные сценарии и области применения#

Выбор между этими архитектурами в значительной степени зависит от целевого оборудования и конкретных эксплуатационных требований.

Когда стоит выбрать RTDETRv2#

RTDETRv2 особенно эффективна в средах с обработкой на сервере, оснащенных мощными GPU. Механизм глобального внимания делает её подходящей для понимания сложных сцен, например при мониторинге многолюдных мероприятий или в специализированной медицинской визуализации, где перекрывающиеся признаки требуют глубокого контекстного анализа.

Когда стоит рассмотреть YOLOv7#

YOLOv7 часто используется в академических исследованиях как базовая модель для сравнения. Её также можно встретить в старых промышленных развертываниях, где существующие конвейеры жестко привязаны к определенным версиям PyTorch и не требуют многозадачной гибкости современных фреймворков.

Почему YOLO26 — рекомендуемый стандарт#

Для современной инфраструктуры умных городов, навигации дронов и высокоскоростного производства YOLO26 обеспечивает непревзойденный баланс. Более низкие требования к памяти делают настройку гиперпараметров и обучение доступными на пользовательском оборудовании, а инференс без NMS обеспечивает быстрое выполнение на периферийных устройствах с ограниченными ресурсами, таких как Raspberry Pi или NVIDIA Jetson.

Другие сравнения

Интересуешься, как эти модели соотносятся с другими архитектурами? Ознакомься с нашими подробными руководствами по YOLO11 vs. RT-DETR и YOLOv8 vs. YOLOv7, чтобы подобрать идеальный вариант для своего проекта компьютерного зрения.

Комментарии