Ultralytics YOLO27:
Get Started

YOLO26 и RTDETRv2#

Компьютерное зрение постоянно развивается, и перед специалистами стоит важный выбор: использовать высокооптимизированные свёрточные нейронные сети (CNN) или перейти на более новые архитектуры на основе Transformer? Среди заметных участников этой области — передовая модель Ultralytics YOLO26 и разработанная Baidu RTDETRv2. Обе модели расширяют границы обнаружения объектов в реальном времени, но опираются на принципиально разные архитектурные подходы.

В этом руководстве подробно рассматриваются обе модели: их структура, метрики производительности и подходящие сценарии применения. Это поможет тебе выбрать оптимальную основу для следующего проекта в области компьютерного зрения.

Ultralytics YOLO26: вершина периферийного ИИ для компьютерного зрения#

Разработанная Ultralytics, YOLO26 представляет собой масштабный скачок нового поколения для семейства YOLO. Выпущенная в январе 2026 года, она специально создана для скорости, точности и беспроблемного развертывания в облаке и на периферийных устройствах.

Архитектурные инновации и преимущества#

В YOLO26 реализовано несколько революционных функций, которые отличают её не только от моделей Transformer, но и от предыдущих версий, таких как YOLO11:

  • Сквозная архитектура без NMS: Опциональная голова YOLO26 «один к одному» (nms=False) устраняет традиционное подавление немаксимумов (NMS) при постобработке. Этот подход сквозной архитектуры впервые появился в таких моделях, как YOLOv10, и сокращает разброс задержки инференса, упрощая логику развертывания, особенно на периферийном оборудовании.
  • Инференс на CPU до 43% быстрее: Учитывая растущую потребность в децентрализованном ИИ, YOLO26 отлично оптимизирована для устройств без выделенных GPU, таких как Raspberry Pi.
  • Удаление DFL: Удаление Distribution Focal Loss (DFL) упрощает экспорт YOLO26 и значительно повышает её совместимость с периферийными устройствами и микроконтроллерами с низким энергопотреблением.
  • Оптимизатор MuSGD: YOLO26 сокращает разрыв между обучением больших языковых моделей (LLM) и компьютерным зрением, используя оптимизатор MuSGD. Эта комбинация SGD и Muon, вдохновлённая Kimi K2 от Moonshot AI, обеспечивает стабильное обучение и ускоряет сходимость.
  • ProgLoss + STAL: Передовые функции потерь заметно улучшают распознавание мелких объектов. Это особенно важно для отраслей, использующих анализ аэрофотоснимков и датчики Интернета вещей (IoT).

Универсальность для задач компьютерного зрения#

В отличие от моделей, ограниченных только ограничивающими рамками, YOLO26 — универсальный мощный инструмент. В ней реализованы улучшения для конкретных задач: функция потерь семантической сегментации и протомодули с несколькими масштабами для сегментации экземпляров, оценка остаточного логарифмического правдоподобия (RLE) для оценки позы и специализированная функция потерь угла, устраняющая проблемы на границах в задачах с ориентированными ограничивающими рамками (OBB).

Стратегия развертывания на периферийных устройствах

При развертывании на периферийных устройствах используй варианты YOLO26n (Nano) или YOLO26s (Small). Благодаря удалению DFL и опциональной голове без NMS эти модели легко экспортировать в CoreML или LiteRT, обеспечивая плавную работу в реальном времени на iOS и Android.

RTDETRv2: усовершенствование трансформеров для обнаружения объектов в реальном времени#

RTDETRv2, разработанная исследователями Baidu, основана на исходной архитектуре RT-DETR. Её цель — показать, что трансформеры для обнаружения объектов (DETR) могут конкурировать с высокооптимизированными CNN по скорости и точности в сценариях реального времени, а иногда и превосходить их.

Архитектура и возможности#

RTDETRv2 использует архитектуру на основе Transformer, которая обрабатывает изображения принципиально иначе, чем CNN, применяя механизмы self-attention для понимания глобального контекста.

  • Bag-of-Freebies: В версии v2 представлен ряд оптимизированных методов обучения (bag-of-freebies), повышающих исходную производительность без увеличения затрат на инференс.
  • Понимание глобального контекста: Благодаря слоям внимания Transformer модель RTDETRv2 хорошо справляется со сложными сценами, где для различения перекрывающихся или частично скрытых объектов необходим глобальный контекст.

Узнай больше о RTDETRv2

Ограничения моделей Transformer#

Несмотря на высокую производительность, модели обнаружения на основе Transformer, такие как RTDETRv2, часто сталкиваются с трудностями при практическом развертывании. При обучении им обычно требуется больше памяти CUDA, чем эффективным CNN. Кроме того, интеграция таких моделей в разнообразные периферийные среды может быть сложной из-за операций, необходимых для слоёв внимания. Поэтому YOLO26 гораздо привлекательнее для развертывания в условиях ограниченных ресурсов.

Сравнение производительности#

Прямое сравнение этих моделей показывает ощутимые преимущества последних оптимизаций CNN. В таблице ниже приведены результаты на стандартных бенчмарках.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Как видно из результатов, YOLO26 стабильно превосходит RTDETRv2 во всех вариантах размера. YOLO26x достигает впечатляющего показателя mAP 57.5 при меньшей задержке (11.8 мс на TensorRT) и значительно меньшем количестве параметров (55.7M), чем RTDETRv2-x (mAP 54.3, 15.03 мс, 76M параметров).

Сценарии использования и рекомендации#

Выбор между YOLO26 и RT-DETR зависит от требований конкретного проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда выбирать YOLO26#

YOLO26 — отличный выбор для таких задач:

  • Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
  • Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
  • Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.

Когда выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
  • Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.

Преимущества Ultralytics#

Выбрать правильную архитектуру машинного обучения — лишь часть задачи: окружающая экосистема определяет, насколько быстро команда сможет перейти от прототипа к производству.

Удобство использования и эффективность обучения#

Python API Ultralytics обеспечивает удивительно простой рабочий процесс. Для обучения сложных моделей больше не нужен громоздкий шаблонный код. Кроме того, YOLO26 значительно эффективнее обучается и использует гораздо меньше видеопамяти GPU, чем требовательные к памяти механизмы внимания RTDETRv2. Благодаря этому даже на потребительском оборудовании можно использовать больший размер пакета.

from ultralytics import YOLO

# Инициализация передовой модели YOLO26 Nano
model = YOLO("yolo26n.pt")

# Обучение на наборе данных COCO8 в течение 100 эпох
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Выполнение высокоскоростного инференса без NMS
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Экспорт в ONNX для беспроблемного развертывания
model.export(format="onnx")

Хорошо поддерживаемая экосистема#

Используя модели Ultralytics, разработчики получают доступ к активно поддерживаемому фреймворку с изначальной интеграцией с современными инструментами трекинга, такими как Weights & Biases и Comet ML. Если ты предпочитаешь обходиться без кода, платформа Ultralytics предоставляет инструменты для облачного обучения, управления наборами данных и развертывания в один клик.

Баланс производительности#

YOLO26 обеспечивает непревзойдённый баланс скорости инференса и точности. Возможность отключить NMS в сочетании с оптимизатором MuSGD позволяет развернуть модель, которая отличается высокой точностью при обнаружении мелких объектов благодаря ProgLoss + STAL и молниеносной работой в производственной среде. Поэтому она превосходит другие модели в большинстве современных задач компьютерного зрения.

Другие модели в экосистеме#

YOLO26 и RTDETRv2 представляют передовые решения для обнаружения объектов в реальном времени, но разработчикам, которые поддерживают устаревшие конвейеры или изучают другие варианты баланса эффективности, стоит рассмотреть YOLOv8 для уже сложившихся корпоративных сред или другие архитектуры, например EfficientDet. Однако для любого нового проекта мы однозначно рекомендуем YOLO26.

Комментарии