Ultralytics YOLO27:

YOLO26 и RTDETRv2#

Ландшафт компьютерного зрения постоянно меняется, ставя специалистов перед важным выбором: использовать высокооптимизированные сверточные нейронные сети (CNNs) или перейти к более новым архитектурам на основе Transformer? Два заметных претендента в этой области — передовой Ultralytics YOLO26 и RTDETRv2 от Baidu. Обе модели расширяют границы обнаружения объектов в реальном времени, но опираются на принципиально разные архитектурные подходы.

В этом руководстве подробно рассматриваются обе модели: сравниваются их структуры, показатели производительности и оптимальные сценарии использования, чтобы помочь тебе выбрать лучшую основу для следующего проекта в области компьютерного зрения.

Ultralytics YOLO26: вершина подхода Edge-First в ИИ для компьютерного зрения#

Разработанная компанией Ultralytics, YOLO26 представляет собой огромный скачок для семейства YOLO. Выпущенная в январе 2026 года, она специально оптимизирована для скорости, точности и бесшовного развертывания в облачных и периферийных средах.

Архитектурные инновации и преимущества#

YOLO26 представляет несколько революционных функций, которые отличают ее не только от моделей на основе Transformer, но и от более ранних версий, таких как YOLO11:

  • Сквозная архитектура без NMS: YOLO26 устраняет традиционное подавление немаксимумов (NMS) на этапе постобработки. Этот изначально сквозной подход, впервые примененный в таких моделях, как YOLOv10, уменьшает вариативность задержки инференса и упрощает логику развертывания, особенно на периферийном оборудовании.
  • До 43% более быстрый инференс на CPU: Учитывая растущую потребность в децентрализованном ИИ, YOLO26 хорошо оптимизирована для устройств без выделенных GPU, таких как Raspberry Pi.
  • Удаление DFL: За счет исключения Distribution Focal Loss (DFL) YOLO26 обеспечивает упрощенный процесс экспорта и значительно улучшенную совместимость с маломощными периферийными устройствами и микроконтроллерами.
  • Оптимизатор MuSGD: Объединяя обучение больших языковых моделей (LLM) и компьютерное зрение, YOLO26 использует оптимизатор MuSGD. Этот гибрид SGD и Muon, вдохновленный Kimi K2 от Moonshot AI, обеспечивает стабильное обучение и более быструю сходимость.
  • ProgLoss + STAL: Продвинутые функции потерь заметно улучшают распознавание мелких объектов. Это критически важно для отраслей, использующих анализ аэрофотоснимков и датчики Интернета вещей (IoT).

Универсальность в задачах компьютерного зрения#

В отличие от моделей, ограниченных одними только ограничивающими рамками, YOLO26 — универсальный мощный инструмент. Она включает улучшения для конкретных задач, такие как функция потерь семантической сегментации и многоуровневый proto для сегментации экземпляров, Residual Log-Likelihood Estimation (RLE) для оценки позы и специализированную функцию потерь угла для устранения проблем с границами в задачах ориентированных ограничивающих рамок (OBB).

Стратегия развертывания на периферийных устройствах

При развертывании на периферийных устройствах используй варианты YOLO26n (Nano) или YOLO26s (Small). Экспорт этих моделей в CoreML или TFLite проходит без затруднений благодаря удалению DFL и архитектуре без NMS, обеспечивая плавную работу в реальном времени на iOS и Android.

RTDETRv2: совершенствование Transformer-моделей обнаружения в реальном времени#

RTDETRv2, разработанная исследователями из Baidu, основана на исходной архитектуре RT-DETR. Она призвана доказать, что Detection Transformers (DETRs) могут конкурировать с высокооптимизированными CNNs и иногда превосходить их по скорости и точности в сценариях реального времени.

Архитектура и возможности#

RTDETRv2 использует архитектуру на основе Transformer, которая принципиально иначе обрабатывает изображения, чем CNNs, задействуя механизмы self-attention для понимания глобального контекста.

  • Bag-of-Freebies: Версия v2 представляет ряд оптимизированных методов обучения (bag-of-freebies), которые повышают базовую производительность без увеличения затрат на инференс.
  • Понимание глобального контекста: Благодаря слоям внимания Transformer модель RTDETRv2 хорошо справляется с пониманием сложных сцен, где глобальный контекст необходим для различения перекрывающихся или частично скрытых объектов.

Ограничения Transformer-моделей#

Несмотря на высокую мощность, модели обнаружения на основе Transformer, такие как RTDETRv2, часто сталкиваются с трудностями при практическом развертывании. Во время обучения им обычно требуется больше памяти CUDA по сравнению с эффективными CNNs. Кроме того, интеграция в различные периферийные среды может быть сложной из-за комплексных операций, необходимых для слоев внимания, поэтому такие модели, как YOLO26, гораздо привлекательнее для развертывания в условиях ограниченных ресурсов.

Сравнение производительности#

Сравнение этих моделей один на один показывает ощутимые преимущества последних оптимизаций CNN. В таблице ниже представлены их результаты на стандартных тестах.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Как показано, YOLO26 стабильно превосходит RTDETRv2 во всех вариантах размеров. YOLO26x достигает впечатляющего показателя 57.5 mAP при меньшей задержке (11.8 мс на TensorRT) и значительно меньшем числе параметров (55.7M), чем RTDETRv2-x (54.3 mAP, 15.03 мс, 76M параметров).

Варианты применения и рекомендации#

Выбор между YOLO26 и RT-DETR зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать YOLO26#

YOLO26 — подходящий выбор для:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Когда стоит выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Преимущества Ultralytics#

Выбор правильной архитектуры машинного обучения — лишь часть задачи; окружающая экосистема определяет, насколько быстро команда сможет перейти от прототипирования к промышленной эксплуатации.

Простота использования и эффективность обучения#

Python API Ultralytics обеспечивает исключительно удобный рабочий процесс. Для обучения сложных моделей больше не требуется многословный шаблонный код. Кроме того, YOLO26 значительно эффективнее обучается, используя гораздо меньше видеопамяти GPU, чем ресурсоемкие механизмы внимания RTDETRv2, что позволяет применять большие размеры пакетов даже на пользовательском оборудовании.

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

Хорошо поддерживаемая экосистема#

Используя модели Ultralytics, разработчики получают доступ к активно поддерживаемому фреймворку, который изначально интегрируется с современными инструментами трекинга, такими как Weights & Biases и Comet ML. Для тех, кто предпочитает подход без кода, Ultralytics Platform предоставляет возможности облачного обучения, управления датасетами и развертывания одним нажатием.

Баланс производительности#

YOLO26 обеспечивает непревзойденный баланс между скоростью инференса и точностью. Удаление NMS в сочетании с оптимизатором MuSGD гарантирует, что ты развертываешь модель, которая одновременно отличается высокой точностью на мелких объектах (благодаря ProgLoss + STAL) и молниеносной скоростью в рабочей среде, что делает ее лучшим выбором почти для всех современных приложений компьютерного зрения.

Другие модели экосистемы#

Хотя YOLO26 и RTDETRv2 представляют передовой уровень обнаружения в реальном времени, разработчики, поддерживающие устаревшие конвейеры или изучающие другие компромиссы эффективности, также могут рассмотреть YOLOv8 для уже внедренных корпоративных сред или изучить другие архитектуры, такие как EfficientDet. Однако для любого нового проекта YOLO26 остается однозначной рекомендацией.

Комментарии