YOLO26 против RTDETRv2#
Ландшафт компьютерного зрения постоянно развивается, предлагая разработчикам сделать критически важный выбор: использовать ли высокооптимизированные сверточные нейронные сети (CNN) или новые архитектуры на базе Transformer? Два заметных претендента в этой области — передовой Ultralytics YOLO26 и RTDETRv2 от компании Baidu. Обе модели раздвигают границы обнаружения объектов в реальном времени, но опираются на принципиально разные архитектурные философии.
Это руководство содержит глубокий технический разбор обеих моделей, сравнивая их структуры, показатели производительности и идеальные сценарии использования, чтобы помочь тебе выбрать наилучшую основу для твоего следующего проекта в области компьютерного зрения.
Ultralytics YOLO26: вершина Vision AI для периферийных вычислений#
Разработанный Ultralytics, YOLO26 представляет собой огромный эволюционный скачок для семейства YOLO. Выпущенный в январе 2026 года, он создан специально для скорости, точности и беспрепятственного развертывания в облачных и периферийных средах.
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2026-01-14
- GitHub: Репозиторий Ultralytics
- Документация: Официальная документация YOLO26
Архитектурные инновации и преимущества#
YOLO26 представляет несколько революционных функций, которые отличают его не только от моделей на базе Transformer, но и от более ранних версий, таких как YOLO11:
- Дизайн без NMS (End-to-End): YOLO26 исключает традиционное подавление не максимумов (NMS) на этапе постобработки. Этот нативный сквозной подход, впервые примененный в таких моделях, как YOLOv10, снижает разброс задержки выводов и упрощает логику развертывания, особенно на периферийном оборудовании.
- Ускорение вывода на CPU до 43%: Учитывая растущую потребность в децентрализованном ИИ, YOLO26 глубоко оптимизирован для устройств без выделенных GPU, таких как Raspberry Pi.
- Удаление DFL: Убрав Distribution Focal Loss (DFL), YOLO26 предлагает упрощенный процесс экспорта и значительно улучшенную совместимость с маломощными периферийными устройствами и микроконтроллерами.
- Оптимизатор MuSGD: Соединяя обучение больших языковых моделей (LLM) и компьютерное зрение, YOLO26 использует оптимизатор MuSGD. Этот гибрид SGD и Muon, вдохновленный Kimi K2 от Moonshot AI, обеспечивает надежную стабильность обучения и более быструю сходимость.
- ProgLoss + STAL: Передовые функции потерь обеспечивают заметное улучшение распознавания мелких объектов. Это крайне важно для отраслей, использующих анализ аэрофотоснимков и датчики интернета вещей (IoT).
Универсальность в задачах компьютерного зрения#
В отличие от моделей, ограниченных только рамками, YOLO26 — это универсальный инструмент. Он включает в себя специфичные для задач улучшения, такие как потеря семантической сегментации и многомасштабный протон для сегментации экземпляров, оценка остаточного логарифма правдоподобия (RLE) для оценки позы и специализированная потеря угла для решения граничных проблем в задачах ориентированных ограничивающих рамок (OBB).
RTDETRv2: улучшение трансформеров для обнаружения в реальном времени#
RTDETRv2, разработанный исследователями Baidu, базируется на оригинальной архитектуре RT-DETR. Его цель — доказать, что трансформеры для обнаружения (DETR) могут конкурировать со скоростью и точностью высокооптимизированных CNN, а иногда и превосходить их в сценариях реального времени.
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 24.07.2024
- Arxiv: 2407.17140
- GitHub: Реализация RT-DETRv2 на PyTorch
- Документация: README по RT-DETRv2
Архитектура и возможности#
RTDETRv2 использует архитектуру на базе Transformer, которая по своей сути обрабатывает изображения иначе, чем CNN, задействуя механизмы самовнимания (self-attention) для понимания глобального контекста.
- Bag-of-Freebies: Итерация v2 представляет серию оптимизированных методов обучения (набор «бесплатных» улучшений), которые повышают базовую производительность без дополнительных затрат на вывод.
- Осведомленность о глобальном контексте: Благодаря слоям внимания трансформера, RTDETRv2 естественным образом адаптирован к пониманию сложных сцен, где глобальный контекст необходим для различения перекрывающихся или заслоненных объектов.
Ограничения моделей Transformer#
Будучи мощными, основанные на Transformer модели детектирования, такие как RTDETRv2, часто сталкиваются с трудностями при практическом развертывании. Как правило, они требуют больше памяти CUDA во время обучения по сравнению с эффективными CNN. Кроме того, интеграция в разнообразные периферийные среды может быть обременительной из-за сложных операций, требуемых слоями внимания, что делает такие модели, как YOLO26, гораздо более привлекательными для развертывания в условиях ограниченных ресурсов.
Сравнение производительности#
Сравнение этих моделей напрямую раскрывает ощутимые преимущества новейших оптимизаций CNN. В таблице ниже показана их производительность на стандартных бенчмарках.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Как показано, YOLO26 стабильно превосходит RTDETRv2 во всех вариантах размера. YOLO26x достигает впечатляющих 57.5 mAP с меньшей задержкой (11.8 мс на TensorRT) и значительно меньшим количеством параметров (55.7M) по сравнению с RTDETRv2-x (54.3 mAP, 15.03 мс, 76M параметров).
Сценарии использования и рекомендации#
Выбор между YOLO26 и RT-DETR зависит от требований твоего проекта, ограничений развертывания и предпочтений в экосистеме.
Когда стоит выбрать YOLO26#
YOLO26 — отличный выбор для:
- Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
- Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
- Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.
Когда выбирать RT-DETR#
RT-DETR рекомендуется для:
- Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
- Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
- Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.
Преимущество Ultralytics#
Выбор правильной архитектуры машинного обучения — это лишь часть уравнения; окружающая экосистема определяет, как быстро команда сможет перейти от прототипирования к продакшену.
Простота использования и эффективность обучения#
Python API от Ultralytics предлагает невероятно простой процесс работы. Обучение сложных моделей больше не требует громоздкого шаблонного кода. Кроме того, эффективность обучения YOLO26 значительно выше: модель использует гораздо меньше видеопамяти GPU по сравнению с требовательными к памяти механизмами внимания в RTDETRv2, что позволяет использовать большие размеры батча даже на оборудовании потребительского уровня.
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX for seamless deployment
model.export(format="onnx")Хорошо поддерживаемая экосистема#
Используя модели Ultralytics, ты получаешь доступ к активно поддерживаемому фреймворку, который нативно интегрируется с современными инструментами отслеживания, такими как Weights & Biases и Comet ML. Для тех, кто предпочитает подход без написания кода, платформа Ultralytics облегчает облачное обучение, управление наборами данных и развертывание в один клик.
Баланс производительности#
YOLO26 достигает непревзойденного баланса между скоростью вывода и точностью. Удаление NMS в сочетании с оптимизатором MuSGD гарантирует, что ты развертываешь модель, которая одинаково эффективна при обнаружении мелких объектов (благодаря ProgLoss + STAL) и невероятно быстра в продакшене, что делает ее лучшим выбором почти для всех современных приложений компьютерного зрения.
Другие модели в экосистеме#
Хотя YOLO26 и RTDETRv2 находятся на передовой детекции в реальном времени, разработчикам, поддерживающим старые пайплайны или изучающим другие графики эффективности, стоит также рассмотреть YOLOv8 для устоявшихся корпоративных сред либо другие архитектуры вроде EfficientDet. Однако для любой новой инициативы YOLO26 остается главным рекомендуемым выбором.