YOLO26 и EfficientDet#
Выбор подходящей архитектуры нейронной сети критически важен для успеха любого приложения для компьютерного зрения. В этом техническом руководстве рассматриваются компромиссы, показатели производительности и архитектурные инновации двух известных моделей: передовой Ultralytics YOLO26 и хорошо зарекомендовавшей себя EfficientDet от Google.
Независимо от того, предназначено ли твоё развёртывание для облачных серверов с высокой пропускной способностью или устройств периферийного ИИ с жёсткими ограничениями по задержке, понимание различий между этими архитектурами помогает достичь оптимального баланса скорости, точности и эффективности.
Обзор архитектуры: YOLO26#
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2026-01-14
- GitHub: Ultralytics GitHub
- Документация: Официальная документация YOLO26
Выпущенная в начале 2026 года, YOLO26 представляет собой новейший этап развития семейства YOLO и специально разработана для обеспечения непревзойдённого пользовательского опыта и первоклассной средней точности (mAP). Созданная с нуля для современного оборудования, она отличается исключительной универсальностью в задачах обнаружения объектов, сегментации экземпляров, классификации изображений и оценки позы.
YOLO26 представляет несколько революционных функций, которые значительно повышают стабильность обучения и скорость инференса:
- Сквозная архитектура без NMS: Развивая концепции, впервые предложенные в YOLOv10, YOLO26 изначально является сквозной моделью и полностью устраняет необходимость в постобработке с подавлением немаксимумов (NMS). Это упрощает логику развёртывания и значительно уменьшает разброс задержки.
- До 43% более быстрый инференс на CPU: Благодаря глубокой архитектурной оптимизации модель достигает беспрецедентной скорости инференса на стандартных CPU, что делает её особенно подходящей для сред IoT и встраиваемых систем.
- Удаление DFL: Distribution Focal Loss была удалена, что обеспечило более чистый процесс экспорта и улучшило совместимость с маломощными периферийными устройствами, использующими такие инструменты, как ONNX.
- Оптимизатор MuSGD: Вдохновлённый процедурами обучения LLM для Kimi K2 от Moonshot AI, этот гибрид SGD и Muon переносит инновации обучения больших языковых моделей непосредственно в компьютерное зрение, обеспечивая более быструю сходимость и более стабильные режимы обучения.
- ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание малоразмерных объектов, что критически важно для приложений с аэрофотосъёмкой с дронов и робототехники.
Благодаря удалению DFL и архитектуре без NMS экспорт моделей YOLO26 в форматы, оптимизированные для периферийных устройств, например NVIDIA TensorRT или Intel OpenVINO, практически не требует разработки пользовательских плагинов.
Обзор архитектуры: EfficientDet#
- Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
- Организация: Google Research
- Дата: 20.11.2019
- Arxiv: EfficientDet Paper
- GitHub: репозиторий Google AutoML
Представленная Google, EfficientDet активно использует экосистему TensorFlow и построена вокруг концепции составного масштабирования. Её архитектура одновременно масштабирует базовую сеть, сеть признаков и сети предсказания рамок и классов с учётом доступных ресурсов.
Ключевые инновации EfficientDet:
- BiFPN (двунаправленная пирамида признаков): Механизм, обеспечивающий простое и быстрое объединение признаков разных масштабов, благодаря чему сеть лучше распознаёт объекты различных размеров.
- Составное масштабирование: Эвристический метод равномерного масштабирования разрешения, глубины и ширины, создающий семейство моделей от d0 (самой маленькой) до d7 (самой большой).
Хотя EfficientDet остаётся надёжным выбором для задач обнаружения только ограничивающих рамок, ей обычно не хватает современной универсальности для решения нескольких задач (например, встроенной поддержки задач OBB) и упрощённой единой экосистемы Python, которую ожидают современные разработчики.
Сравнение производительности и метрик#
Чтобы определить границу Парето для скорости и точности, мы протестировали обе архитектуры в стандартных средах, используя набор данных COCO. В следующей таблице представлены различия в размерах моделей, точности и задержке, измеренной на экземпляре AWS EC2 P4d.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Как показано выше, YOLO26 обеспечивает более сбалансированную производительность. Модель YOLO26x достигает наивысшей точности (57.5 mAP), значительно превосходя самую тяжёлую EfficientDet-d7. Кроме того, модели YOLO26 требуют значительно меньше памяти и обеспечивают гораздо более быстрый инференс на GPU (всего 1.7 мс на TensorRT), что подчёркивает преимущества архитектуры без NMS.
Эффективность обучения и преимущества экосистемы#
Основное различие между двумя архитектурами заключается в средах разработки. EfficientDet глубоко интегрирована в экосистемы Google AutoML и TensorFlow, которые, несмотря на мощные возможности, могут создавать сложный порог входа и жёсткие ограничения конфигурации для пользовательских наборов данных, таких как DOTAv1.
В свою очередь, Ultralytics предлагает исключительно хорошо поддерживаемую экосистему на базе PyTorch. Использование памяти во время обучения строго оптимизировано, что позволяет инженерам обучать надёжные модели без чрезмерного выделения VRAM, часто необходимого для сетей на базе Transformer.
Через Ultralytics Platform разработчики получают доступ к сквозному рабочему процессу MLOps. Он включает удобную разметку данных, автоматическую настройку гиперпараметров и облачное обучение в один клик, значительно ускоряя путь от прототипа до промышленной эксплуатации.
Пример реализации#
Благодаря простоте использования API Ultralytics ты можешь обучить и валидировать современную модель YOLO26 всего несколькими строками кода.
from ultralytics import YOLO
# Initialize the End-to-End NMS-Free YOLO26 model
model = YOLO("yolo26n.pt")
# Train using the innovative MuSGD optimizer on a custom dataset
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device="0", # Train on GPU
)
# Export natively to TensorRT for ultra-low latency deployment
model.export(format="engine")Идеальные сценарии использования#
Когда использовать YOLO26:
- Периферийные вычисления и мобильные устройства: Благодаря инференсу на CPU, который выполняется до 43% быстрее, и отсутствию накладных расходов NMS YOLO26 превосходно работает на устройствах со строго ограниченным вычислительным бюджетом, таких как Raspberry Pi или мобильные телефоны.
- Многозадачность: Когда одному конвейеру требуются ограничивающие рамки, маски сегментации и трекинг, универсальность YOLO26 не имеет себе равных.
- Съёмка с дронов и аэрофотосъёмка: Сочетание ProgLoss и STAL значительно улучшает обнаружение чрезвычайно малых объектов с большой высоты.
Когда использовать EfficientDet:
- Устаревшие конвейеры TensorFlow: Если твоя инфраструктура жёстко запрограммирована на поддержку только TensorFlow SavedModels или требует определённых конвейеров TensorFlow Serving, EfficientDet обеспечивает встроенную совместимость.
- TPU с ограниченными ресурсами: EfficientDet была тщательно оптимизирована для пользовательских тензорных процессоров Google (TPU).
Изучение других альтернатив#
Хотя это руководство посвящено главным образом подходу YOLO26 и EfficientDet, более широкая экосистема Ultralytics включает и другие впечатляющие архитектуры. Если твоё приложение активно использует Transformer, RT-DETR предлагает обнаружение на базе Transformer в реальном времени. Если же ты поддерживаешь устаревшие системы, YOLO11 по-прежнему полностью поддерживается и отличается высокой эффективностью. Для более общего обзора посетите центр сравнений моделей Ultralytics.
В конечном счёте для любого современного конвейера компьютерного зрения, создаваемого сегодня, выдающаяся скорость, простота использования и точность уровня передовых решений делают YOLO26 однозначной рекомендацией как для исследователей, так и для разработчиков.