YOLO26とEfficientDetの比較#
コンピュータービジョンアプリケーションの成否には、適切なニューラルネットワークアーキテクチャの選択が重要です。この技術ガイドでは、最先端のUltralytics YOLO26と、Googleが確立したEfficientDetという2つの代表的なモデルについて、トレードオフ、性能指標、アーキテクチャのイノベーションを解説します。
デプロイ先が高スループットのクラウドサーバーでも、レイテンシに制約のあるエッジAIデバイスでも、これらのアーキテクチャの違いを理解することで、速度、精度、効率の最適なバランスを実現できます。
アーキテクチャの概要:YOLO26#
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2026-01-14
- GitHub: Ultralytics GitHub
- ドキュメント: YOLO26公式ドキュメント
2026年初頭にリリースされたYOLO26は、YOLOファミリーの最新モデルです。比類のないユーザー体験とトップクラスの平均適合率 (mAP)を提供するために、専用設計されています。最新のハードウェアを念頭に一から設計され、物体検出、インスタンスセグメンテーション、画像分類、姿勢推定の各タスクで優れた汎用性を発揮します。
YOLO26には、トレーニングの安定性と推論速度の両方を大幅に向上させる、画期的な機能がいくつか導入されています。
- エンドツーエンドのNMS不要設計: YOLOv10で初めて実現された概念を基に、YOLO26はオプションのエンドツーエンド対応1対1ヘッド (
nms=False) を提供し、非極大値抑制 (NMS) の後処理を不要にします。これにより、デプロイのロジックがシンプルになり、レイテンシのばらつきが大幅に低減します。 - CPU推論が最大43%高速: アーキテクチャを深く最適化することで、一般的なCPUでこれまでにない推論速度を実現しており、IoTや組み込み環境に非常に適しています。
- DFLの削除: Distribution Focal Lossを削除することで、エクスポートプロセスがシンプルになり、ONNXなどのツールを使う低消費電力のエッジデバイスとの互換性が向上します。
- MuSGDオプティマイザー: Moonshot AIのKimi K2のLLMトレーニング手法に着想を得た、SGDとMuonのハイブリッドです。大規模言語モデルのトレーニングにおけるイノベーションをコンピュータービジョンに直接取り入れ、より速い収束と安定したトレーニングを実現します。
- ProgLoss + STAL: これらの高度な損失関数は、小さな物体の認識性能を大きく向上させます。これは、ドローンによる航空画像やロボティクスに関するアプリケーションで重要な要素です。
DFLの削除とNMS不要アーキテクチャにより、YOLO26モデルをNVIDIA TensorRTやIntel OpenVINOなどのエッジ向け形式にエクスポートする際、カスタムプラグインの開発はほぼ不要です。
アーキテクチャの概要:EfficientDet#
- 著者: Mingxing Tan、Ruoming Pang、Quoc V. Le
- 組織: Google Research
- 日付: 2019-11-20
- Arxiv: EfficientDet論文
- GitHub: Google AutoMLリポジトリ
Googleが発表したEfficientDetは、TensorFlowエコシステムを大いに活用し、複合スケーリングの概念に基づいて設計されています。そのアーキテクチャでは、リソースの制約に応じて、バックボーンネットワーク、特徴ネットワーク、ボックス/クラス予測ネットワークを同時に拡張します。
EfficientDetの主な革新点は次のとおりです。
- BiFPN(双方向特徴ピラミッドネットワーク): 複数スケールの特徴を簡単かつ高速に融合する仕組みで、さまざまなサイズの物体をネットワークがより適切に認識できるようにします。
- 複合スケーリング: 解像度、深さ、幅を均一に拡張するヒューリスティック手法で、最小のd0から最大のd7までのモデルファミリーを作成します。
EfficientDetは厳密なバウンディングボックス検出において依然として堅牢な選択肢ですが、一般に、最新のマルチタスク対応力(ネイティブのOBBタスクなど)や、現代の開発者が期待する合理化された統合型Pythonエコシステムを備えていません。
パフォーマンスと指標の比較#
速度と精度のパレートフロンティアを特定するため、標準的な環境でCOCOデータセットを使用し、両方のアーキテクチャをベンチマークしました。次の表では、モデルサイズ、精度、レイテンシの違いを示しています。CPU速度はONNX Runtime、GPU速度はNVIDIA T4上のTensorRTを使用して測定しました。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
上記のとおり、YOLO26は優れた性能バランスを実現しています。YOLO26xモデルは最高精度(57.5 mAP)を達成し、最も大規模なEfficientDet-d7を大幅に上回ります。さらに、YOLO26モデルは必要なメモリが大幅に少なく、GPU推論もはるかに高速です(TensorRTで最速1.7 ms)。これはNMSフリー設計の利点を示しています。
トレーニング効率とエコシステムの優位性#
2つのアーキテクチャの大きな違いの1つは、開発環境にあります。EfficientDetはGoogle AutoMLおよびTensorFlowエコシステムに深く組み込まれています。この環境は強力である一方、DOTAv1のようなカスタムデータセットでは、習得に時間がかかり、設定の柔軟性が制限されることがあります。
一方、UltralyticsはPyTorchを基盤とする、非常に適切に保守されたエコシステムを提供しています。トレーニング時のメモリ使用量は厳密に最適化されており、Transformerベースのネットワークで一般的な過剰なVRAM割り当てを必要とせず、エンジニアは堅牢なモデルをトレーニングできます。
Ultralytics Platformを通じて、開発者はエンドツーエンドのMLOpsワークフローを利用できます。これには、シームレスなデータアノテーション、自動ハイパーパラメータチューニング、ワンクリックのクラウドトレーニングが含まれており、プロトタイピングから本番環境までの移行を大幅に加速します。
実装例#
Ultralytics APIを使えば、わずか数行のコードで最先端のYOLO26モデルをトレーニングおよび検証できます。
from ultralytics import YOLO
# エンドツーエンドのNMSフリーYOLO26モデルを初期化します
model = YOLO("yolo26n.pt")
# カスタムデータセットでトレーニングします(optimizer='auto'は、長時間のトレーニングにMuSGDを選択します)
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device="0", # GPUでトレーニングします
)
# 超低レイテンシでのデプロイに向けて、ネイティブにTensorRTへエクスポートします
model.export(format="engine")最適なユースケース#
YOLO26を使用する場面:
- エッジコンピューティングとモバイル: CPU推論が最大43%高速で、NMSのオーバーヘッドもないYOLO26は、Raspberry Piや携帯電話など、計算リソースが厳しく制限されたデバイスで優れた性能を発揮します。
- マルチタスク: 1つのパイプラインでバウンディングボックス、セグメンテーションマスク、トラッキングが必要な場合、YOLO26の汎用性は他に類を見ません。
- ドローンと航空画像: ProgLossとSTALの組み合わせにより、高高度からの極小物体の検出性能が大幅に向上します。
EfficientDetを使用する場面:
- レガシーTensorFlowパイプライン: インフラストラクチャがTensorFlow SavedModelsのみをサポートするように強く依存している場合や、特定のTensorFlow Servingパイプラインが必要な場合、EfficientDetはネイティブ互換性を提供します。
- リソースに制約のあるTPU: EfficientDetは、Google独自のTensor Processing Unit(TPU)向けに高度に最適化されています。
その他の代替モデルを検討する#
このガイドでは主にYOLO26とEfficientDetの比較を取り上げていますが、幅広いUltralyticsエコシステムには、ほかにも優れたアーキテクチャがあります。アプリケーションでTransformerを多用する場合は、RT-DETRがリアルタイムのTransformerベース検出を提供します。また、レガシーシステムをサポートする場合は、YOLO11も引き続き完全にサポートされ、高い効果を発揮します。全体像については、Ultralyticsモデル比較ハブをご覧ください。
今日構築する最新のコンピュータービジョンパイプラインでは、YOLO26の圧倒的な速度、使いやすさ、最先端の精度により、研究者にも開発者にも最適な選択肢となっています。