YOLO Vision 2026:

YOLO11とEfficientDetの比較#

コンピュータビジョンプロジェクトに最適なニューラルネットワークを選択するには、利用可能なアーキテクチャについての深い理解が必要です。本ガイドでは、Ultralytics YOLO11とGoogleのEfficientDetについて、詳細な技術的比較を行います。機械学習のワークロードにおいて情報に基づいた決定を下せるよう、アーキテクチャの違い、パフォーマンス指標、トレーニング効率、および最適なデプロイシナリオを解説します。

モデルの背景と仕様#

両モデルは ディープラーニング の分野に大きな影響を与えてきましたが、それぞれ異なる設計思想や AI 開発の時代背景から生まれています。

YOLO11の詳細#

著者: Glenn Jocher, Jing Qiu
組織: Ultralytics
日付: 2024-09-27
GitHub: https://github.com/ultralytics/ultralytics
ドキュメント: https://docs.ultralytics.com/models/yolo11/

YOLO11の詳細はこちら

EfficientDetの詳細#

著者: Mingxing Tan, Ruoming Pang, Quoc V. Le
組織: Google
日付: 2019-11-20
Arxiv: https://arxiv.org/abs/1911.09070
GitHub: https://github.com/google/automl/tree/master/efficientdet
ドキュメント: https://github.com/google/automl/tree/master/efficientdet#readme

EfficientDetについて詳しく知る

エコシステムの利点

コンピュータビジョンモデルを扱う場合、モデル自体と同様に周囲のエコシステムも重要です。Ultralytics エコシステム は並外れた開発者体験を提供し、充実したドキュメント、活発なコミュニティサポート、ONNXTensorRT などのフォーマットへのシームレスなエクスポート機能を提供します。

アーキテクチャの革新#

EfficientDet: BiFPNとコンパウンドスケーリング#

2019年後半に発表された EfficientDet は、計算コストを最小限に抑えながら精度を最大化することを目指しました。これは主に2つのメカニズムによって達成されています。1つ目は、深さ、幅、解像度をバランスよくスケーリングする EfficientNet バックボーン を使用している点です。2つ目は、簡単かつ高速なマルチスケール 特徴量フュージョン を可能にする双方向特徴ピラミッドネットワーク(BiFPN)を導入した点です。

当時としては非常に効率的であったものの、EfficientDet が TensorFlow の AutoML ライブラリに依存しているため、柔軟性に欠ける場合があります。モダンでモジュール化された PyTorch ベースのフレームワークと比較して、研究者は モデルプルーニング や独自のカスタマイズが難しいと感じることがよくあります。

YOLO11: 高度な特徴抽出と汎用性#

YOLO11 は、物体検出アーキテクチャ において大きな飛躍を表しています。先行モデルの成功を基盤としており、洗練された C3k2 ブロックと改良された Spatial Pyramid Pooling モジュールを導入しています。これらの機能強化により 特徴抽出 が優れており、YOLO11 は複雑な視覚パターンを並外れた鮮明さで捉えることができます。

YOLO11の大きな利点はその汎用性です。EfficientDetが厳密にオブジェクト検出モデルである一方、YOLO11はインスタンスセグメンテーション画像分類姿勢推定、および方向付きバウンディングボックス (OBB)をネイティブでサポートしています。さらに、YOLO11はトレーニングおよび推論時のメモリ要件が非常に低いため、リソースが制限されたエッジAI環境にデプロイする際、古いモデルやかさばるビジョンTransformerよりも圧倒的に優れています。

性能とベンチマーク#

平均適合率 (mAP) で測定される精度と、推論速度のバランスは、実際のデプロイメントにおいて決定的な要素となります。以下の表は、標準的な COCO データセット における両モデルファミリーの生パフォーマンスを示しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

示されているように、YOLO11は非常に優れたパフォーマンスバランスを実現しています。YOLO11xは全体的な最高精度(54.7 mAP)を達成し、より小型のYOLO11バリアントはGPU推論速度(TensorRTを使用してT4上で最小1.5ms)において絶対的な優位性を誇ります。

学習効率とエコシステム#

Ultralytics モデルの定義的な特徴の1つは、その 使いやすさ です。EfficientDet モデルのトレーニングには、複雑な TensorFlow グラフ設定の操作や複雑な依存関係チェーンの管理が必要になることがよくあります。対照的に、YOLO11 はクリーンで徹底的にモダンな PyTorch 基盤の上に構築されています。

この 適切に維持管理されたエコシステム により、開発者はわずか数行のコードでパッケージをインストールし、事前学習済みモデルを読み込み、カスタム データセット のトレーニングを開始できます。

Pythonコードの例#

以下は、Ultralytics APIのシンプルさを示す、完全に実行可能な例です。このスクリプトは学習済みのYOLO11モデルをダウンロードし、学習を行い、迅速な予測を実行します。

from ultralytics import YOLO

# Initialize a pretrained YOLO11 nano model
model = YOLO("yolo11n.pt")

# Train the model efficiently using the integrated PyTorch engine
# Training efficiency is high, requiring less VRAM than legacy models
results = model.train(data="coco8.yaml", epochs=10, imgsz=640, device="cpu")

# Run real-time inference on a sample image
prediction = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the output bounding boxes
prediction[0].show()

未来を見据えて:YOLO26の利点#

YOLO11 は非常に強力ですが、新規にプロジェクトを開始するチームは、2026年1月にリリースされた Ultralytics YOLO26 を強く検討すべきです。YOLO26 は、デプロイのシンプルさとエッジパフォーマンスにおけるパラダイムシフトを表しています。

YOLO26の主な革新技術は以下の通りです。

  • エンドツーエンド NMS フリー設計: 後処理中の非最大値抑制(NMS)を排除することにより、YOLO26 は一貫した超低遅延を保証し、高速な ロボティクス や自動運転にとって極めて重要です。
  • 最大43%高速なCPU推論: 専用GPUを搭載していない環境向けに、YOLO26は標準プロセッサでのスループットを最大化するように最適化されています。
  • MuSGDオプティマイザ: Moonshot AIのKimi K2から着想を得たこのハイブリッドオプティマイザは、LLM学習の安定性をコンピュータビジョンにもたらし、より高速な収束を可能にします。
  • ProgLoss + STAL: これらの改良された損失関数は、衛星画像解析 やドローン映像において課題となることが多い小さなオブジェクトの認識を劇的に向上させます。
  • DFLの削除: Distribution Focal Lossを削除することで、エッジデバイスへのモデルエクスポートプロセスを合理化しています。
検討すべき代替モデル

プロジェクトに非常に特定の要件がある場合は、Transformer ベースの検出用に RT-DETR モデルをベンチマークするか、多くの既存のエンタープライズデプロイメントで主力であり続けている広く採用されている YOLOv8 を検討するとよいでしょう。

ユースケースと推奨事項#

YOLO11とEfficientDetの選択は、プロジェクトの特定の要件、デプロイメントの制約、およびエコシステムの優先順位に依存します。

YOLO11を選択すべき時#

YOLO11は以下のような場合に適しています:

  • 本番エッジデプロイメント: 信頼性と積極的なメンテナンスが最優先される、Raspberry PiNVIDIA Jetson などのデバイス上の商用アプリケーション。
  • マルチタスクビジョンアプリケーション: 単一の統一されたフレームワーク内で detectionsegmentationpose estimation、および OBB を必要とするプロジェクト。
  • 迅速なプロトタイピングとデプロイメント: 合理化された Ultralytics Python API を使用して、データ収集から本番環境まで迅速に移行する必要があるチーム。

EfficientDetを選択すべき場合#

EfficientDetは以下の場合に推奨されます:

  • Google CloudおよびTPUパイプライン: Google Cloud Vision APIやTPUインフラストラクチャと深く統合されたシステムであり、EfficientDetのネイティブ最適化が活かせる環境。
  • 複合スケーリング研究: ネットワークの深さ、幅、解像度のスケーリングバランスが与える影響を調査することに焦点を当てた学術的なベンチマーク。
  • TFLite によるモバイルデプロイメント: Android または組み込み Linux デバイス向けに TensorFlow Lite のエクスポートを特別に必要とするプロジェクト。

Ultralytics (YOLO26) を選択すべき時#

ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。

  • NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
  • CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
  • 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。

結論#

EfficientDetは、物体検出におけるコンパウンドスケーリングの実現可能性を証明した先駆的なアーキテクチャでした。しかし、AI研究の急速な進歩により、より高性能で、統合しやすく、実行速度の速いモデルが登場しています。

堅牢なマルチタスク機能、驚異的な GPU 推論速度、そして業界で最も開発者に優しい API とも言える特長を備えた YOLO11 は、現代のビジョンパイプラインにとって明確な勝者です。テクノロジーの絶対的な最先端(特にエッジファーストのデプロイメント)を目指す人にとって、YOLO26 へのアップグレードは、NMS フリーの速度と比類のない精度の究極の組み合わせを提供します。

コントリビューター

コメント