YOLO Vision 2026:

YOLOv5 と EfficientDet の比較#

新しいcomputer visionプロジェクトに着手する際、適切なニューラルネットワークアーキテクチャの選択は、下す決断の中で最も結果を左右する重要なものの1つです。本ガイドでは、Ultralytics YOLOv5とGoogleのEfficientDetの間に深い技術的比較を提供します。アーキテクチャ、パフォーマンス指標、トレーニングエコシステムを分析することで、開発者や研究者が特定のデプロイ環境に最適なobject detectionモデルを特定できるよう支援することを目指しています。

EfficientDetが複合スケーリングと特徴量融合における新しい概念を導入した一方で、YOLOv5は、非常に直感的なPyTorch実装、効率化されたユーザー体験、そして比類のない速度と精度のバランスを通じて、高性能AIへのアクセスを大衆化し、業界に革命をもたらしました。

Ultralytics YOLOv5: アクセシビリティにおける業界標準#

2020年夏にリリースされたYOLOv5は、YOLOの系譜における極めて重要な転換点となりました。C言語ベースのDarknetフレームワークからネイティブなPyTorchへと移行したことで、モデルの構築、学習、デプロイを迅速に行いたい開発者にとっての定番アーキテクチャとなりました。

アーキテクチャの革新#

YOLOv5は、シームレスなmachine learningライフサイクルを優先する、高度に最適化されたアーキテクチャで高く評価されています。これは、改良されたCSPDarknet53バックボーンとPath Aggregation Network(PANet)ネックを組み合わせて利用しており、複数の空間スケールにわたる特徴伝播を劇的に改善します。

主な進歩は以下の通りです:

  • Mosaicデータ拡張: この学習テクニックは、4つの異なる学習画像を1つのモザイクに結合します。これにより、モデルは複雑な空間コンテキスト内での物体識別を学習せざるを得なくなり、小さなターゲットを検出する能力が大幅に向上します。
  • 自動学習アンカーボックス: トレーニングが開始される前に、YOLOv5はカスタムtraining dataを分析し、k-meansクラスタリングを使用して最適なanchor boxの寸法を自動的に計算します。
  • メモリ効率: 重いTransformerベースのモデルと比較して、YOLOv5は学習時および推論時のメモリフットプリントが大幅に低く抑えられており、コンシューマーグレードのハードウェアでもスムーズに動作します。

YOLOv5の詳細はこちら

EfficientDet: スケーラブルな物体検出#

2019年にGoogle Researchが発表したEfficientDetは、スケーラブルな物体検出器のファミリーを提供することを目指しました。EfficientNet画像分類バックボーンを基盤とし、新しい特徴融合メカニズムを導入しています。

アーキテクチャの革新#

EfficientDetの中核となる提案は、スケーリングと特徴集約に対する体系的なアプローチにあります:

  • BiFPN (双方向特徴ピラミッドネットワーク): 情報をトップダウンにのみ渡す従来型のFPNとは異なり、BiFPNは学習可能な重みを導入して異なる入力特徴の重要度を学習することで、高速かつ容易なマルチスケール特徴融合を可能にします。
  • 化合物スケーリング: EfficientDetは、バックボーン、特徴ネットワーク、ボックス/クラス予測ネットワークの解像度、深さ、幅をすべて同時にスケーリングし、軽量なD0から大規模なD7までのモデルを実現しています。

EfficientDetについて詳しく知る

フレームワークの違い

EfficientDetがTensorFlowエコシステムとAutoMLライブラリに強く依存しているのに対し、YOLOv5はPyTorch内でネイティブに動作し、多くの開発者がより直感的で、Pythonらしく、デバッグしやすいワークフローであると感じるものを提供します。

パフォーマンスと指標の比較#

これらのモデルを比較する際、COCO datasetのような標準ベンチマークでのパフォーマンスを評価することが不可欠です。以下の表は、サイズ、計算需要(FLOPs)、推論速度の間のトレードオフを強調しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

バランスの取れた分析#

YOLOv5は、そのデプロイの柔軟性と生ハードウェアアクセラレーションの互換性において優れています。T4 GPUにおける圧倒的な高速のTensorRT速度に注目してください。これにより、YOLOv5は高スループットのビデオ分析およびreal-time inferenceパイプラインに非常に適したものとなっています。さらに、Ultralyticsエコシステムにより、ONNXCoreMLTensorRTなどの形式へのエクスポートが1行のコマンドで行えます。

EfficientDetは優れたパラメータ効率を提供します。特定のパラメータ数に対して、高いmean Average Precision (mAP)を抽出することがよくあります。しかし、この理論上の効率は、BiFPN層の複雑なルーティングのために、エッジGPUでの実際のウォールクロック推論時間を速くすることに常に直結するとは限らず、計算バウンドではなくメモリ帯域幅バウンドになる可能性があります。

エコシステムと使いやすさ#

Ultralyticsモデルを選択する決定的な利点は、周辺のエコシステムにあります。YOLOv5は、強力なコミュニティサポートを受け、活発にメンテナンスおよび開発されているリポジトリの一部です。

Ultralytics Platformの導入により、ユーザーはデータ収集からデプロイまでシームレスに移行できます。このプラットフォームは、自動アノテーション、クラウドトレーニング、モデルモニタリングを標準でサポートしています。対照的に、EfficientDetのトレーニングでは、古いTensorFlowオブジェクト検出APIの複雑さを乗り越える必要があることが多く、迅速なプロトタイピングにとって急な学習曲線をもたらす可能性があります。

さらに、YOLOv5の多様性はバウンディングボックスにとどまりません。継続的なアップデートを通じて、Ultralyticsフレームワークはinstance segmentationimage classificationをネイティブでサポートし、複数のコンピュータビジョンタスクに向けた統合APIを提供します。

理想的なユースケース#

  • 次の場合にYOLOv5を選択してください: 迅速なプロトタイピング、摩擦のないトレーニング体験、高度に最適化されたエッジデプロイが必要な場合。低レイテンシが不可欠なドローン、retail analytics、モバイルアプリケーションに最適です。
  • EfficientDetを選択すべきケース: Google Cloud/TensorFlow AutoML環境に厳密に依存しており、厳格なリアルタイム遅延制限なしでパラメータあたりの精度を最大化する必要がある場合。

次世代: YOLO26の採用#

YOLOv5は信頼できる主力製品であり続けていますが、コンピュータビジョンの分野は進歩しています。2026年における絶対的な最先端を求める開発者にとって、YOLO26はUltralyticsラインナップの新たな最高峰を表しています。

前身のレガシー(YOLOv8YOLO11など)を基盤として、YOLO26画期的なイノベーションを導入します:

  • エンドツーエンドのNMSフリー設計: YOLO26はNon-Maximum Suppressionのポストプロセッシングをネイティブに排除します。これにより遅延の変動が大幅に減少し、デプロイアーキテクチャが簡素化されます。
  • 最大43%高速なCPU推論: edge AI向けに高度に最適化されており、専用GPUを持たない低電力のエッジデバイスや標準CPUに前例のない速度をもたらします。
  • MuSGDオプティマイザー: 大規模言語モデル (LLM) の学習テクニックに触発されたSGDとMuonのハイブリッドにより、非常に安定した学習と高速な収束を保証します。
  • 高度な損失関数: ProgLossとSTALの統合により、高高度のドローン画像やroboticsにとって不可欠である小規模ターゲットの認識が大幅に向上します。
  • DFLの削除: Distribution Focal Lossを削除することで、モデルのエクスポートプロセスが効率化され、多様なハードウェアアクセラレーター間での互換性がさらに向上しました。

Ultralyticsエコシステム内の他の最近のアーキテクチャの探索に関心のあるユーザーは、YOLOv10RT-DETRなどのモデルを比較することもできます。

移行は簡単です

Ultralytics Python APIは、後方互換性と前方互換性を考慮して設計されています。YOLOv5からYOLO26へのアップグレードは、コード内のモデル重みの文字列を変更するだけという、まさに文字通りのシンプルさです!

コード例: 学習と推論#

Ultralyticsエコシステムの比類なき使いやすさを実証するため、最新のYOLOモデルを使用した学習と推論の実行方法を以下に示します。このコードは100%実行可能で、データセットのダウンロード、学習ループ、検証を自動的に処理します。

from ultralytics import YOLO

# Load a modern model (Swap 'yolov5s.pt' for 'yolo26n.pt' to test the newest architecture!)
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 example dataset for 20 epochs
results = model.train(data="coco8.yaml", epochs=20, imgsz=640)

# Run inference on an image from the web
inference_results = model("https://ultralytics.com/images/bus.jpg")

# Display the image with bounding boxes
inference_results[0].show()

ユーザー体験の優先、堅牢なエコシステムの維持、そしてYOLO26のようなアップデートで可能なことの境界を押し広げ続けることにより、Ultralyticsは、開発者が現実世界の視覚的知能に関する課題を解決するための最良のツールを常に手元に持てるようにします。

コントリビューター

コメント