Ultralytics YOLO27:

YOLO26とEfficientDetの比較#

適切なニューラルネットワークアーキテクチャの選択は、あらゆるコンピュータービジョンアプリケーションの成功に不可欠です。この技術ガイドでは、2つの代表的なモデル、最先端のUltralytics YOLO26と、Googleが確立したEfficientDetのトレードオフ、パフォーマンス指標、アーキテクチャ上の革新について説明します。

デプロイ先が高スループットのクラウドサーバーであっても、レイテンシーが制約されるエッジAIデバイスであっても、これらのアーキテクチャの違いを理解することで、速度、精度、効率の最適なバランスを確保できます。

アーキテクチャの概要: YOLO26#

2026年初頭にリリースされたYOLO26は、YOLOファミリーの最新の進化形であり、比類のないユーザーエクスペリエンスと最高水準の平均適合率 (mAP)を提供するよう特別に設計されています。最新のハードウェア向けにゼロから設計されており、物体検出インスタンスセグメンテーション画像分類姿勢推定にわたって優れた汎用性を発揮します。

YOLO26には、トレーニングの安定性と推論速度の両方を大幅に向上させる、画期的な機能が複数導入されています。

  • エンドツーエンドのNMSフリーデザイン: YOLOv10で先駆的に導入された概念を基盤として、YOLO26はネイティブなエンドツーエンドモデルとなっており、非最大抑制 (NMS) の後処理が完全に不要です。これにより、デプロイロジックが簡素化され、レイテンシーのばらつきが大幅に低減されます。
  • CPU推論が最大43%高速化: 深いアーキテクチャ最適化により、標準的なCPU上で前例のない推論速度を実現し、IoTや組み込み環境に非常に適しています。
  • DFLの削除: Distribution Focal Lossが削除されたことで、エクスポートプロセスがよりクリーンになり、ONNXなどのツールを使用する低消費電力のエッジデバイスとの互換性が向上しています。
  • MuSGDオプティマイザー: Moonshot AIのKimi K2のLLMトレーニング手法から着想を得た、SGDとMuonのハイブリッドです。大規模言語モデルのトレーニングにおける革新をコンピュータービジョンに直接取り入れ、より速い収束と安定したトレーニングを実現します。
  • ProgLoss + STAL: これらの高度な損失関数により、小物体認識が大幅に向上します。これは、航空ドローン画像やロボティクスを扱うアプリケーションにおいて重要な要素です。
効率化されたエクスポート

DFLの削除とNMSフリーアーキテクチャにより、YOLO26モデルをNVIDIA TensorRTIntel OpenVINOなどのエッジに適した形式へエクスポートする際、カスタムプラグインの開発はほとんど必要ありません。

アーキテクチャの概要: EfficientDet#

Googleによって導入されたEfficientDetは、TensorFlowエコシステムを大いに活用し、複合スケーリングの概念を中心に設計されています。そのアーキテクチャでは、リソースの制約に基づいて、バックボーンネットワーク、特徴ネットワーク、ボックスおよびクラス予測ネットワークを同時にスケールアップします。

EfficientDetの主な革新には、次のものがあります。

  • BiFPN (双方向特徴ピラミッドネットワーク): マルチスケールの特徴を容易かつ高速に融合できる仕組みであり、さまざまなサイズの物体をネットワークがより適切に理解できるようにします。
  • 複合スケーリング: 解像度、深さ、幅を均一にスケールアップするヒューリスティック手法であり、d0(最小)からd7(最大)までのモデルファミリーを作成します。

EfficientDetは厳密なバウンディングボックス検出において依然として堅牢な選択肢ですが、一般的には、最新のマルチタスクに対応する汎用性(ネイティブのOBBタスクなど)や、現代の開発者が期待する合理化された統合Pythonエコシステムを備えていません。

EfficientDet の詳細を見る

パフォーマンスとメトリクスの比較#

速度と精度のパレートフロンティアを特定するため、COCOデータセットを使用し、標準環境で両アーキテクチャのベンチマークを実施しました。次の表では、AWS EC2 P4dインスタンス上で測定したモデルサイズ、精度、レイテンシーの違いを示します。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター数
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

上記の結果が示すように、YOLO26はより優れたパフォーマンスバランスを実現しています。YOLO26xモデルは最高精度(57.5 mAP)を達成し、最も大規模なEfficientDet-d7を大幅に上回っています。さらに、YOLO26モデルは必要メモリが大幅に少なく、GPU推論速度も大幅に高速です(TensorRT上で最短1.7 ms)。これはNMSフリーデザインの利点を裏付けています。

トレーニング効率とエコシステムの優位性#

2つのアーキテクチャの大きな違いの1つは、開発環境にあります。EfficientDetはGoogle AutoMLおよびTensorFlowエコシステムに深く組み込まれています。強力である一方、DOTAv1のようなカスタムデータセットでは、学習曲線が急になり、設定が厳格になる場合があります。

一方、UltralyticsはPyTorchを基盤とした、非常によく保守されたエコシステムを提供しています。トレーニング中のメモリ使用量は厳密に最適化されているため、Transformerベースのネットワークで一般的に必要となる過剰なVRAM割り当てなしに、エンジニアは堅牢なモデルをトレーニングできます。

統合プラットフォーム連携

Ultralytics Platformを通じて、開発者はエンドツーエンドのMLOpsワークフローを利用できます。これには、シームレスなデータアノテーション、自動ハイパーパラメーター調整、ワンクリックのクラウドトレーニングが含まれ、プロトタイピングから本番環境までの移行を大幅に加速します。

実装例#

Ultralytics APIの使いやすさにより、わずか数行のコードで最先端のYOLO26モデルをトレーニングおよび検証できます。

from ultralytics import YOLO

# Initialize the End-to-End NMS-Free YOLO26 model
model = YOLO("yolo26n.pt")

# Train using the innovative MuSGD optimizer on a custom dataset
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Train on GPU
)

# Export natively to TensorRT for ultra-low latency deployment
model.export(format="engine")

理想的なユースケース#

YOLO26を使用する場合:

  • エッジコンピューティングとモバイル: CPU推論が最大43%高速で、NMSのオーバーヘッドもないため、YOLO26はRaspberry Piや携帯電話など、計算リソースが厳しく制限されたデバイスで優れた性能を発揮します。
  • マルチタスク: 1つのパイプラインでバウンディングボックス、セグメンテーションマスク、トラッキングが必要な場合、YOLO26の汎用性は他に類を見ません。
  • ドローンと航空画像: ProgLossとSTALの組み合わせにより、高高度からの非常に小さな物体の検出性能が大幅に向上します。

EfficientDetを使用する場合:

  • レガシーTensorFlowパイプライン: インフラストラクチャがTensorFlow SavedModelのみをサポートするように大部分がハードコードされている場合、または特定のTensorFlow Servingパイプラインが必要な場合、EfficientDetはネイティブ互換性を提供します。
  • リソースが制約されたTPU: EfficientDetはGoogle独自のテンソル処理ユニット(TPU)向けに大幅に最適化されています。

その他の代替モデル#

このガイドではYOLO26とEfficientDetの比較に重点を置いていますが、より広範なUltralyticsエコシステムには、他にも優れたアーキテクチャがあります。アプリケーションでTransformerを多用する場合、RT-DETRはリアルタイムのTransformerベース検出を提供します。一方、レガシーシステムをサポートする場合は、YOLO11も引き続き完全にサポートされており、高い効果を発揮します。より広範な概要については、Ultralyticsモデル比較ハブをご覧ください。

最終的に、現在構築される最新のコンピュータービジョンパイプラインでは、YOLO26の圧倒的な速度、使いやすさ、最先端の精度により、研究者と開発者の双方にとって議論の余地のない推奨モデルとなっています。

コメント