YOLO Vision 2026:

YOLO26 と YOLO11 の比較#

最先端のコンピュータビジョンシステムを構築する際、精度、レイテンシ、リソース効率のバランスを取るためには、適切なモデルを選択することが極めて重要です。急速に進化する人工知能の分野において、Ultralyticsは、可能性の限界を押し広げ続けています。この詳細な技術比較では、非常に成功を収めたYOLO11から革新的な新しいYOLO26への移行を詳しく解説し、AIエンジニアや研究者が情報に基づいたアーキテクチャの意思決定を行うために必要な洞察を提供します。

モデルの系譜とメタデータ#

両モデルとも Ultralytics によって開発されましたが、オブジェクト検出およびマルチタスクビジョンモデルの歴史において異なるパラダイムを表しています。

YOLO26の詳細:

YOLO26の詳細はこちら

YOLO11 の詳細:

YOLO11の詳細はこちら

その他のアーキテクチャ

YOLO26は当社の最も高度なリアルタイムモデルですが、高度に特化されたハードウェアや膨大なメモリ容量を扱うユーザーは、RT-DETRや画期的なNMSフリーの先駆者であるYOLOv10のようなTransformerベースのアーキテクチャを検討することもできます。

アーキテクチャの違いと革新#

YOLO11からYOLO26への飛躍には、モデルアーキテクチャと基盤となるトレーニング手法の両方における根本的な変更が伴います。YOLO11はオブジェクト検出とマルチタスク学習の堅牢なベースラインを確立しましたが、YOLO26はエッジコンピューティング向けのデプロイパイプラインを完全に刷新しています。

エンドツーエンドの NMS 不要設計#

YOLO26における最も重要なアップグレードの1つは、ネイティブのエンドツーエンドアーキテクチャです。重複するバウンディングボックスをフィルタリングするために非最大抑制 (NMS)後処理に依存するYOLO11とは異なり、YOLO26はこのステップを完全に排除します。このコンセプトは、YOLOv10で初めて開拓されたものであり、さまざまなエッジデバイスにわたるレイテンシの変動を劇的に削減し、デプロイロジックを簡素化します。

エッジ効率のための DFL 削除#

YOLO11 はバウンディングボックスの推定を洗練させるために Distribution Focal Loss (DFL) を利用しています。しかし、DFL は低電力のエッジアクセラレータではサポートが不十分なことが多い複雑な softmax 演算に依存しています。YOLO26 は精度を犠牲にすることなく DFL を正常に削除しました。このアーキテクチャの簡素化により、組み込みシステムとの互換性が大幅に向上し、YOLO26 は前モデルと比較して最大 43% 高速な CPU 推論 を実現しています。

MuSGD オプティマイザ#

トレーニングの安定性と速度は極めて重要です。YOLO26 は、Stochastic Gradient Descent (SGD) と Muon のハイブリッドである MuSGD オプティマイザ を導入しており、これは Moonshot AI の Kimi K2 の LLM トレーニングの革新から大きな影響を受けています。このオプティマイザは、言語モデルのトレーニングの安定性をコンピュータービジョンにもたらし、重量級の Transformer 代替品と比較して、トレーニング中の収束を高速化しメモリフットプリントを削減します。

ProgLoss と STAL#

空中画像やドローンアプリケーションを扱う研究者にとって、微小な特徴の検出は歴史的な課題です。YOLO26はProgLossとSTAL (Scale-Targeted Attention Loss)を組み合わせて導入し、YOLO11と比較して小物体認識における顕著な改善を実現しています。

パフォーマンスと指標の比較#

両モデルを直接比較すると、YOLO26 は精度とエッジデバイスの効率性において明らかに優位性を示しつつ、Ultralytics エコシステムの特徴である極めて低いメモリ要件を維持しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

注: YOLO26 nano (YOLO26n) モデルは、YOLO11n と比較して CPU 速度が約31%向上 (56.1ms に対し 38.9ms) しており、エッジ優先の設計思想が強調されています。

コンピュータービジョンタスク全般における汎用性#

両モデルは高度にメンテナンスされた Ultralytics エコシステムの恩恵を受けており、統一された Python API を通じて比類のない使いやすさを提供します。これらは単なるオブジェクト検出器ではなく、マルチタスクの強力なツールです。ただし、YOLO26 にはタスク固有のいくつかの進歩が組み込まれています。

  • インスタンスセグメンテーション: YOLO26は、洗練されたセマンティックセグメンテーションロスとマルチスケールプロトタイピングを使用し、YOLO11よりも鮮明なマスク境界を生成します。セグメンテーションワークフローの詳細をご覧ください。
  • 姿勢推定: 残差対数尤度推定 (RLE)を統合することにより、YOLO26は複雑な人間の姿勢におけるキーポイント精度を劇的に向上させます。姿勢推定機能をご覧ください。
  • 指向性バウンディングボックス (OBB): 特殊な角度損失関数により、従来の境界の不連続性の問題が解決され、YOLO26は衛星画像内の回転したオブジェクトの検出において非常に信頼性が高くなります。OBBタスクについてお読みください。
  • 画像分類: どちらのモデルも高速な分類を効率的に処理し、YOLO26はImageNetでわずかなtop-1精度の向上を実現しています。

トレーニングと推論のコード例#

Ultralyticsは、その優れた開発者エクスペリエンスで称賛されています。SOTAモデルのトレーニングや推論スクリプトの実行はわずか数行のコードで行うことができ、ボイラープレートを最小限に抑えて生産性を最大化します。さらに、YOLOモデルのトレーニングには、大規模なTransformerネットワークよりもはるかに少ないCUDAメモリしか必要としません。

from ultralytics import YOLO

# Load the cutting-edge YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset efficiently
# The MuSGD optimizer is automatically enabled for YOLO26
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Utilize GPU for accelerated training
)

# Perform NMS-free inference directly on an image
results = model("https://ultralytics.com/images/bus.jpg")

# Display the clean, instant predictions
results[0].show()

理想的なユースケースとデプロイ戦略#

YOLO26 と YOLO11 のどちらを選択するかは、完全に本番環境の制約に依存します。

YOLO26 をデプロイすべきタイミング#

YOLO26 は、モダンで新規のプロジェクトにとって決定的な選択肢です。特に以下のような用途に構築されています。

  • エッジコンピューティングと IoT: その驚異的な CPU 性能と DFL の削除により、Raspberry Pi、Coral NPU、モバイルプロセッサなどのデバイスで最高のパフォーマンスを発揮します。
  • ドローンおよび航空分析: ProgLoss と STAL の統合により、広大な風景の中で小さく高速に移動するオブジェクトを追跡する能力において唯一無二の性能を発揮します。
  • レイテンシクリティカルなアプリケーション: 自律型ロボットや製造業の品質管理において、NMSフリーのデザインは、予期しない後処理のスパイクなしで決定論的なレイテンシを保証します。

YOLO11 を保持すべきタイミング#

YOLO26 は優れていますが、YOLO11 も非常に高性能なモデルです。以下の場合には YOLO11 を継続して使用することが適しています。

  • レガシーパイプライン: 既存の C++ デプロイインフラストラクチャが、古いアーキテクチャの特定のアンカーベースの出力や NMS ロジックと密結合している場合。
  • 学術的なベースライン: 研究を発表しており、新しいアルゴリズムを評価するために広く認識されている 2024 年の標準が必要な場合。

Ultralytics エコシステムの力#

YOLO11をデプロイするかYOLO26をデプロイするかに関係なく、Ultralyticsモデルを活用することは、頻繁なアップデートと豊富なコミュニティサポートを備えた十分にメンテナンスされたエコシステムを利用することを意味します。

エンタープライズチーム向けに、Ultralytics Platformは、データアノテーション、モデルトレーニング、およびシームレスなクラウドデプロイのためのエンドツーエンドのソリューションを提供します。トレーニング済みウェイトのCoreMLTensorRTへのエクスポートから、高度なハイパーパラメータチューニングの設定まで、提供されるツールによりAIライフサイクルが可能な限り合理化されます。

コントリビューター

コメント