YOLO Vision 2026:

YOLO26 と YOLOv5 の比較#

コンピュータビジョンの進化は、速度、精度、アクセシビリティのたゆまぬ追求によって定義されてきました。AIプロジェクトの成功には、適切なアーキテクチャの選択が不可欠です。この包括的なガイドでは、Ultralyticsによる2つの記念碑的なリリース、先駆的なYOLOv5と画期的なYOLO26を比較します。どちらもリアルタイムobject detectionのランドスケープに大きな影響を与えていますが、その根底にあるテクノロジーは、ニューラルネットワークが視覚データを処理する方法において、大きなパラダイムシフトを反映しています。

モデルの概要#

アーキテクチャの詳細に入る前に、両モデルの基礎となる詳細を確認しましょう。

YOLO26の詳細:

YOLO26の詳細はこちら

YOLOv5の詳細:

YOLOv5の詳細はこちら

他の選択肢の検討

このガイドではYOLO26とYOLOv5に焦点を当てていますが、レガシーシステムを移行する開発者は、YOLO11や先駆的なNMSフリーアーキテクチャのYOLOv10の比較にも興味を持つかもしれません。どちらも特定のデプロイメント環境において優れた足がかりを提供します。

アーキテクチャの革新#

YOLOv5とYOLO26の間の6年間のギャップは、ディープラーニング研究における大きな飛躍を表しています。YOLOv5は、ビジョンモデルでのPyTorchの広く普及した使用を一般化し、業界標準となった高度に最適化されたアンカーベースの検出メカニズムを提供しました。しかし、後処理の際にNon-Maximum Suppression (NMS)に大きく依存しており、リソースが制限されたデバイスでレイテンシのボトルネックを引き起こす可能性がありました。

YOLO26は、End-to-End NMS-Free Designによって推論パイプラインを完全に再想像します。NMS後処理の必要性をなくすことで、YOLO26はより高速で非常にシンプルなデプロイメントロジックを実現します。この概念はYOLOv10で初めて開拓され、ここで完成されました。さらに、YOLO26は出力ヘッドを劇的にシンプルにするDFL Removal(Distribution Focal Loss)を備えています。これにより、モデルをONNXTensorRTなどのフォーマットにエクスポートすることが非常にスムーズになり、エッジデバイスや低電力デバイスとの優れた互換性が保証されます。

トレーニング中、YOLO26は最先端のMuSGD Optimizerを採用しています。これは、Moonshot AIのKimi K2にインスパイアされたSGDとMuonのハイブリッドです。これにより、LLMトレーニングのイノベーションがコンピュータビジョン分野に導入され、YOLOv5で使用されている従来のSGDまたはAdamWオプティマイザと比較して、非常に安定したトレーニングと大幅に高速な収束が保証されます。

パフォーマンスとメトリクス#

モデルを評価する際、mean Average Precision (mAP)と推論速度のバランスが現実世界の実行可能性を決定づけます。YOLO26は、ハイエンドGPUとエッジCPUの両方に向けてネイティブに最適化されています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

ベンチマークは驚異的な改善を示しています。たとえば、YOLO26nYOLOv5nの28.0と比較して40.9のmAPを達成し、同時に最大43%高速なCPU推論を提供します。これにより、YOLO26はRaspberry Piやモバイルデバイスなどの組み込みデプロイメントにおいて圧倒的に優れています。YOLOv5はNanoスケールでのTensorRT GPU速度でわずかに優位性を持っていますが、精度のトレードオフは圧倒的にYOLO26に有利です。

トレーニングエコシステムと使いやすさ#

両モデルとも、適切にメンテナンスされたUltralyticsエコシステムの恩恵を大きく受けています。合理化されたPython API、広範なドキュメント、活発なコミュニティサポートにより、「ゼロからヒーロー」への体験を提供します。しかし、YOLO26はトレーニングの効率性を新たなレベルに引き上げています。

Ultralyticsのモデルは、トランスフォーマーを多用する代替手段と比較して、トレーニング中に一貫して大幅に低いCUDA memoryを要求します。YOLO26は、ProgLoss + STAL損失関数によりこれをさらに強化します。これらの進歩により、メモリオーバーヘッドを肥大化させることなく、小物体の認識において顕著な改善がもたらされます。

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model with the MuSGD optimizer (default for YOLO26)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)

# Run fast, NMS-free inference on a test image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

このシンプルなスクリプトにより、開発者はcustom datasetsで迅速にイテレーションを行い、データ取り込みから本番環境に対応したモデルへとシームレスに移行できます。

導入の簡素化

1行の変換コードも書くことなく、Ultralytics Platformを使用して、トレーニング済みYOLO26モデルをCoreMLTensorFlow Liteなどのフォーマットに自動的にエクスポートできます。

汎用性と理想的なユースケース#

YOLOv5を使用すべき場面#

YOLOv5は、レガシーシステムにとって信頼できる主力製品であり続けています。アンカーベースの出力に強く結びついた既存の産業用パイプラインがある場合や、成熟した固定されたTensorRTスタックを備えた古いNVIDIA Jetsonデバイスで推論を実行している場合、YOLOv5は安定した、十分に文書化されたソリューションを提供します。

YOLO26を使用すべき場面#

YOLO26は、現代のコンピュータビジョンプロジェクトにとって決定版の選択肢です。その汎用性は前任者をはるかに凌駕しています。YOLOv5は主に検出(後からのセグメンテーション追加を含む)に焦点を当てていますが、YOLO26はInstance SegmentationPose EstimationImage Classification、およびOriented Bounding Boxes (OBB)に対するディープでネイティブなサポートを提供します。

YOLO26は、専門的なセマンティックセグメンテーション損失、超高精度なポーズキーポイントのためのResidual Log-Likelihood Estimation (RLE)、および複雑な境界問題を解決するためのOBB向けの高度な角度損失など、タスク固有の改善 を導入しています。

  • エッジIoTおよびロボティクス: NMSフリーのアーキテクチャと43%高速なCPU推論により、YOLO26はリアルタイムのロボットナビゲーションやスマートホームカメラに最適です。
  • 航空画像: ProgLoss + STALの強化により、駐車場の車両や農地の作物など、ドローンからの小さな物体の検出が大幅に信頼性の高いものとなります。
  • リアルタイムビデオ分析: スポーツ放送における選手の追跡であれ、交通流の監視であれ、YOLO26のパフォーマンスバランスはフレームを落とさずに高いリコール率を保証します。

最終的に、アクセシブルで高性能なエコシステムに対するUltralyticsのコミットメントは、YOLOv5からYOLO26への移行が摩擦なく行えることを保証し、研究者から開発者まで同様に最先端の機能を利用可能にします。

コントリビューター

コメント