Ultralytics YOLO27:

YOLO26とYOLOv5の比較#

コンピュータビジョンの進化は、速度、精度、アクセシビリティを絶えず追求することで形作られてきました。適切なアーキテクチャの選択は、あらゆるAIプロジェクトの成功に不可欠です。本ガイドでは、Ultralyticsによる2つの画期的なリリース、先駆的なYOLOv5と革新的なYOLO26を比較します。どちらもリアルタイムの物体検出の分野に大きな影響を与えてきましたが、その基盤となるテクノロジーには、ニューラルネットワークによる視覚データ処理の方法における大規模なパラダイムシフトが反映されています。

モデル概要#

アーキテクチャの細部に入る前に、両モデルの基本的な詳細を確認します。

YOLO26の詳細:

YOLOv5の詳細:

その他の選択肢

本ガイドではYOLO26とYOLOv5に焦点を当てていますが、レガシーシステムを移行する開発者は、YOLO11や、先駆的なNMSフリーアーキテクチャを採用したYOLOv10との比較にも関心があるかもしれません。どちらも、特定のデプロイ環境への優れた足がかりとなります。

アーキテクチャのイノベーション#

YOLOv5とYOLO26の6年間の隔たりは、ディープラーニング研究における大きな飛躍を表しています。YOLOv5はビジョンモデルにおけるPyTorchの広範な利用を普及させ、業界標準となった高度に最適化されたアンカーベースの検出メカニズムを提供しました。一方で、後処理では最大値抑制(NMS)に大きく依存していたため、リソースに制約のあるデバイスではレイテンシのボトルネックが生じる可能性がありました。

YOLO26は、エンドツーエンドのNMSフリーデザインによって推論パイプラインを完全に再構築しています。NMSによる後処理を不要にすることで、YOLO26はより高速で大幅にシンプルなデプロイロジックを実現します。これはYOLOv10で初めて導入されたコンセプトを、ここでさらに完成させたものです。さらに、YOLO26はDFLの削除(分布焦点損失)を採用し、出力ヘッドを大幅に簡素化しています。これにより、モデルをONNXTensorRTなどの形式へ非常にスムーズにエクスポートでき、エッジデバイスや低消費電力デバイスとの優れた互換性が確保されます。

トレーニング中、YOLO26は、Moonshot AIのKimi K2に着想を得たSGDとMuonのハイブリッドである最先端のMuSGD Optimizerを採用します。これにより、LLMトレーニングのイノベーションがコンピュータビジョンの領域にもたらされ、YOLOv5で使用されている従来のSGDやAdamWオプティマイザーと比較して、非常に安定したトレーニングと大幅に高速な収束を実現します。

パフォーマンスとメトリクス#

モデルを評価する際、平均適合率(mAP)と推論速度のバランスが、実環境での実用性を決定します。YOLO26は、ハイエンドGPUとエッジCPUの両方にネイティブ最適化されています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター数
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

ベンチマークでは、驚異的な改善が明らかになっています。たとえば、YOLO26nはmAP 40.9を達成する一方、YOLOv5nは28.0であり、さらにCPU推論が最大43%高速です。このため、YOLO26はRaspberry Piやモバイルデバイスなどの組み込み環境へのデプロイにおいて、はるかに優れています。NanoスケールではTensorRTのGPU速度でYOLOv5がわずかに優位ですが、精度とのトレードオフはYOLO26に大きく有利です。

トレーニングエコシステムと使いやすさ#

両モデルは、十分にメンテナンスされたUltralyticsエコシステムの恩恵を大いに受けています。合理化されたPython API、豊富なドキュメント、活発なコミュニティサポートにより、「ゼロから達人まで」の体験を提供します。ただし、YOLO26はトレーニング効率を新たなレベルへ引き上げています。

Ultralyticsのモデルは、Transformerを多用する代替モデルと比べて、トレーニング中に必要とするCUDAメモリが一貫して大幅に少なくなっています。YOLO26は、ProgLoss + STALの損失関数によってこの優位性をさらに高めています。これらの進歩により、メモリオーバーヘッドを増大させることなく、小さな物体の認識性能が大幅に向上します。

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model with the MuSGD optimizer (default for YOLO26)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)

# Run fast, NMS-free inference on a test image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

このシンプルなスクリプトにより、開発者はカスタムデータセットを迅速に反復処理し、データの取り込みから本番環境対応モデルまでシームレスに進められます。

簡単なデプロイ

Ultralytics Platformを使用すると、変換コードを1行も記述せずに、トレーニング済みのYOLO26モデルをCoreMLTensorFlow Liteなどの形式へ自動的にエクスポートできます。

汎用性と理想的なユースケース#

YOLOv5を使用する場合#

YOLOv5は、レガシーシステム向けの信頼性の高い実用モデルであり続けています。アンカーベースの出力に強く依存する既存の産業用パイプラインがある場合、または成熟して固定化されたTensorRTスタックを備えた旧型のNVIDIA Jetsonデバイスで推論を実行している場合、YOLOv5は安定性に優れ、ドキュメントも充実したソリューションを提供します。

YOLO26を使用する場合#

YOLO26は、最新のコンピュータビジョンプロジェクトにおける決定的な選択肢です。その汎用性は前モデルを大きく上回ります。YOLOv5が主に検出に焦点を当て、後からセグメンテーション機能が追加されたのに対し、YOLO26はインスタンスセグメンテーション姿勢推定画像分類回転バウンディングボックス(OBB)をネイティブに深くサポートしています。

YOLO26は、専用のセマンティックセグメンテーション損失、超高精度な姿勢キーポイントを実現する残差対数尤度推定(RLE)、難しい境界の問題を解決するOBB向けの高度な角度損失など、タスク固有の改善を導入しています。

  • エッジIoTとロボティクス: NMSフリーアーキテクチャと43%高速なCPU推論により、YOLO26はリアルタイムのロボットナビゲーションやスマートホームカメラに最適です。
  • 航空画像: ProgLoss + STALの改善により、駐車場の車両や農地の作物など、ドローンから撮影した小さな物体をより確実に検出できます。
  • リアルタイム動画分析: スポーツ中継でアスリートを追跡する場合でも、交通の流れを監視する場合でも、YOLO26のパフォーマンスバランスにより、フレームを落とさず高い再現率を確保できます。

最終的に、アクセシブルで高性能なエコシステムに対するUltralyticsの取り組みにより、YOLOv5からYOLO26への移行はスムーズに行え、研究者と開発者の双方が最先端の機能を活用できるようになります。

コメント