YOLO26 と YOLOv9#
コンピュータビジョンの分野は急速に進歩しており、新しいアーキテクチャが常に速度と精度の限界を押し広げています。この技術比較では、リアルタイム物体検出の分野で非常に影響力のある2つのモデル、YOLO26とYOLOv9の違いを検証します。両モデルとも独自のアーキテクチャ上の革新を提供していますが、次のビジョンプロジェクトに最適なツールを選択するには、そのパフォーマンスのトレードオフ、デプロイ機能、およびハードウェア要件を理解することが重要です。
YOLO26: エッジ最適化されたパワーハウス#
2026年初期にリリースされたUltralytics YOLO26は、デプロイ効率とモデル学習の安定性において世代を超えた飛躍を実現しています。ネイティブなエンドツーエンドのフレームワークとして設計されており、エッジAIアプリケーションで従来課題となっていたデプロイのボトルネックを直接解消します。
モデル詳細:
- 著者: Glenn Jocher and Jing Qiu
- 組織: Ultralytics
- 日付: 2026-01-14
- GitHub: Ultralytics リポジトリ
- ドキュメント: YOLO26 ドキュメント
アーキテクチャとイノベーション#
YOLO26は、エンドツーエンドのNMSフリー設計を導入することで、後処理パイプラインを根本から再設計しています。非極大値抑制(NMS)の必要性をなくすことで、モデルはレイテンシの変動を大幅に低減します。これにより、ONNXやApple CoreMLなどのフレームワークにエクスポートする際、モバイルおよびエッジプラットフォームへのデプロイが非常に簡単になります。
さらに、Distribution Focal Loss (DFL)の削除によりエクスポートプロセスが合理化され、低電力マイクロコントローラーとの互換性が向上しました。学習の安定性を高めるため、YOLO26はStochastic Gradient Descent (SGD)とMuon(大規模言語モデル学習の革新から着想を得た)を組み合わせたハイブリッドのMuSGD Optimizerを統合しています。これにより、困難なデータセット全体で、より高速な収束と、より堅牢な特徴抽出が可能になります。
アーキテクチャの簡素化とDFLの排除により、YOLO26は**CPU推論の高速化(最大43%)**を実現しており、Raspberry PiやNVIDIA Jetson Nanoなどのリソースが制限されたエッジデバイスに最適な選択肢となります。
ドローン空撮画像などのシーンで非常に困難なアイテムを検出するため、YOLO26は更新されたProgLoss + STAL損失関数を活用します。これらは、小物体認識の再現率において顕著な改善をもたらします。さらに、インスタンスセグメンテーション用のマルチスケールプロト、姿勢推定用のResidual Log-Likelihood Estimation(RLE)、および指向性バウンディングボックス(OBB)検出用の特殊な角度損失を含む、タスク固有の機能強化を誇ります。
YOLOv9: プログラマブル勾配情報#
2024年初頭に導入されたYOLOv9は、ニューラルネットワークが学習段階で勾配フローを処理する方法に理論的な進歩をもたらし、パラメータ効率と深い特徴の保持に焦点を当てました。
モデル詳細:
- 著者: Chien-Yao Wang および Hong-Yuan Mark Liao
- 組織: 台湾 中央研究院 情報科学研究所
- 日付: 2024-02-21
- Arxiv: YOLOv9 論文
- GitHub: YOLOv9 リポジトリ
- ドキュメント: YOLOv9 ドキュメント
アーキテクチャと強み#
YOLOv9は、Programmable Gradient Information(PGI)とGeneralized Efficient Layer Aggregation Network(GELAN)の概念を中心に構築されています。これらの概念は、ディープニューラルネットワークでよく見られる情報のボトルネック問題に対処します。フィードフォワードプロセスを通じて重要な情報を保持することにより、GELANは重み更新に使用される勾配が信頼性を維持することを保証します。このアーキテクチャは高い精度を提供し、YOLOv9をPyTorchフレームワークを使用したニューラルネットワーク理論および勾配パス最適化に関する学術研究の強力な候補にします。
制限事項#
優れたパラメータ効率にもかかわらず、YOLOv9はバウンディングボックスの後処理を従来のNMSに大きく依存しているため、エッジデバイスでの推論時に計算のボトルネックが生じる可能性があります。さらに、公式リポジトリは主に物体検出に焦点を当てており、トラッキングや姿勢推定などの特殊なタスクに適応させるには、多くのカスタムエンジニアリングが必要になります。
パフォーマンスの比較#
実世界へのデプロイに向けてこれらのモデルを評価する際、精度 (mAP)、推論速度、メモリ使用量のバランスを取ることが極めて重要です。Ultralytics モデルは、トレーニングと推論の両方においてメモリ要件が低いことで定評があり、RT-DETR などの Transformer ベースの代替手段と比較して、はるかに少ない CUDA memory しか必要としません。
以下は、COCOデータセットにおけるYOLO26とYOLOv9のパフォーマンスの直接比較です。各列の最良の値は太字で強調表示されています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
注: YOLOv9のCPU速度は、NMSの設定によって大きく変動し、通常はYOLO26のネイティブなNMSフリー実装よりも遅いため、除外されています。
ユースケースと推奨事項#
YOLO26とYOLOv9のどちらを選択するかは、特定のプロジェクト要件、デプロイの制約、およびエコシステムの好みに依存します。
YOLO26を選ぶべき時#
YOLO26は以下の場合に強力な選択肢となります:
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
YOLOv9を選択すべき場合#
YOLOv9は以下の場合に推奨されます:
- 情報ボトルネック研究: Programmable Gradient Information (PGI)およびGeneralized Efficient Layer Aggregation Network (GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: トレーニング中の深層ネットワーク層における情報損失の理解と軽減に重点を置いた研究。
- 高精度検出ベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の強力なCOCOベンチマークパフォーマンスが必要とされるシナリオ。
Ultralyticsの利点#
モデルの選択には、単に精度ベンチマークを読むこと以上の要素が含まれます。周囲のソフトウェアエコシステムが、データ収集から本番環境までどれだけ速く進めるかを決定します。
使いやすさとエコシステム#
Ultralytics Python APIは、シームレスな「ゼロからヒーローへ」の体験を提供します。複雑なリポジトリをクローンしたり、分散トレーニングスクリプトを手動で設定したりする代わりに、開発者は pip を介してパッケージをインストールし、すぐにトレーニングを開始できます。活発にメンテナンスされているUltralyticsエコシステムは、頻繁なアップデート、Weights & BiasesなどのMLプラットフォームとの自動統合、および豊富なドキュメントを保証します。
ビジョンタスク全般の汎用性#
YOLOv9が主に検出エンジンであるのに対し、YOLO26は汎用のビジョンツールです。単一の統一された構文を使用して、物体検出からピクセル精度の画像セグメンテーションや全画像分類へと簡単に移行できます。この汎用性により、さまざまなコンピュータビジョン機能のために複数のバラバラなコードベースを維持する技術的負債が軽減されます。
効率的な学習とデプロイ#
トレーニングの効率性は、Ultralyticsの哲学の基盤です。YOLO26は容易に入手できる事前トレーニング済み重みを利用し、かさばるビジョンtransformersと比較して大幅に低いメモリ使用量を誇ります。トレーニング後、組み込みのエクスポートパイプラインにより、TensorRTやTensorFlow Liteなどの最適化されたフォーマットへのワンクリック変換が可能になり、本番環境への道筋がスムーズになります。
コード例: YOLO26を始める#
YOLO26の実装は非常に簡単です。以下のPythonスニペットは、学習済みモデルの読み込み、カスタムデータでの学習、およびUltralytics APIを使用した推論の実行方法を示しています。
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset utilizing the MuSGD optimizer
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Uses GPU 0, or use 'cpu' for CPU training
)
# Run an NMS-free inference on a sample image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Display the bounding boxes and confidences
predictions[0].show()YOLO26の速度、簡素化されたアーキテクチャ、堅牢なエコシステムを活用することで、チームはこれまで以上に少ない技術的ハードルで、高度なビジョンAIアプリケーションを市場に投入できるようになります。