YOLOv9 と YOLO26 の比較#
リアルタイムオブジェクト検出の分野は、ここ数年で大きく進化しました。機械学習のエンジニアがさまざまなハードウェア全体でモデルをデプロイしようとする際、適切なアーキテクチャを選ぶことが極めて重要になります。この包括的な技術ガイドでは、コンピュータビジョンの分野における2つの重要なマイルストーンを比較します。1つは勾配パスの最適化に焦点を当てて2024年初頭に発表されたYOLOv9であり、もう1つはエッジ推論と学習の安定性を完全に再定義した2026年初頭リリースの最新かつ最先端のフレームワークである**Ultralytics YOLO26**です。
エグゼクティブサマリー:モデルの系譜と開発者#
これらのディープラーニングモデルの起源を理解することは、アーキテクチャ設計の選択やターゲットユーザーに関する貴重なコンテキストを提供します。
YOLOv9#
台湾のAcademia Sinicaの情報科学研究所のChien-Yao Wang氏とHong-Yuan Mark Liao氏によって執筆されたYOLOv9は、2024年2月21日にリリースされました。このモデルは理論的なディープラーニングの概念に深く焦点を当てており、特にディープ畳み込みニューラルネットワーク(CNN)における情報ボトルネックの問題に対処しています。
Ultralytics YOLO26#
YOLO26は、UltralyticsのGlenn Jocher氏とJing Qiu氏によって執筆され、2026年1月14日にリリースされました。YOLO11やYOLOv8などの前バージョンの圧倒的な成功を基盤として、YOLO26は本番環境での実用性、エッジデプロイ、およびネイティブなエンドツーエンドの効率性を最優先するようにゼロから設計されました。
コンピュータビジョンのパイプラインをアップグレードする準備はできましたか?Ultralytics Platformを使用すると、コードを1行も書くことなく、クラウド上でYOLO26モデルを簡単にトレーニングしてデプロイできます。
アーキテクチャの革新#
両モデルとも、ニューラルネットワークが視覚データを処理する方法に画期的な変化をもたらしていますが、そのアプローチには違いがあります。
YOLOv9におけるプログラマブル勾配情報#
YOLOv9の分野への最大の貢献は、**プログラマブル勾配情報(PGI)と一般化効率的層集約ネットワーク(GELAN)**の導入です。ニューラルネットワークが深くなるにつれて、フォワードパスの過程で情報損失に悩まされることがよくあります。PGIは、バックプロパゲーション中の重みの更新に使用される勾配が正確かつ信頼性を保つように保証し、GELANアーキテクチャがより少ないパラメータで高い精度を達成できるようにします。
しかし、YOLOv9は後処理に従来の非最大抑制(NMS)を大きく依存しており、これが実環境での推論時にレイテンシのボトルネックとなる可能性があります。
YOLO26 のエッジファーストアーキテクチャ#
YOLO26は、トレーニングからリアルタイムデプロイまでのパイプライン全体を最適化するという、根本的に異なるアプローチをとっています。YOLOv10で初めて開拓されたエンドツーエンドのNMSフリーデザインを基にしており、NMS後処理の必要性を完全に排除しています。これにより信じられないほど低いレイテンシが実現し、Raspberry PiやNVIDIA Jetsonなどのエッジデバイス向けに高度に最適化されています。
さらに、YOLO26はディストリビューション焦点損失(DFL)を完全に削除しました。この構造的変更により、モデルのONNXへのエクスポートが簡素化され、低電力マイクロコントローラとの互換性が大幅に向上します。
トレーニングフェーズにおいて、YOLO26は確率的勾配降下法とMuon(Moonshot AIのKimi K2の大規模言語モデルトレーニング手法からインスピレーションを得たもの)のハイブリッドである新しいMuSGDオプティマイザを統合しています。これにより、大規模言語モデル(LLM)のトレーニングにおける革新とコンピュータビジョンのギャップが埋められ、はるかに安定したトレーニングとより高速な収束時間が提供されます。
パフォーマンスと指標の比較#
広く使用されているCOCOデータセットでベンチマークを行うと、両方のモデルが卓越した性能を示しますが、実際の推論速度とパラメータ効率においてはUltralyticsエコシステムが圧倒的に優れています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
結果の分析#
- 速度と効率: YOLO26はNMSフリーのアーキテクチャと簡素化された損失関数を使用しているため、レガシーアーキテクチャと比較してCPU推論が最大43%高速になります。YOLO26nモデルは、TensorRTを使用したNVIDIA T4 GPU上で驚異的な1.7msで動作し、リアルタイムビデオストリームの究極の選択肢となります。
- 精度: YOLO26xモデルは、最大のYOLOv9eモデルを上回りつつ、より低いレイテンシを維持しながら、比類のない 57.5 mAP を達成しています。
- メモリ要件: Ultralytics モデルはその効率性で知られています。YOLO26 は、複雑な transformer-based vision models と比較して、model training および推論時の CUDA メモリ消費量が大幅に少ないため、開発者はコンシューマー向けハードウェアでより大きなバッチサイズを利用できます。
エコシステム、使いやすさ、汎用性#
真の強み: Ultralyticsエコシステムの真の強みは、その優れたユーザー体験にあります。YOLOv9のGitHubコードベースを利用する研究者は複雑な環境構築や手動でのスクリプト作成を強いられますが、YOLO26は直感的なUltralytics Python APIに完全に統合されています。
合理化された API の例#
最先端のYOLO26モデルのトレーニングには、わずか数行のPythonコードしか必要ありません:
from ultralytics import YOLO
# Load the latest native end-to-end YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model effortlessly with the default MuSGD optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export natively to ONNX format in a single command
model.export(format="onnx")比類のないタスク汎用性#
標準的なオブジェクト検出主にカスタマイズされているYOLOv9とは異なり、YOLO26は、膨大な数のコンピュータビジョンタスクを標準でネイティブにサポートしています。このアーキテクチャには、多様なアプリケーション向けの特定の機能強化が含まれています:
- インスタンスセグメンテーション: 完璧なピクセルレベルのマスクを実現するために、特化したセマンティックセグメンテーション損失とマルチスケールプロトを備えています。
- 姿勢推定: 骨格のキーポイントを極めて高い精度で追跡するために、残差対数尤度推定(RLE)を統合しています。
- 方向付きバウンディングボックス(OBB): 空中画像における回転したオブジェクト検出の境界問題を解決するために特別に設計された、特化した角度損失関数が含まれています。
- 画像分類: ImageNetの標準に基づいた、画像全体の堅牢なカテゴリ分け。
すべてのYOLO26モデルは、Ultralytics Platformとのシームレスな統合の恩恵を受けており、組み込みのデータセットラベリング、アクティブラーニング、および即時のデプロイパイプラインを提供します。
実際のアプリケーション#
これらのモデルの選択は、多くの場合、それらがデプロイされる環境によって決まります。
IoT およびエッジロボティクス#
ロボティクス、自律型ドローン、およびスマートホームIoTデバイスにとって、YOLO26は議論の余地のないチャンピオンです。ProgLoss + STALの統合により、高高度ドローンからの農業モニタリングに不可欠な小物体認識の大幅な改善がもたらされます。43%高速なCPU推論とNMSフリーのデザインと相まって、YOLO26は専用GPUなしのハードウェアでもスムーズに動作します。
学術研究および勾配分析#
YOLOv9は、学術界において依然として非常に尊敬されているモデルです。勾配フローの理論的限界を調査している研究者や、PGIの概念に基づいてカスタムのPyTorchレイヤーを構築しようとしている研究者にとって、YOLOv9のコードベースはディープラーニング理論の探索のための優れた基盤となるでしょう。
高速製造パイプライン#
高速コンベアベルトでの自動欠陥検出のような産業環境では、YOLO26モデルの非常に高速なTensorRT速度により、フレームのドロップが一切発生せず、品質保証システムの処理能力が最大化されます。
ユースケースと推奨事項#
YOLOv9とYOLO26のどちらを選ぶかは、特定のプロジェクト要件、デプロイの制約、およびエコシステムの好みに依存します。
YOLOv9を選択すべき場合#
YOLOv9は以下の場合に強力な選択肢となります:
- 情報ボトルネック研究: Programmable Gradient Information (PGI)およびGeneralized Efficient Layer Aggregation Network (GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: トレーニング中の深層ネットワーク層における情報損失の理解と軽減に重点を置いた研究。
- 高精度検出ベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の強力なCOCOベンチマークパフォーマンスが必要とされるシナリオ。
YOLO26を選ぶべき時#
YOLO26は以下のような場合に推奨されます。
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
結論#
両モデルとも、オープンソースコミュニティにとって信じられないほどの飛躍を意味しています。YOLOv9は勾配フローに関する重要な理論的改善をもたらし、今後のアーキテクチャのインスピレーションとなるでしょう。しかし、速度、精度、デプロイの容易さの完璧なバランスを求める現代の開発者、スタートアップ、企業チームにとっては、Ultralytics YOLO26 が明確な推奨事項となります。
NMSを排除し、強力なMuSGDオプティマイザを導入し、検出、セグメンテーション、姿勢推定にわたる比類のないツールスイートを提供することで、YOLO26はコンピュータビジョンプロジェクトが今日利用可能な最も信頼性が高く、将来を見据えたフレームワーク上で構築されることを保証します。