YOLOv10とYOLO26の比較#
コンピュータービジョンの分野では近年、目覚ましい進歩が見られ、複雑で後処理に大きく依存するアーキテクチャから、合理化されたエンドツーエンドモデルへと移行しています。本技術比較では、この進化における2つの主要なマイルストーン、学術的ブレークスルーであるYOLOv10と、最先端かつエンタープライズ対応のYOLO26を詳しく検証します。アーキテクチャ、トレーニング手法、実環境でのデプロイ能力を比較することで、開発者は次のビジョンAIアプリケーションを構築する際に、十分な情報に基づいて判断できます。
YOLOv10:エンドツーエンド物体検出の先駆け#
- 著者: Ao Wang、Hui Chen、Lihao Liu、ほか
- 組織: 清華大学
- 日付: 2024-05-23
- リンク: arXiv Paper | GitHub Repository
2024年半ばにリリースされたYOLOv10は、リアルタイム物体検出における最も根強いボトルネックの1つである非最大抑制(NMS)に取り組むことで、学術的なコンピュータービジョン研究を大きく前進させました。従来の物体検出器は、冗長なバウンディングボックスを除外するためにNMSに大きく依存しており、推論時のレイテンシが変動するとともに、エッジデバイスへのデプロイが複雑になっていました。
清華大学のチームは、NMSを使用しないトレーニングのために、一貫性のあるデュアルアサインメント戦略を導入しました。これにより、モデルは後処理によるフィルタリングステップを必要とせずにバウンディングボックスを正確に予測でき、推論レイテンシが直接的に改善され、ハードウェアアクセラレーターへのデプロイの障壁が低くなりました。標準的な検出タスクでは非常に効率的である一方、このモデルは主にバウンディングボックスの予測に重点を置いており、インスタンスセグメンテーションやポーズ推定など、より複雑なタスクにはネイティブ対応していませんでした。
YOLO26:エッジおよびクラウドビジョンAIの新たな標準#
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2026-01-14
- リンク: GitHub Repository | Ultralytics Platform
先行モデルで確立されたNMSフリーの概念を基盤として、新たにリリースされたYOLO26は、パフォーマンスと汎用性の頂点を示します。学術研究とエンタープライズグレードのデプロイの両方を想定して設計されており、エンドツーエンドのNMSフリー設計をネイティブに組み込むことで、NMSの後処理を完全に排除し、対応するすべてのハードウェアでより高速かつシンプルなデプロイを実現します。
YOLO26では、画期的なアーキテクチャ上の改善がいくつか導入されています。分布フォーカル損失(DFL)を削除することで、モデルのエクスポートプロセスが大幅に簡素化され、低消費電力のエッジデバイスとの互換性が向上します。これらの構造上の変更に加えて、YOLO26はCPU推論を最大43%高速化しており、GPUアクセラレーションを利用できない場合があるIoTやロボティクスのアプリケーションに最適な選択肢となっています。
さらに、MuSGD Optimizerの使用により、トレーニングの安定性と収束速度が革新されました。これは、LLMのトレーニング手法に着想を得たSGDとMuonのハイブリッドです。ProgLoss + STALなどの高度な損失関数と組み合わせることで、YOLO26は小物体認識を大幅に改善します。また、セグメンテーション向けのマルチスケールプロトタイピング、ポーズ推定向けの残差対数尤度推定(RLE)、方向付きバウンディングボックス(OBB)検出における境界の問題を解決する専用角度損失など、タスク固有の機能強化も導入されています。
コンピュータービジョンのワークフローを拡張したいチーム向けに、Ultralytics PlatformはYOLO26とのシームレスな統合を提供します。広範なMLOpsインフラストラクチャを必要とせず、直感的なデータアノテーション、自動化されたクラウドトレーニング、ワンクリックのデプロイオプションを利用できます。
技術パフォーマンス比較#
これらのモデルを評価する際には、精度、モデルサイズ、推論速度のバランスが重要です。以下の表では、標準のCOCOデータセットで評価した、さまざまなスケールにおける両モデルファミリーのパフォーマンスを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
データは、新しいアーキテクチャが進化上の優位性を持つことを明確に示しています。YOLO26は、非常に競争力の高い推論速度を維持しながら、すべてのサイズ層でより高いmAP(平均適合率)を達成します。YOLO26でDFLを削除したことは、特に優れたCPU ONNXパフォーマンスに寄与しています。この指標は、以前の世代がしばしば苦戦していたものです。
トレーニング手法とエコシステム#
モデルの有用性は、それを支えるエコシステムの有用性に左右されます。YOLOv10はPyTorchを基盤とする優れた学術実装を提供しましたが、基本的な検出以外のタスクでは手動設定が必要になることが多くありました。
対照的に、YOLO26は十分に保守されたUltralyticsエコシステムに完全統合されています。これにより、RT-DETRのようなTransformerベースのモデルと比較して、トレーニング中に必要なメモリが大幅に少なくなり、研究者はコンシューマー向けハードウェア上で最先端のネットワークをトレーニングできます。使いやすさは他に類を見ないもので、データ拡張、ハイパーパラメータチューニング、ロギングを自動的に処理する統合APIを提供します。
コード例:YOLO26のトレーニング#
汎用性が高く精度に優れたモデルのトレーニングは、数行のPythonコードだけで実行できます。
from ultralytics import YOLO
# Load the highly optimized YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model efficiently with automatic memory management
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
)
# Export natively to TensorRT without NMS complexities
model.export(format="engine")実環境でのアプリケーションとユースケース#
適切なアーキテクチャの選択は、デプロイ時の制約に完全に依存します。
高速エッジコンピューティング#
マイクロコントローラー、ロボティクス、または旧式のモバイルデバイスへの迅速なデプロイが必要なアプリケーションでは、YOLO26のCPU推論43%高速化により、決定的な選択肢となります。NMSフリーかつDFLフリーのアーキテクチャは、OpenVINOやTensorRTなどの形式にシームレスに変換でき、スマートシティインフラストラクチャにおけるリアルタイム動画分析に最適です。
高度なマルチタスクビジョン#
YOLOv10は純粋なバウンディングボックス検出に優れていますが、高度な視覚理解を必要とするプロジェクトではYOLO26が適しています。医用画像におけるインスタンスセグメンテーションから、スポーツ分析向けの高精度なポーズ推定まで、YOLO26は多様な分野で優れた精度を実現するタスク固有の損失関数を提供します。
堅牢なオープンボキャブラリー検出がプロジェクトに必要な場合は、YOLO-Worldを検討してください。レガシーパイプラインを維持しているユーザーにとっては、YOLO11もUltralyticsフレームワーク内で完全にサポートされている強力な代替手段です。
ユースケースと推奨事項#
YOLOv10とYOLO26のどちらを選択するかは、具体的なプロジェクト要件、デプロイ時の制約、エコシステムに関する選好によって決まります。
YOLOv10を選択する場合#
YOLOv10は次の用途に適しています:
- NMSフリーのリアルタイム検出: Non-Maximum Suppressionを使用しないエンドツーエンド検出のメリットを活かし、デプロイの複雑さを軽減できるアプリケーション。
- 速度と精度のバランスの取れたトレードオフ: さまざまなモデルスケールで、推論速度と検出精度の優れたバランスが求められるプロジェクト。
- レイテンシが一貫したアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が重要なデプロイシナリオ。
YOLO26を選ぶタイミング#
YOLO26は次の用途に推奨されます:
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
まとめ#
YOLOv10からYOLO26への移行は、学術的な概念実証から本番環境対応のエンタープライズソリューションへの重要な転換を示しています。先駆的なNMSフリー設計を採用し、MuSGD Optimizer、ProgLoss、合理化されたエッジ互換性によって強化することで、YOLO26はリアルタイムコンピュータービジョンで可能なことの新たなベンチマークを確立します。速度、精度、使いやすさの最適なバランスを実現したい開発者にとって、YOLO26は最終的な推奨モデルとして際立っています。