YOLO11 vs YOLOv10#
リアルタイムコンピュータービジョンの世界は絶えず進化しており、新しいアーキテクチャによって、エッジデバイスとクラウドインフラストラクチャの双方で可能なことの限界が押し広げられています。本稿では、領域を代表する2つのモデル、Ultralytics YOLO11とYOLOv10の違いを詳細な技術分析で掘り下げます。どちらも物体検出の能力を大きく飛躍させていますが、性能を実現するために根本的に異なるアーキテクチャ思想を採用しています。
YOLO11アーキテクチャを詳しく見る#
YOLO11の詳細:
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- ドキュメント: https://docs.ultralytics.com/models/yolo11
多用途で強力なモデルとして登場したYOLO11は、コンピュータービジョンとAIにおける長年の基礎研究を土台に構築されています。YOLO11の中核となる設計思想は、複数のコンピュータービジョンタスクにわたる豊かな特徴表現と高い汎用性を軸としています。
YOLO11における特に注目すべき改善の1つが、C3k2 Blockの実装です。この改良されたボトルネックモジュールは、ネットワーク全体の勾配フローを最適化し、高い精度を維持しながらパラメーター効率を大幅に向上させます。さらに、YOLO11は強化された空間アテンション機構を採用しており、小さな物体や部分的に遮蔽された物体の識別に重要な役割を果たします。そのため、航空画像のユースケースや詳細な医用画像解析に非常に適しています。
YOLO11はアンカーフリー設計を採用しており、ハイパーパラメーター調整の複雑さを軽減し、多種多様なカスタムデータセットに対して堅牢な汎化を可能にします。さらに、Transformerベースのアーキテクチャと比較して、トレーニング中に必要なメモリが大幅に少ないため、研究者は一般的なコンシューマーハードウェア上で大規模モデルを効率的にトレーニングできます。
YOLOv10アーキテクチャを詳しく見る#
YOLOv10の詳細:
- 著者: Ao Wang、Hui Chen、Lihao Liu、ほか
- 所属: 清華大学
- 日付: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- Docs: https://docs.ultralytics.com/models/yolov10
清華大学の研究者によって開発されたYOLOv10は、YOLOファミリーにおけるエンドツーエンドの先駆けとして注目を集めました。YOLOv10の最大の特徴は、NMS-Free Training手法です。トレーニング段階で一貫したデュアルアサインメントを採用することで、モデルは各物体につき1つのバウンディングボックスだけを自然に予測します。この画期的な手法により、推論時に非最大抑制 (NMS)が完全に不要になります。非最大抑制は、これまでデプロイメントパイプラインでレイテンシーのボトルネックを引き起こしていた後処理ステップです。
このアーキテクチャでは、効率と精度を包括的に両立する設計戦略も導入されています。空間とチャネルを分離したダウンサンプリングや、ネットワーク各ステージの冗長性を選択的に削減するランク誘導型のブロック設計を取り入れています。その結果、平均適合率 (mAP)を大きく犠牲にすることなく、FLOPsと計算オーバーヘッドを削減できます。1ミリ秒の差も重要なリアルタイムアプリケーションでは、NMSの削除によって、エッジAIデバイスに非常に適した決定論的な推論グラフが実現します。
性能指標とベンチマーク#
これら2つのモデルを評価する際は、精度、パラメーター数、速度のバランスに注目します。以下の表では、COCOデータセット上で、さまざまな規模における両モデルの比較を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
YOLOの性能指標から分かるように、YOLO11は一般に、各バリアントでやや高いmAPスコアを達成しており、特に大規模モデルでその傾向が顕著です。YOLOv10のNMSフリー設計は、エンドツーエンドの推論時間を非常に安定させますが、YOLO11もNVIDIAハードウェア上でTensorRTを使用して最適化すると、非常に優れたスループットを実現します。
モデルをデプロイメントに備える際は、最適化された形式へのエクスポートが重要です。YOLO11とYOLOv10はいずれも、Ultralyticsフレームワークを使用してONNXやTensorRTなどの形式にシームレスにエクスポートできます。手順については、モデルのデプロイメントオプションに関するガイドをご覧ください。
Ultralyticsエコシステムの優位性#
単独の性能指標も重要ですが、機械学習プロジェクトの実用上の成功を左右するのは、それを取り巻くフレームワークです。ここで、Ultralyticsエコシステムにネイティブに統合されたYOLO11の真価が発揮されます。
Ultralytics Platformは、非常に合理化されたユーザーエクスペリエンスを提供します。シンプルで統一されたPython APIにより、開発者は基本的なバウンディングボックスを超えるタスクにも対応できます。YOLO11は、インスタンスセグメンテーション、ポーズ推定、画像分類、回転バウンディングボックス (OBB)検出を標準でネイティブにサポートしています。この非常に高い汎用性は、専門的な研究リポジトリでは不足していることが多い特徴です。
さらに、このエコシステムは、充実したドキュメントと活発なコミュニティサポートに支えられています。実験トラッキング用のWeights & Biasesや、Intelハードウェア最適化用のOpenVINOなどのツールとの統合が、ライブラリに直接組み込まれています。モデルのトレーニングに必要なボイラープレートコードは最小限で済み、RT-DETRのような大規模なTransformerモデルよりも少ないCUDAメモリで動作する、非常に効率的なトレーニングプロセスのメリットを得られます。
実践的なコード例#
Ultralyticsでのトレーニングと推論の実行は、可能な限り直感的に行えるよう設計されています。同一のAPIでYOLO11とYOLOv10の両方を簡単に扱えます。
from ultralytics import YOLO
# Initialize the model (YOLO11n or YOLOv10n)
model = YOLO("yolo11n.pt")
# Train the model efficiently on a custom dataset
# Ultralytics automatically handles hyperparameters and memory optimization
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Run inference on an image
inference_results = model("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
inference_results[0].show()ユースケースと推奨事項#
YOLO11とYOLOv10のどちらを選ぶかは、具体的なプロジェクト要件、デプロイメント上の制約、エコシステムに対する好みによって決まります。
YOLO11を選ぶタイミング#
YOLO11は、次の用途に適しています。
- 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最重要となる、Raspberry PiやNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
- マルチタスクビジョンアプリケーション: 単一の統合フレームワーク内で、検出、セグメンテーション、ポーズ推定、OBBを必要とするプロジェクト。
- **迅速なプロトタイピングとデプロイメント:**合理化されたUltralytics Python APIを使用して、データ収集から本番環境まで迅速に移行する必要があるチーム。
YOLOv10を選択する場合#
YOLOv10は次の用途に推奨されます。
- NMSフリーのリアルタイム検出: Non-Maximum Suppressionを使用しないエンドツーエンド検出のメリットを活かし、デプロイの複雑さを軽減できるアプリケーション。
- 速度と精度のバランスの取れたトレードオフ: さまざまなモデルスケールで、推論速度と検出精度の優れたバランスが求められるプロジェクト。
- レイテンシが一貫したアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が重要なデプロイシナリオ。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
次世代モデル: YOLO26#
YOLOv10が革新的なNMSフリーパラダイムを導入し、YOLO11がマルチタスクの汎用性を極めた一方で、AIの分野は急速に進化しています。現在、新たに本番環境へのデプロイメントを始める開発者には、Ultralytics YOLO26を検討することを強くおすすめします。
2026年1月にリリースされたYOLO26は、両者の長所を融合しています。YOLOv10が先駆けたエンドツーエンドNMSフリー設計をネイティブに採用し、デプロイメントパイプラインを大幅に簡素化するとともに、一貫したレイテンシーを実現します。さらに、YOLO26はエッジコンピューティングに特化した最適化を取り入れています。DFLの削除(Distribution Focal Lossの削除)を実行することで、アーキテクチャはより容易なエクスポートを保証し、従来のモデルと比較してCPU推論を最大43%高速化します。そのため、低消費電力のIoTデバイスやモバイルアプリケーションに最適な選択肢となります。
YOLO26は、革新的なMuSGD Optimizer(最先端のAI研究に着想を得たハイブリッドオプティマイザー)を通じて、大規模言語モデル (LLM)のトレーニング安定性をコンピュータービジョンにもたらします。ProgLoss + STALの損失関数と組み合わせることで、YOLO26は小さな物体に対して比類のない精度を実現します。これは、詳細な交通映像検出や複雑なロボット自動化に不可欠です。
まとめ#
適切なビジョンモデルの選択は、具体的な運用上の制約によって決まります。YOLOv10は学術分野における重要なマイルストーンであり、検出パイプラインからNMSを効果的に排除できることを実証しました。しかし、性能、包括的なタスクの汎用性、シームレスなデプロイメントツールのバランスを重視する場合、YOLO11は堅牢でエンタープライズ対応のソリューションを提供します。
最先端の技術、つまりエンドツーエンドのシンプルさと極めて高速なエッジ性能の両方を求めるエンジニアには、最新のYOLO26への移行を強くおすすめします。包括的なUltralytics Platformを活用することで、十分にメンテナンスされ、高効率で、将来性のある基盤の上にプロジェクトを構築できます。