YOLO11とYOLOv7の比較#
コンピュータービジョンの分野は急速に進化を続けており、リアルタイム物体検出はAIアプリケーションの最前線にあります。プロジェクトに適したアーキテクチャを選ぶには、速度、精度、デプロイの容易さの間にある複雑なトレードオフを検討する必要があります。このガイドでは、代表的な2つのアーキテクチャであるUltralytics YOLO11とYOLOv7を包括的に技術比較します。
モデルの背景と技術的な詳細#
どちらのモデルもディープラーニングコミュニティに大きな影響を与えてきましたが、開発思想や時代背景は異なります。
YOLO11の詳細:
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- ドキュメント: https://docs.ultralytics.com/models/yolo11
YOLOv7の詳細:
- 著者: Chien-Yao Wang、Alexey Bochkovskiy、Hong-Yuan Mark Liao
- 組織: 台湾、中央研究院情報科学研究所
- 日付: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- ドキュメント: https://docs.ultralytics.com/models/yolov7
アーキテクチャの違い#
内部の仕組みを分析すると、どちらの検出器も最先端の手法を採用していますが、構造上の基盤は異なります。
YOLOv7では、Extended Efficient Layer Aggregation Networks(E-ELAN)の概念が導入されました。このアーキテクチャは、元の勾配経路を損なわずにネットワークの学習能力を継続的に高めることを目的としており、その重要なブレークスルーは研究論文で報告されています。YOLOv7は、トレーニング時に構造的な再パラメーター化と堅牢な「bag-of-freebies」手法に大きく依存しており、推論コストを増やさずにCOCOデータセットでの全体的な精度を高めます。
一方、YOLO11は高度に最適化されたUltralyticsアーキテクチャを基盤としています。パラメーター数を抑えた、より洗練された特徴抽出パイプラインを重視しており、トレーニング時のメモリ使用量を削減します。YOLO11は計算リソース(FLOPs)を抑えながら、より大規模なモデルと同等以上の検出精度を実現し、優れた性能バランスを達成しています。さらに、YOLO11はより幅広いタスクをネイティブにサポートするため、現代のコンピュータービジョンアプリケーションに適した汎用性の高い選択肢です。
Ultralytics YOLOモデルの際立った特徴の1つは、他の最先端モデルと比較してトレーニング時に必要なメモリが少ないことです。そのため、開発者はコンシューマー向けのPyTorch対応ハードウェアで高性能なネットワークをトレーニングできます。
パフォーマンスと指標の比較#
実環境での実用性を正確に把握するには、平均適合率(mAP)、推論速度、モデルのパラメーター数、計算複雑度(FLOPs)などの指標を評価することが不可欠です。次の表では、YOLO11の各スケールのバリエーションと、より大規模なYOLOv7モデルを比較しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
ご覧のとおり、YOLO11xはYOLOv7xの53.1 mAPに対して、より高い54.7 mAPを達成しながら、パラメーター数を大幅に抑えています(56.9M対71.3M)。これは、YOLO11のアーキテクチャ効率が優れていることを示しています。
トレーニング効率とエコシステムの使いやすさ#
この2つのアーキテクチャを大きく分ける特徴の1つが、開発者エクスペリエンスと、それを取り巻くエコシステムです。
YOLOv7は、基本的に学術研究向けのリポジトリです。モデルのトレーニングでは、複雑な環境構築、依存関係の手動管理、長いコマンドライン引数の使用が必要になることがよくあります。最先端の実験には対応していますが、YOLOv7のGitHubリポジトリのコードをカスタムの本番環境に適応させるには、時間がかかる場合があります。
YOLO11は使いやすさを一新します。シームレスなエンドツーエンドのワークフローを提供する、包括的で継続的にメンテナンスされているエコシステムであるUltralytics Platformに完全に統合されています。データのアノテーションやローカルでのトレーニングからデプロイまで、統一されたPython APIとシンプルなコマンドラインインターフェースが全プロセスを効率化します。
コードの比較#
YOLO11で物体検出モデルをトレーニングするために必要なコードは数行だけで、導入のハードルを大幅に下げられます。
from ultralytics import YOLO
# 事前トレーニング済みのYOLO11 smallモデルを読み込みます
model = YOLO("yolo11s.pt")
# 統一APIを使って簡単にモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# ONNX形式にすばやくエクスポートします
model.export(format="onnx")一方、一般的なYOLOv7のトレーニングコマンドは次のようになり、パスや設定ファイル、bashスクリプトを慎重に準備する必要があります。
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'YOLO11は高い汎用性も備えています。YOLOv7では、検出以外のタスク(姿勢推定やセグメンテーションなど)をサポートするために、まったく異なるコードベースや大幅な変更が必要ですが、YOLO11は単一の一貫したフレームワークで物体検出、インスタンスセグメンテーション、画像分類、姿勢推定、方向付きバウンディングボックス(OBB)検出に対応します。
実環境での用途と適したユースケース#
YOLOv7とYOLO11のどちらを選ぶかは、プロジェクトの範囲とデプロイ時の制約によって決まります。
YOLOv7を検討するケース:
- レガシーモデルのベンチマーク:勾配経路設計を研究する学術研究者は、新しい畳み込みニューラルネットワークを評価するためのベースラインとしてYOLOv7を使用できます。
- 既存のカスタムパイプライン:YOLOv7独自のバウンディングボックスデコードロジックを中心に構築された、高度にカスタマイズ済みのC++またはCUDAパイプラインを運用しているチーム。
YOLO11を選ぶケース:
- 商用の本番環境:スマート小売や医療診断のアプリケーションでは、YOLO11の継続的にメンテナンスされているコードベースと高い安定性が大きなメリットになります。
- リソースが限られた環境:YOLO11nは軽量なため、ONNXを介してモバイルデバイスやエッジデバイスにデプロイする用途に特に適しています。
- マルチタスクプロジェクト:1つのアプリケーションで人物を認識し、その骨格(姿勢)を推定し、人物が持つ物体をセグメンテーションする必要がある場合、YOLO11は統一されたソリューションを提供します。
最先端:YOLO26で切り拓く未来#
YOLO11は非常に堅牢な選択肢ですが、人工知能のイノベーションは絶えず進化しています。現在、新しいプロジェクトに取り組むエンジニアには、Ultralytics YOLO26をぜひご検討ください。
2026年1月にリリースされたYOLO26は、エンドツーエンドのNMSフリーデザイン(nms=False)を導入し、非最大値抑制の後処理に伴うレイテンシーのボトルネックを解消します。さらに、YOLO26はLLMのトレーニング手法に着想を得た革新的なMuSGDオプティマイザーを採用し、収束を高速化します。ProgLoss + STALによる損失関数の改善と、DFLの削除による最大43%のCPU推論高速化を実現したYOLO26は、エッジコンピューティングに特化して最適化されており、現在のビジョンAIの最高峰です。
特化した別の構造に関心があるユーザーは、TransformerベースのRT-DETRや、動的なオープンボキャブラリー対応のYOLO-Worldモデルも検討すると、さまざまなコンピュータービジョンのデプロイで有益な結果が得られる場合があります。