YOLO11 対 YOLOv7#
コンピュータービジョンの分野は急速に進化を続けており、リアルタイム物体検出は依然としてAIアプリケーションの最前線に位置しています。プロジェクトに適したアーキテクチャを選択するには、速度、精度、デプロイの容易さという複雑なトレードオフを検討する必要があります。本ガイドでは、主要な2つのアーキテクチャ、Ultralytics YOLO11とYOLOv7を包括的に技術比較します。
モデルの背景と技術的詳細#
どちらのモデルもディープラーニングコミュニティに大きな影響を与えていますが、異なる開発思想と時代に基づいています。
YOLO11の詳細:
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- ドキュメント: https://docs.ultralytics.com/models/yolo11
YOLOv7の詳細:
- 著者: Chien-Yao Wang、Alexey Bochkovskiy、Hong-Yuan Mark Liao
- 組織: 台湾中央研究院情報科学研究所
- 日付: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- Docs: https://docs.ultralytics.com/models/yolov7
アーキテクチャの違い#
内部の仕組みを分析すると、どちらの検出器も最先端の概念を採用していますが、構造的な基盤は異なります。
YOLOv7では、拡張効率的レイヤー集約ネットワーク(E-ELAN)の概念が導入されました。このアーキテクチャは、元の勾配経路を壊すことなくネットワークの学習能力を継続的に向上させるよう設計されており、研究論文で報告された重要なブレークスルーです。YOLOv7は、トレーニング中の構造的再パラメーター化と堅牢な「bag-of-freebies」手法に大きく依存しており、推論コストを増加させることなくCOCOデータセットでの全体的な精度を向上させています。
一方、YOLO11は高度に最適化されたUltralyticsアーキテクチャを基盤に構築されています。より洗練された特徴抽出パイプラインに重点を置き、パラメーター数を削減することで、トレーニング中のメモリ使用量を抑えています。YOLO11は、より少ない計算リソース(FLOPs)を使用しながら、より大規模なモデルと同等以上の検出精度を実現し、非常に優れた性能バランスを達成しています。さらに、YOLO11は本来、より幅広いタスクをサポートしているため、最新のコンピュータービジョンアプリケーションに適した非常に汎用性の高い選択肢です。
Ultralytics YOLOモデルの大きな特徴の1つは、他の最先端モデルと比較してトレーニング時に必要なメモリが少ないことです。これにより、開発者は一般向けのPyTorchハードウェア上で高性能なネットワークをトレーニングできます。
パフォーマンスとメトリクスの比較#
実環境での実用性を正確に評価するには、平均適合率(mAP)、推論速度、モデルパラメーター数、計算量(FLOPs)などの指標を評価することが不可欠です。次の表では、YOLO11のスケーリングバリアントと、より大規模なYOLOv7モデルを比較しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
ご覧のとおり、YOLO11xはYOLOv7xの53.1 mAPに対して、より高い54.7 mAPを達成しています。一方で、パラメーター数は大幅に少なくなっています(56.9M対71.3M)。これは、YOLO11の優れたアーキテクチャ効率を示しています。
トレーニング効率とエコシステムの使いやすさ#
この2つのアーキテクチャを分ける最も大きな特徴の1つは、開発者エクスペリエンスと周辺エコシステムです。
YOLOv7は本質的に学術研究用のリポジトリです。モデルのトレーニングには、複雑な環境構築、依存関係の手動管理、長いコマンドライン引数の使用が必要になることがよくあります。最先端の実験には対応していますが、YOLOv7 GitHubリポジトリのコードをカスタムの本番環境に適応させるには、時間がかかる場合があります。
YOLO11は使いやすさを完全に再定義します。包括的で適切に保守されたエコシステムであるUltralytics Platformに完全統合され、シームレスなエンドツーエンドのワークフローを提供します。データアノテーション、ローカルトレーニングからデプロイまで、統一されたPython APIとシンプルなコマンドラインインターフェースによって、プロセス全体が効率化されます。
コード比較#
YOLO11で物体検出モデルをトレーニングするために必要なコードは数行だけで、導入の障壁を大幅に下げられます。
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Quickly export to ONNX format
model.export(format="onnx")一方、一般的なYOLOv7のトレーニングコマンドは次のようになり、パス、設定ファイル、bashスクリプトを慎重に準備する必要があります。
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'YOLO11は非常に高い汎用性も備えています。YOLOv7では、検出以外のタスク(姿勢推定やセグメンテーションなど)をサポートするために、まったく異なるコードベースや大幅な変更が必要ですが、YOLO11では単一の統合フレームワークを通じて、物体検出、インスタンスセグメンテーション、画像分類、姿勢推定、Oriented Bounding Box(OBB)検出に対応できます。
YOLO11をTensorRTやOpenVINOなどの形式にエクスポートするには、1つのコマンドを実行するだけで済み、レガシーモデルで一般的に発生するオペレーターサポートの問題を軽減できます。
実環境でのアプリケーションと最適なユースケース#
YOLOv7とYOLO11のどちらを選択するかは、プロジェクトの範囲とデプロイの制約によって完全に決まります。
YOLOv7を検討する場合:
- レガシーモデルのベンチマーク: 勾配経路の設計を研究する学術研究者は、新しい畳み込みニューラルネットワークを評価するためのベースラインとしてYOLOv7を使用できます。
- 既存のカスタムパイプライン: YOLOv7独自のバウンディングボックスデコードロジックを中心に構築された、高度にカスタマイズされたC++またはCUDAパイプラインを持つチーム。
YOLO11を選択する場合:
- 商用環境: スマートリテールや医療診断のアプリケーションは、YOLO11の保守されたコードベースと高い安定性から大きなメリットを得られます。
- リソースに制約のある環境: YOLO11nの軽量なフットプリントは、ONNXを介したモバイルデバイスやエッジデバイスへのデプロイに特に適しています。
- マルチタスクプロジェクト: 1つのアプリケーションで人物を特定し、その骨格(姿勢)をマッピングし、持っている物体をセグメントする必要がある場合、YOLO11は統合ソリューションを提供します。
最先端: YOLO26で前進する#
YOLO11は非常に堅牢な選択肢ですが、人工知能のイノベーションが止まることはありません。現在、新しいプロジェクトを開始するエンジニアには、**Ultralytics YOLO26**を検討することを強くお勧めします。
2026年1月にリリースされたYOLO26は、エンドツーエンドのNMS-Free設計を導入し、Non-Maximum Suppressionのポストプロセスに伴うレイテンシーのボトルネックを完全に排除します。さらに、YOLO26はLLMのトレーニング手法に着想を得た革新的なMuSGD Optimizerを組み込み、より高速な収束を実現します。ProgLoss + STALによる的を絞った損失改善と、DFLの削除による最大43%高速なCPU推論により、YOLO26はエッジコンピューティング向けに特化して最適化されており、現在のビジョンAIの最高峰を表しています。
専門的な代替構造に関心があるユーザーは、TransformerベースのRT-DETRや、動的なオープンボキャブラリーのYOLO-Worldモデルを検討することで、多様なコンピュータービジョンのデプロイに有益な結果を得られる可能性があります。