Ultralytics YOLO27:

YOLOv10とYOLO11の比較#

コンピュータビジョンの分野は常に進化しており、新しいアーキテクチャによってリアルタイム処理の可能性が広がり続けています。この急速に変化する分野に取り組む開発者や研究者にとって、最先端モデル間の微妙な違いを理解することは重要です。この詳細な比較では、高い性能を持つ2つの物体検出フレームワーク、YOLOv10Ultralytics YOLO11の技術的な違い、性能上のトレードオフ、適したユースケースを検証します。

どちらのモデルもベンチマークデータセットで優れた結果を達成していますが、基盤となる設計思想とエコシステムとの統合性は大きく異なります。アーキテクチャを調べることで、どちらのソリューションがデプロイ環境の制約やプロジェクトの目標に最も適しているかを特定できます。

YOLOv10:NMS不要のエンドツーエンド検出を先駆けて実現#

2024年春にリリースされたYOLOv10は、後処理に伴うレイテンシのオーバーヘッドに直接対処することで、従来の物体検出パイプラインに新しいアプローチを導入しました。

YOLOv10の際立ったイノベーションは、一貫したデュアルアサインメント戦略です。これにより、NMS不要のトレーニングが可能になります。従来の物体検出器は、重複するバウンディングボックス予測を除外するために、Non-Maximum Suppression (NMS)に大きく依存しています。このステップを削除することで、YOLOv10は真のエンドツーエンド検出を実現し、推論レイテンシを短縮します。また、カスタムNMS処理の最適化が非常に難しいNeural Processing Units (NPUs)などのハードウェアアクセラレータへのデプロイも簡素化します。

YOLOv10の詳細について学ぶ

YOLO11:エコシステム主導の汎用性と性能#

同年の後半にリリースされたYOLO11は、Ultralyticsモデルファミリーを継続的に洗練したものであり、速度、精度、開発者エクスペリエンスの最適なバランスに重点を置いています。

YOLO11は本番環境向けに設計されています。標準的なバウンディングボックス検出に優れている一方で、本当の強みは汎用性にあります。主に物体検出に焦点を当てたYOLOv10とは異なり、YOLO11は統一されたアーキテクチャを使用して、インスタンスセグメンテーション姿勢推定画像分類Oriented Bounding Box (OBB)タスクをネイティブにサポートします。トレーニング中のメモリ要件が非常に低いため、より大規模なTransformerベースのアーキテクチャと比較して、コンシューマー向けGPUを使用するチームでも利用しやすくなっています。

パフォーマンスとメトリクスの比較#

これらのモデルを並べて比較する際は、COCOデータセットなどの標準ベンチマークで、異なるスケールのバリアントがどのように性能を発揮するかを確認することが重要です。

以下の表は性能の違いを示しています。YOLO11は、非常に競争力の高いTensorRT推論速度を維持しながら、ほとんどのサイズカテゴリでmAPにおいてYOLOv10を上回ることが多くなっています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター数
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
ハードウェアアクセラレーション

これらの高速な推論速度をローカルで再現するには、Intel CPU向けのOpenVINOやNVIDIA GPU向けのTensorRTなど、最適化された形式にモデルをエクスポートしてください。

アーキテクチャの詳細#

トレーニング手法と効率#

YOLOv10のアーキテクチャは、計算上の冗長性の削減を重視しています。効率と精度を総合的に考慮した戦略によってバックボーンとネックの設計を最適化し、Tsinghua Universityの著者らは、以前のバージョンと比較して、中規模モデル(YOLOv10mなど)のパラメーター数を大幅に削減しました。

ただし、トレーニング効率はUltralyticsモデルの大きな特徴です。YOLO11は、高度に洗練されたultralytics Pythonパッケージを利用し、複雑なハイパーパラメータチューニングを抽象化します。このフレームワークは、高度なデータ拡張、学習率スケジューリング、マルチGPU分散トレーニングを標準で自動処理します。YOLO11のアーキテクチャは優れた勾配フローも実現しており、トレーニング段階での収束の高速化とVRAM使用量の削減につながっています。

使いやすさとエコシステムの優位性#

企業での採用における重要な要素は、適切に保守されたエコシステムです。研究リポジトリは画期的な成果をもたらす一方で、論文の初回公開後に休止状態になることが少なくありません。YOLO11を支えるUltralyticsエコシステムは、シームレスなエンドツーエンドの開発者エクスペリエンスを提供します。

実験追跡用のWeights & Biasesやデータセット管理用のRoboflowなどのツールとシームレスに統合できるため、YOLO11はプロトタイプから本番環境への移行を加速します。合理化されたAPIによって、わずか数行のコードでモデルのトレーニングとエクスポートが可能なことから、使いやすさが明確に表れています。

from ultralytics import YOLO

# Initialize the YOLO11 small model
model = YOLO("yolo11s.pt")

# Train the model efficiently with optimized memory handling
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="0")

# Export to ONNX format for deployment flexibility
model.export(format="onnx")

ユースケースと推奨事項#

YOLOv10とYOLO11のどちらを選ぶかは、具体的なプロジェクト要件、デプロイ環境の制約、エコシステムに関する選好によって決まります。

YOLOv10を選択する場合#

YOLOv10は次の用途に適しています:

  • NMSフリーのリアルタイム検出: Non-Maximum Suppressionを使用しないエンドツーエンド検出のメリットを活かし、デプロイの複雑さを軽減できるアプリケーション。
  • 速度と精度のバランスの取れたトレードオフ: さまざまなモデルスケールで、推論速度と検出精度の優れたバランスが求められるプロジェクト。
  • レイテンシが一貫したアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が重要なデプロイシナリオ。

YOLO11を選ぶタイミング#

YOLO11は次の用途に推奨されます:

  • 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最重要となる、Raspberry PiNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
  • マルチタスクビジョンアプリケーション: 単一の統合フレームワーク内で、検出セグメンテーションポーズ推定OBBを必要とするプロジェクト。
  • **迅速なプロトタイピングとデプロイメント:**合理化されたUltralytics Python APIを使用して、データ収集から本番環境まで迅速に移行する必要があるチーム。

Ultralytics (YOLO26)を選ぶタイミング#

ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。

  • NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
  • CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
  • 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。

その他のアーキテクチャを検討する#

YOLOv10とYOLO11は優れた選択肢ですが、具体的なユースケースによっては、ドキュメントで提供されている他のアーキテクチャが適している場合があります。シーケンスベースの推論には、RT-DETRのようなTransformerモデルが高い精度を提供しますが、通常はより多くのメモリを必要とします。一方、再トレーニングなしで未知のクラスを識別するゼロショット機能が必要な場合は、YOLO-Worldが自然言語プロンプトを利用したオープンボキャブラリーアプローチを提供します。

次世代モデル: YOLO26#

最先端の性能を求めるチームには、最近リリースされたUltralytics YOLO26が、上記で説明した両モデルの優れた機能を組み合わせています。2026年1月にリリースされたYOLO26は、最新のデプロイシナリオにおける最適な推奨モデルです。

前世代モデルの基盤を受け継ぐYOLO26は、エンドツーエンドのNMS不要設計をネイティブに組み込んでいます。これにより、YOLOv10が初めて対処した後処理のボトルネックを効果的に排除しながら、堅牢なUltralyticsフレームワーク内で実現しています。さらに、YOLO26はDFLの削除(分布フォーカルロス)を特徴としており、モデルのエクスポートグラフを大幅に簡素化し、エッジデバイスや低消費電力のIoTデバイスとの互換性を高めます。

MuSGD Optimizerの導入により、トレーニングの安定性も世代を超えて大きく向上しています。これはLLMのトレーニング手法に着想を得たハイブリッドアプローチで、極めて高速な収束を実現します。ProgLoss + STALなどの高度な損失関数と組み合わせることで、YOLO26は小さな物体の認識を大幅に改善します。標準的なエッジデバイスへのデプロイでは、これらのアーキテクチャ上の改良により、CPU推論が最大43%高速化され、YOLO26はあらゆるコンピュータビジョンタスクにおいて他に類を見ない選択肢となります。

コメント