Ultralytics YOLO27:

YOLOv6-3.0 vs YOLOv7#

リアルタイムコンピュータビジョンの進化は、アーキテクチャの効率性とトレーニング手法の急速な進歩によって特徴付けられてきました。この分野に大きな影響を与えた代表的なモデルが、YOLOv6-3.0YOLOv7です。どちらのフレームワークも、ハイエンドのサーバーGPUからエッジデバイスまで、さまざまな環境への展開を想定し、推論速度と検出精度のバランスを取る新しい技術を導入しました。

この包括的な技術比較では、両モデルのアーキテクチャ、パフォーマンス指標、理想的なユースケースを検証するとともに、最新のUltralytics Platformと最新モデルのYOLO26が、これらの基盤となる概念をどのように発展させ、卓越した開発者エクスペリエンスを実現しているかを紹介します。

YOLOv6-3.0: 産業用スループットの最適化#

MeituanのVision AI Departmentが開発したYOLOv6-3.0は、高スループットの産業用途向けに明確な目的を持って設計されました。ハードウェアアクセラレーター上でのパフォーマンス最大化を重視しており、専用GPUによるバッチ処理が可能な環境に適した有力な候補です。

  • 著者: Chuyi Li、Lulu Li、Yifei Geng、Hongliang Jiang、Meng Cheng、Bo Zhang、Zaidan Ke、Xiaoming Xu、Xiangxiang Chu
  • 組織: Meituan
  • 日付: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

アーキテクチャのイノベーション#

YOLOv6-3.0は、GPU上のメモリアクセスコストを最適化するよう設計された、ハードウェアフレンドリーなアーキテクチャであるEfficientRepバックボーンを採用しています。異なるスケール間での特徴融合を強化するため、モデルのネック部分に**双方向連結(BiC)**モジュールを導入しています。これにより、従来のイテレーションよりも複雑な空間的階層を効果的に捉えられます。

さらに、YOLOv6-3.0は**アンカー支援トレーニング(AAT)**戦略を実装しています。このアプローチは、アンカーベーストレーニングの豊富な勾配シグナルと、アンカーフリー推論による効率的なデプロイの利点を組み合わせます。その結果、後処理速度を犠牲にすることなく、モデルをより安定して収束させられます。

YOLOv6の詳細をご覧ください

ハードウェアに関する考慮事項

YOLOv6-3.0はサーバーグレードのGPU(NVIDIA T4など)で優れた性能を発揮しますが、特定の構造的再パラメータ化に大きく依存しているため、より新しいアーキテクチャと比較すると、CPUのみで動作するエッジデバイスではレイテンシーが最適でない場合があります。

YOLOv7:Bag-of-Freebiesの先駆者#

Academia Sinicaの研究者によってリリースされたYOLOv7は、異なるアプローチを採用しています。勾配パスの分析と、推論コストを増加させないトレーニング時の最適化を重視しており、著者らはこの概念を「トレーニング可能なbag-of-freebies」と呼んでいます。

  • 著者: Chien-Yao Wang、Alexey Bochkovskiy、Hong-Yuan Mark Liao
  • 所属機関: 台湾 中央研究院 情報科学研究所
  • 日付: 2022-07-06
  • Arxiv: 2207.02696
  • GitHub: WongKinYiu/yolov7

アーキテクチャのイノベーション#

YOLOv7の中核は、**拡張効率的レイヤー集約ネットワーク(E-ELAN)**です。E-ELANは、元のネットワークトポロジーを乱すことなく異なるレイヤーがより多様な特徴を学習できるようにすることで、勾配パスを最適化します。その結果、非常に表現力の高いモデルとなり、トップクラスの平均適合率(mAP)を達成できます。

YOLOv7はモデルの再パラメータ化も大いに活用しており、推論時に畳み込みレイヤーとバッチ正規化を統合します。これにより、パラメーター数が減少し、NVIDIA TensorRTONNXなどのフレームワークを使用してデプロイする際のフォワードパスが高速化されます。

YOLOv7について詳しく見る

性能比較#

これらのモデルをMS COCOデータセットで評価すると、YOLOv6の超軽量バリアントと、パラメーター数が多く精度を重視するYOLOv7アーキテクチャとの間に、明確なトレードオフがあることが分かります。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター数
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

データから、YOLOv6-3.0nは非常に優れた推論速度を提供し、高頻度のビデオ分析に適していることが分かります。一方、YOLOv7xは最高のmAPを達成し、生のフレームレートよりも検出精度が重要なタスクで優位に立ちます。

ユースケースと推奨事項#

YOLOv6とYOLOv7のどちらを選択するかは、具体的なプロジェクト要件、デプロイの制約、エコシステムに関する好みによって決まります。

YOLOv6を選択する場合#

YOLOv6は、次のような用途に適しています。

  • 産業用ハードウェアを考慮したデプロイ: モデルのハードウェアを考慮した設計と効率的な再パラメータ化により、特定の対象ハードウェア上で最適化された性能が得られるシナリオ。
  • 高速なシングルステージ検出: 管理された環境でのリアルタイム動画処理において、GPU上での生の推論速度を優先するアプリケーション。
  • Meituanエコシステムとの統合: すでにMeituanの技術スタックとデプロイインフラストラクチャを利用しているチーム。

YOLOv7を選ぶタイミング#

YOLOv7は次の場合に推奨されます。

  • 学術ベンチマーク: 2022年当時の最先端の結果を再現する場合、またはE-ELANとトレーニング可能なbag-of-freebies技術の効果を研究する場合。
  • 再パラメータ化研究: 計画された再パラメータ化畳み込みと、複合モデルスケーリング戦略を調査する場合。
  • 既存のカスタムパイプライン: YOLOv7固有のアーキテクチャを中心に構築され、容易にリファクタリングできない高度にカスタマイズされたパイプラインを持つプロジェクト。

Ultralytics (YOLO26)を選ぶタイミング#

ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。

  • NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
  • CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
  • 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。

Ultralyticsの優位性: 未来への一歩#

YOLOv6-3.0とYOLOv7は重要なマイルストーンですが、異なるリポジトリを本番パイプラインに統合する際には、モデルのデプロイやハイパーパラメーターのチューニングで課題が生じることがよくあります。Ultralyticsエコシステムは、合理化された統合インターフェースを提供することで、こうした問題を解決します。

Ultralyticsを選ぶ理由#

  • 使いやすさ: Ultralytics Python APIを使用すると、わずか数行のコードでモデルの読み込み、トレーニング、エクスポートを実行できます。古いモデルから最新のアーキテクチャへ切り替える場合も、変更が必要なのは1つの文字列だけです。
  • 適切に保守されたエコシステム: Ultralyticsは、頻繁なアップデート、活発なコミュニティサポート、充実したドキュメントを提供しています。
  • 汎用性: 主にバウンディングボックスに重点を置いていた従来のモデルとは異なり、Ultralyticsモデルは、インスタンスセグメンテーション姿勢推定回転バウンディングボックス(OBB)など、マルチタスク学習をネイティブにサポートしています。
  • メモリ要件: Ultralytics YOLOモデルは、RT-DETRのようなTransformerベースのアーキテクチャと比較して、トレーニング中のメモリ使用量を低く抑えられるため、コンシューマー向けハードウェアでも効果的にトレーニングできます。

YOLO26へのアップグレード#

最高水準のパフォーマンスを求める開発者にとって、YOLO26(2026年1月リリース)は、物体検出のパラダイムを根本的に変えるモデルです。完全なエンドツーエンドNMSフリーデザインを導入し、複雑な後処理ロジックを排除するとともに、エッジデバイスでのレイテンシーのばらつきを大幅に低減します。

YOLO26の主なイノベーションには、次のものがあります。

  • MuSGD Optimizer: SGDとMuonを組み合わせた高度なハイブリッドで、非常に安定したトレーニングダイナミクスと高速な収束を実現します。
  • DFL Removal: Distribution Focal Lossを取り除くことで、YOLO26はエクスポートの互換性を簡素化し、低消費電力デバイスでのパフォーマンスを向上させます。
  • ProgLoss + STAL: 小さな物体の認識を大幅に改善する高度な損失関数です。
  • 比類のない速度: 従来世代と比較してCPU推論が最大43%高速で、Raspberry PiApple CoreMLのデプロイなど、組み込みシステムに最適です。

エコシステムには、YOLO11YOLOv8など、非常に高性能なモデルも含まれています。どちらも、レガシーハードウェアとの統合に優れたパフォーマンスバランスを提供します。

将来に対応したパイプライン

Ultralytics Platform上にコンピュータビジョンアプリケーションを構築することで、データセットローダーやデプロイスクリプトを書き直すことなく、将来の最先端モデルにすぐアクセスできます。

コード例:効率化されたトレーニング#

次のスニペットは、Ultralytics APIを使用して最先端のYOLO26モデルをいかに簡単にトレーニングできるかを示しています。このワークフローはYOLO11やYOLOv8にもシームレスに適用でき、従来のリポジトリで通常必要となる定型コードを不要にします。

from ultralytics import YOLO

# Load the cutting-edge YOLO26 nano model for rapid training
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset
# The API handles dataset downloading, augmentation, and hyperparameter configuration
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="cuda:0",  # Automatically utilizes PyTorch GPU acceleration
)

# Run an end-to-end, NMS-free inference on a test image
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for cross-platform deployment
model.export(format="onnx")

まとめ#

YOLOv6-3.0とYOLOv7は、リアルタイム検出という課題の異なる側面にそれぞれ効果的に対応しました。YOLOv6-3.0は専門的な産業用GPU環境に適した強力なモデルであり、YOLOv7は厳密な勾配パス最適化によって高い精度を実現します。

しかし、卓越した汎用性、最小限のデプロイ負担、最先端のパフォーマンスを必要とする現代のアプリケーションでは、Ultralytics YOLO26が決定的な選択肢となります。NMSフリーアーキテクチャ、高度なMuSGD Optimizer、Ultralytics Platformとの深い統合により、開発者はこれまで以上に迅速に、強力でスケーラブルなVision AIソリューションをデプロイできます。

コメント