YOLOv6-3.0とDAMO-YOLO#
コンピュータービジョンの分野は絶えず進化しており、新しいアーキテクチャがリアルタイム物体検出の可能性を広げています。この分野で注目されるモデルに、YOLOv6-3.0とDAMO-YOLOがあります。どちらも産業用ハードウェアで性能を最大化する独自のアーキテクチャ革新を導入しています。このガイドでは、両モデルのアーキテクチャ、学習方法、最適なユースケースを包括的に技術比較し、YOLO26などのUltralyticsモデルがもたらす次世代の利点も紹介します。
モデルの概要#
YOLOv6-3.0: 産業グレードのスループット#
MeituanのVision AI部門が開発したYOLOv6-3.0は、高スループットの産業用途向けに特化して設計されています。NVIDIA GPUなどのハードウェアアクセラレーターでの性能最大化を重視しています。
- 著者: Chuyi Li、Lulu Li、Yifei Gengほか
- 組織: Meituan
- 日付: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
- ドキュメント: Ultralytics YOLOv6のドキュメント
YOLOv6-3.0は、特徴融合を改善する双方向連結(BiC)モジュールを導入し、Anchor-Aided Training(AAT)戦略を利用しています。この戦略では、学習時にアンカーベースとアンカーフリー検出器の利点を組み合わせながら、推論時には完全なアンカーフリーを維持します。EfficientRepバックボーンはGPUバッチ処理に適した高いハードウェア親和性を備えており、大量の動画理解データの処理に最適です。
DAMO-YOLO:NASによる高速・高精度化#
Alibaba Groupが開発したDAMO-YOLOは、ニューラルアーキテクチャ探索(NAS)を活用し、リアルタイム推論に最も効率的なバックボーン構造を自動的に見つけ出します。
- 著者:Xianzhe Xu、Yiqi Jiang、Weihua Chenほか
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv:2211.15444v2
- GitHub:tinyvision/DAMO-YOLO
DAMO-YOLOは、効率的なマルチスケール特徴融合を実現するRepGFPN(再パラメーター化された汎用特徴ピラミッドネットワーク)と、検出ヘッドの計算オーバーヘッドを大幅に削減するZeroHead設計を採用しています。また、モデルのパラメーター数を増やすことなく精度を高めるため、AlignedOTAによるラベル割り当てと堅牢な知識蒸留技術も取り入れています。
DAMO-YOLOは優れた精度を達成しますが、トレーニング中の知識蒸留への依存度が高いため、はるかに大規模な「教師」モデルが必要です。そのため、よりシンプルなアーキテクチャと比べて、トレーニングフェーズで必要となるCUDAメモリが大幅に増加します。
パフォーマンス比較#
物体検出モデルを評価する際は、平均適合率(mAP)と推論速度のバランスが重要です。以下では、さまざまなモデルスケールにおけるYOLOv6-3.0とDAMO-YOLOを詳しく比較します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
YOLOv6-3.0は、TensorRTの最適化を利用するNVIDIA GPU上で、特にnanoおよびsmallバリアントにおいて優れた速度を発揮します。一方、DAMO-YOLOのNAS最適化バックボーンは、mediumおよびlargeスケールで必要なFLOPsが少ない傾向にあり、大規模なデプロイではレイテンシがわずかに優れます。
Ultralyticsの強み:YOLO26の登場#
YOLOv6-3.0とDAMO-YOLOは強力なツールですが、開発者は複雑なデプロイパイプライン、トレーニング中の高いメモリ要件、柔軟性に欠ける単一タスクアーキテクチャといった課題に直面することがよくあります。Ultralyticsエコシステムは、開発者にとって大幅に効率化された環境を提供します。
YOLO26のリリースにより、UltralyticsはコンピュータービジョンAIの最先端を再定義しました。2026年1月にリリースされたUltralytics YOLO26は、効率性と汎用性の限界を押し広げます。
YOLO26の主な革新#
- エンドツーエンドのNMSフリーデザイン: YOLOv10が先駆けたコンセプトを基盤とするYOLO26のオプションのone-to-oneヘッド(
nms=False)は、後処理の非極大値抑制(NMS)を不要にします。これによりレイテンシのばらつきが大幅に低減し、CoreMLやLiteRTを介したエッジデバイスへのデプロイが簡素化されます。 - DFLの削除: Distribution Focal Lossを削除することで、YOLO26はエクスポートプロセスを簡素化し、低消費電力のマイクロコントローラーやエッジハードウェアとの互換性を大幅に高めます。
- CPU推論が最大43%高速化: 専用GPUハードウェアを利用できないアプリケーションでは、YOLO26のCPU最適化によって卓越した速度を実現し、GPUに大きく依存するYOLOv6などのモデルを上回ります。
- MuSGDオプティマイザー: Moonshot AIのKimi K2などのLLMトレーニング手法に着想を得たYOLO26は、MuSGDオプティマイザー(SGDとMuonのハイブリッド)を使用し、安定したトレーニングと迅速な収束を実現します。
- ProgLoss + STAL: 高度な損失関数により小物体の認識性能が大幅に向上するため、YOLO26はドローン運用や遠距離のターゲット追跡に最適です。
- マルチタスクの汎用性: 検出専用のDAMO-YOLOとは異なり、YOLO26は単一の統合APIで、インスタンスセグメンテーション、姿勢推定(Residual Log-Likelihood Estimationを使用)、回転バウンディングボックス(OBB)をすぐに利用できます。
RT-DETRのような複雑なTransformerアーキテクチャや、蒸留に大きく依存するDAMO-YOLOのパイプラインとは異なり、UltralyticsのモデルはVRAM使用量の少なさで知られています。一般向けハードウェアでもYOLO26モデルを簡単にトレーニングできます。
効率化されたPythonワークフロー#
最先端モデルのトレーニングやデプロイに、何百行もの定型コードは必要ありません。Ultralytics Pythonパッケージは、機械学習のライフサイクルを簡素化します。
from ultralytics import YOLO
# 最先端のYOLO26 smallモデルを読み込む
model = YOLO("yolo26s.pt")
# 組み込みのデータ処理機能を使って、モデルを簡単にトレーニングする
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 超高速推論を実行して結果を表示する
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# ONNXまたはTensorRTにシームレスにエクスポートする
model.export(format="onnx")最適なユースケース#
適切なアーキテクチャは、デプロイ上の制約によって決まります。
YOLOv6-3.0を使う場面#
- 大規模バッチの動画分析: TensorRTを最大限に活用できるエンタープライズGPUサーバーで、高密度の動画ストリームを処理する用途に最適です。
- 産業オートメーション: 高速な製造ラインでの品質管理における欠陥検出。
DAMO-YOLOの用途#
- カスタムシリコン: 特定の独自NPUハードウェアに対応するニューラルアーキテクチャサーチのマッピングを研究する用途。
- 学術研究: リアルタイムネットワーク向けの新しい知識蒸留手法をベンチマークする用途。
Ultralytics YOLO26を使用するタイミング#
- エッジおよびモバイルへのデプロイ: NMSフリーデザイン、DFLの削除、CPU速度の43%向上により、iOS、Android、Raspberry Piとの統合に最適です。
- ラピッドプロトタイピングから本番環境まで: Ultralytics Platformとのシームレスな統合により、チームはデータセットのアノテーションからグローバルなクラウドデプロイまでを、数カ月ではなく数日で実現できます。
- 複雑なビジョンパイプライン: バウンディングボックスの検出に加え、人間の姿勢キーポイントと高精度なセグメンテーションマスクを同時に必要とするプロジェクトに適しています。
結論#
YOLOv6-3.0とDAMO-YOLOは、リアルタイム物体検出の研究に大きく貢献してきました。YOLOv6はGPUの能力を最大限に引き出す技術を洗練させ、DAMO-YOLOは自動アーキテクチャサーチの威力を示しました。
しかし、精度、推論速度、エコシステムの保守性を最高水準で両立させたい開発者には、Ultralytics YOLOファミリーが依然として最適な選択肢です。YOLO26で導入された画期的な最適化により、エンタープライズグレードのコンピュータービジョンアプリケーションを開発するハードルは、かつてないほど低くなっています。
さらに詳しく調べるには、ドキュメントでほかのアーキテクチャとの比較もご覧ください。YOLO11や、RT-DETRのようなTransformerベースのアプローチなどが挙げられます。