Ultralytics YOLO27:
Get Started

Ultralytics YOLOによるモデル予測#

Ultralytics YOLO ecosystem and integrations

はじめに#

機械学習とコンピュータービジョンの分野では、視覚データを解釈するプロセスは、一般に推論または予測と呼ばれます。Ultralytics YOLO26には、幅広いデータソースに対応した高性能なリアルタイム推論向けのpredictモードが用意されています。

今後の推論例については、未公開のYOLO27プレビューを参照してください。



視聴: カスタムプロジェクト向けに Ultralytics YOLO26 のタスク結果を抽出する方法 🚀

実世界での活用例#

製造スポーツ安全
車両用スペアパーツの検出サッカー選手の検出人の転倒検出

Ultralytics YOLOを推論に使用する理由#

さまざまな推論ニーズにYOLO26のpredictモードを検討すべき理由は次のとおりです。

  • 汎用性: 画像、動画、さらにはライブストリームでも推論を実行できます。
  • パフォーマンス: 精度を損なうことなく、リアルタイムの高速処理を実現できるように設計されています。
  • 使いやすさ: 直感的に使えるPythonおよびCLIインターフェースにより、迅速なデプロイとテストが可能です。
  • 高いカスタマイズ性: さまざまな設定やパラメーターを調整して、特定の要件に合わせてモデルの推論動作をカスタマイズできます。
  • 本番環境に対応: モデルをUltralytics Platformの推論エンドポイントとしてデプロイし、自動スケーリングとモニタリングを利用するか、ローカルで推論を実行できます。

predictモードの主な機能#

YOLO26のpredictモードは、堅牢性と汎用性を備えるように設計されており、次の機能を備えています。

  • 複数のデータソースとの互換性: 個別の画像、画像のコレクション、動画ファイル、リアルタイムの動画ストリームなど、データ形式を問わずpredictモードを利用できます。
  • ストリーミングモード: ストリーミング機能を使用して、メモリ効率に優れたResultsオブジェクトのジェネレーターを生成できます。predictorのcallメソッドでstream=Trueを設定すると有効になります。すべての結果を含むリストを返すデフォルトの動作(stream=False)とは異なり、stream=Trueは結果を1つずつ返すため、長時間の動画やライブストリームに特に役立ちます。
  • バッチ処理: 複数の画像または動画フレームを1つのバッチで処理することで、推論の合計時間をさらに短縮できます。
  • 統合しやすさ: 柔軟なAPIにより、既存のデータパイプラインや他のソフトウェアコンポーネントと簡単に統合できます。

Ultralytics YOLOモデルは、推論時にstream=Trueをモデルに渡すと、ResultsオブジェクトのPythonリスト、またはメモリ効率に優れたResultsオブジェクトのジェネレーターを返します。

推論
from ultralytics import YOLO

# モデルを読み込む
model = YOLO("yolo26n.pt")  # 事前学習済みYOLO26nモデル

# 画像のリストに対してバッチ推論を実行
results = model(["image1.jpg", "image2.jpg"])  # Resultsオブジェクトのリストを返す

# 結果のリストを処理
for result in results:
    boxes = result.boxes  # バウンディングボックス出力用のBoxesオブジェクト
    masks = result.masks  # セグメンテーションマスク出力用のMasksオブジェクト
    keypoints = result.keypoints  # ポーズ出力用のKeypointsオブジェクト
    probs = result.probs  # 分類出力用のProbsオブジェクト
    obb = result.obb  # OBB出力用のOriented boxesオブジェクト
    result.show()  # 画面に表示
    result.save(filename="result.jpg")  # ディスクに保存

推論ソース#

YOLO26は、以下の表に示すように、さまざまな種類の入力ソースを推論に使用できます。ソースには、静止画像、動画ストリーム、さまざまなデータ形式が含まれます。また、各ソースをstream=True ✅引数を指定したストリーミングモードで使用できるかどうかも示しています。ストリーミングモードでは、すべてのフレームをメモリに読み込む代わりに結果のジェネレーターを作成するため、動画やライブストリームの処理に適しています。

ヒント

長時間の動画や大規模なデータセットを処理する場合は、メモリを効率的に管理するためにstream=Trueを使用してください。stream=Falseの場合、すべてのフレームまたはデータポイントの結果がメモリに保存されるため、大きな入力ではすぐにメモリ使用量が増加し、メモリ不足エラーが発生する可能性があります。一方、stream=Trueはジェネレーターを使用し、現在のフレームまたはデータポイントの結果のみをメモリに保持するため、メモリ消費量を大幅に削減し、メモリ不足の問題を防止できます。

ソース例種類備考
画像'image.jpg'strまたはPath単一の画像ファイル。
URL'https://ultralytics.com/images/bus.jpg'str画像のURL。
スクリーンショット'screen'strスクリーンショットをキャプチャします。
PILImage.open('image.jpg')PIL.ImageRGBチャンネルを含むHWC形式。
OpenCVcv2.imread('image.jpg')np.ndarrayBGRチャンネルを含むHWC形式uint8 (0-255)。
NumPynp.zeros((640,1280,3))np.ndarrayBGRチャンネルを含むHWC形式uint8 (0-255)。
torchtorch.zeros(16,3,320,640)torch.TensorRGBチャンネルを含むBCHW形式float32 (0.0-1.0)。
CSV'sources.csv'strまたはPath画像、動画、またはディレクトリへのパスを含むCSVファイル。
動画 ✅'video.mp4'strまたはPathMP4、AVIなどの形式の動画ファイル。
ディレクトリ ✅'path/'strまたはPath画像または動画を含むディレクトリへのパス。
glob ✅'path/*.jpg'str複数のファイルに一致するglobパターン。ワイルドカードとして*文字を使用します。
YouTube ✅'https://youtu.be/LNwODJXcvt4'strYouTube動画のURL。
ストリーム ✅'rtsp://example.com/media.mp4'strRTSP、RTMP、TCPなどのストリーミングプロトコルのURL、またはIPアドレス。
マルチストリーム ✅'list.streams'strまたはPath1行につき1つのストリームURLを含む*.streamsテキストファイルです。たとえば、8つのストリームをバッチサイズ8で実行します。
Webカメラ ✅0int推論を実行する接続済みカメラデバイスのインデックス。

以下は、各ソースタイプを使用するコード例です。

予測ソース

画像ファイルに対して推論を実行します。

from ultralytics import YOLO

# 事前学習済みYOLO26nモデルを読み込む
model = YOLO("yolo26n.pt")

# 画像ファイルへのパスを定義
source = "path/to/image.jpg"

# ソースに対して推論を実行
results = model(source)  # Resultsオブジェクトのリスト

推論引数#

model.predict() は、デフォルト設定を上書きするために推論時に渡せる複数の引数を受け付けます。

固定形状と最小矩形(rect)#

デフォルトでは、predictは rect=True を使用し、可能な場合は 最小矩形 のパディングを有効にします。画像は imgsz に収まるようにスケーリングされ、最も近いストライドの倍数までのみパディングされるため、最終的なテンソルは imgsz より 小さく なる場合があります。最小矩形のパディングは、バッチ内のすべての画像の形状が同じ で、バックエンドが対応している場合(PyTorch .pt、または動的ONNXなどの動的形状エクスポート)にのみ使用されます。それ以外の場合、画像は 完全な imgsz のターゲットサイズまでパディングされます。

常に完全な imgsz のターゲットサイズまでパディングするには、rect=False を使用します。エクスポート済みモデル(ONNX、TensorRTなど)に合わせて固定入力サイズが必要な場合に推奨されます。

整数とタプル imgsz

  • 整数 の imgsz=640 は、ストライドに合わせて丸められた後、正方形のターゲット (640, 640) になります。
  • タプル の imgsz=(384, 672) は、長方形のターゲットを設定します。rect=True を使用すると、実際のテンソルはこのターゲットより小さくなる場合があります。

トレーニングとpredict/export

トレーニングで受け付けるのは単一の整数 imgsz のみです([h, w] リストは最大値に変換されます)。Predictとexportでは、整数または (height, width) タプルを使用できます。

例
from ultralytics import YOLO

# 事前学習済みYOLO26nモデルを読み込む
model = YOLO("yolo26n.pt")

# 'bus.jpg'で引数を指定して推論を実行します
model.predict("https://ultralytics.com/images/bus.jpg", save=True, imgsz=320, conf=0.25)

推論引数:

引数種類デフォルト説明
sourcestr、int、またはNoneNone推論のデータソースを指定します。画像パス、動画ファイル、ディレクトリ、URL、またはライブ配信用のデバイスIDを指定できます。省略すると警告がログに記録され、組み込みのデモアセット(ultralytics/assets、またはOBBの場合はデモURL)がモデルで使用されます。幅広い形式とソースに対応しているため、さまざまな種類の入力に柔軟に適用できます。
conffloat0.25検出の最小信頼度しきい値を設定します。このしきい値を下回る信頼度で検出された物体は無視されます。この値を調整すると、誤検出を減らせる場合があります。
ioufloat0.7非最大抑制(NMS)に使用する積集合対和(IoU)のしきい値です。値を小さくすると、重なり合うボックスが除外されて検出数が減り、重複の削減に役立ちます。
imgszintまたはtuple640レターボックスの目標サイズです。整数を指定すると正方形のN×Nになり、タプルを指定すると(height, width)になります。rect=Trueの場合、最小矩形パディングにより実際のテンソルが目標サイズより小さくなることがあります。固定サイズにするにはrect=Falseを使用してください。固定形状と最小矩形をご覧ください。
rectboolTrueTrueの場合、可能であれば最小矩形パディングを使用します(同じ形状のバッチで、バックエンドが対応している場合)。Falseの場合、常に完全なimgszまでパディングします。固定形状と最小矩形をご覧ください。
quantizeintまたはstrNone推論精度: 16/"fp16"および32/"fp32"/未設定では、PyTorchおよびTorchScriptモデルの演算にFP16またはFP32を選択します(CPUではFP32)。その他の形式では、アーティファクトとランタイムによって選択される精度が使用されます。16では、OpenVINOは引き続きクライアント側で入力をFP16に丸めてからFP32に戻しますが、ランタイムの精度は変更しません。INT8/PTQ量子化はエクスポート時に設定し、その後、エクスポート済みモデルの読み込み時に使用します。非推奨のhalfフラグを置き換えます。
devicestrNone推論に使用するデバイスを指定します(例: cpu、cuda:0、0、npu、またはnpu:0)。モデルの実行にCPU、特定のGPU、Huawei Ascend NPU、その他の計算デバイスを選択できます。
dnnboolFalseTrueの場合、ONNXモデルの推論にONNX RuntimeではなくOpenCV DNNモジュールを使用します。
datastrNoneデータセットYAMLへのパス(例: coco8.yaml)。読み込んだモデル自体にクラス名がない場合に限り、そのnamesだけを読み取ります。該当するのは、サードパーティによるエクスポートモデル、または付属のメタデータから切り離されたUltralyticsエクスポートモデルです。このようなモデルは、それ以外の場合、class0、class1などを出力します。
batchint1推論のバッチサイズを指定します(ディレクトリ、動画ファイル、または.txtファイルをソースにする場合のみ有効です)。バッチサイズを大きくするとスループットが向上し、推論にかかる合計時間を短縮できます。
max_detint300画像ごとに許可される検出数の最大値です。1回の推論でモデルが検出できるオブジェクトの総数を制限し、密集したシーンで過剰な出力が発生するのを防ぎます。
vid_strideint1動画入力のフレームストライドです。動画のフレームをスキップして処理を高速化しますが、時間解像度は低下します。値が1の場合はすべてのフレームを処理し、値を大きくするとフレームをスキップします。
stream_bufferboolFalse動画ストリームの受信フレームをキューに格納するかどうかを指定します。Falseの場合、新しいフレームを受け入れるために古いフレームを破棄します(リアルタイムアプリケーション向けに最適化されています)。Trueの場合、新しいフレームをバッファーにキューイングしてフレームのスキップを防ぎますが、推論FPSがストリームFPSより低いと遅延が発生します。
visualizeboolFalse各予測の横にクラスアクティベーションヒートマップを保存し、予測されたクラスのスコアを高めたピクセルを表示します。confとclassesを反映するため、classes=[0]の場合はそのクラスのみがマッピングされます。Ultralytics PyTorchモデルでのみ利用できます。
augmentboolFalse予測にテスト時拡張(TTA)を適用します。推論速度は低下する可能性がありますが、検出の頑健性を高められる場合があります。Ultralytics PyTorchモデルでのみ利用できます。
agnostic_nmsboolFalseクラス非依存のNon-Maximum Suppression(NMS)を有効にします。同じクラス内だけでなく、異なるクラス間でも重複するボックスを対象に、スコアの低いものを抑制します。クラス間の重複がよく発生するマルチクラス検出で有用です。NMSなし推論(YOLO26またはYOLOv10でnms=False)では、同じ検出が複数のクラスラベルで出力されること(IoU=1.0の重複)を防ぐだけで、異なるボックス間のIoUしきい値に基づく抑制は行いません。
classeslist[int]None予測をクラスIDのセットでフィルタリングします。指定したクラスに属する検出のみが返されます。マルチクラス検出タスクで、関連するオブジェクトに対象を絞る場合に便利です。
retina_masksboolFalse高解像度のセグメンテーションマスクを返します。有効にすると、返されるマスク(masks.data)は元の画像サイズに一致します。無効にすると、推論に使用した画像サイズになります。
embedlist[int]None特徴ベクトルまたは埋め込みを抽出するレイヤーを指定します。model.embed(source)では最後から2番目のレイヤーの埋め込みを使用し、model.predict(source, embed=[layer])では特定のレイヤーを選択します。クラスタリングや類似検索などの下流タスクで役立ちます。Ultralytics PyTorchモデルでのみ利用できます。
projectstrNonesaveが有効な場合に、予測出力を保存するプロジェクトディレクトリの名前です。
namestrNone予測実行の名前です。プロジェクトフォルダー内にサブディレクトリを作成し、saveが有効な場合に予測出力を保存するために使用します。
streamboolFalseすべてのフレームを一度にメモリへ読み込む代わりに、Resultsオブジェクトのジェネレーターを返すことで、長時間の動画や大量の画像をメモリ効率よく処理します。
verboseboolTrue端末に詳細な推論ログを表示するかどうかを制御し、予測処理の進行状況をリアルタイムで確認できるようにします。
compileboolまたはstrFalsePyTorch 2.xのtorch.compileグラフコンパイルをbackend='inductor'で有効にします。True → "default"、False → 無効、または"default"、"reduce-overhead"、"max-autotune-no-cudagraphs"などの文字列モードを指定できます。未対応の場合は警告を表示し、eagerモードにフォールバックします。
channels_lastboolNoneネイティブPyTorch推論でchannels_last(NHWC)メモリ形式を使用します。Noneでは、oneDNNを有効にしたLinuxおよびWindowsのx86 CPU上でPyTorch 1.13以降を使用する場合に自動的に有効になり、Falseでは無効になり、Trueでは対応するx86 CPUまたはCUDAデバイスでの使用を指定します。ARM64、MPS、古いPyTorchバージョン、oneDNN非対応CPU、およびTensorRTやONNXなどのエクスポート形式では変更されません。
nmsbool、省略可NoneデフォルトではNMSを使用したone-to-many推論(NoneまたはTrue)を実行します。利用可能な場合は、Falseを設定してNMSなしのone-to-oneヘッドを使用します。詳細はエンドツーエンド検出ガイドをご覧ください。

可視化の引数:

引数種類デフォルト説明
showboolFalseTrueの場合、注釈付き画像または動画をウィンドウに表示します。開発やテスト中にすぐ視覚的なフィードバックを得るのに便利です。
saveboolFalse or True注釈付き画像または動画をファイルに保存します。ドキュメント作成、追加分析、結果の共有に便利です。CLIで使用する場合のデフォルトはTrue、Pythonで使用する場合はFalseです。
save_framesboolFalse動画の処理時に、各フレームを画像として保存します。特定のフレームの抽出や、フレームごとの詳細な分析に便利です。
save_txtboolFalse検出結果を[class] [x_center] [y_center] [width] [height] [confidence]形式のテキストファイルに保存します。他の分析ツールとの連携に便利です。
save_confboolFalse保存されるテキストファイルに信頼度スコアを含めます。後処理や分析で利用できる情報が増えます。
save_cropboolFalse検出したオブジェクトのクロップ画像を保存します。データセットの拡張や分析、特定のオブジェクトに絞ったデータセットの作成に便利です。
show_labelsboolTrue可視化出力で各検出のラベルを表示します。検出されたオブジェクトをすぐに把握できます。
show_confboolTrue各検出のラベルとともに信頼度スコアを表示します。各検出に対するモデルの確信度を確認できます。
show_boxesboolTrue検出されたオブジェクトの周囲にバウンディングボックスを描画します。画像や動画フレーム内のオブジェクトを視覚的に識別し、位置を確認するために不可欠です。
line_widthint or NoneNoneバウンディングボックスの線幅を指定します。Noneの場合、画像サイズに応じて線幅が自動調整されます。見やすさを高めるために表示をカスタマイズできます。

画像と動画の形式#

YOLO26は、ultralytics/data/utils.py に記載されているさまざまな画像および動画形式に対応しています。有効な拡張子とpredictコマンドの例については、以下の表を参照してください。

画像#

以下の表に、有効なUltralytics画像形式を示します。

注

HEIC/HEIF形式には pi-heif が必要です。これは初回使用時に自動でインストールされます。AVIFはPillowでネイティブにサポートされています。

画像の拡張子predictコマンドの例参照
.avifyolo predict source=image.avifAV1画像ファイル形式
.bmpyolo predict source=image.bmpMicrosoft BMPファイル形式
.dngyolo predict source=image.dngAdobe DNG
.heicyolo predict source=image.heic高効率画像形式
.heifyolo predict source=image.heif高効率画像形式
.jp2yolo predict source=image.jp2JPEG 2000
.jpegyolo predict source=image.jpegJPEG
.jpgyolo predict source=image.jpgJPEG
.mpoyolo predict source=image.mpoマルチピクチャオブジェクト
.pngyolo predict source=image.pngポータブルネットワークグラフィックス
.tifyolo predict source=image.tifタグ付き画像ファイル形式
.tiffyolo predict source=image.tiffタグ付き画像ファイル形式
.webpyolo predict source=image.webpWebP

動画#

以下の表に、有効なUltralytics動画形式を示します。

動画の拡張子predictコマンドの例参照
.asfyolo predict source=video.asfAdvanced Systems Format
.aviyolo predict source=video.aviAudio Video Interleave
.gifyolo predict source=video.gifGraphics Interchange Format
.m4vyolo predict source=video.m4vMPEG-4 Part 14
.mkvyolo predict source=video.mkvMatroska
.movyolo predict source=video.movQuickTimeファイル形式
.mp4yolo predict source=video.mp4MPEG-4 Part 14 - Wikipedia
.mpegyolo predict source=video.mpegMPEG-1 Part 2
.mpgyolo predict source=video.mpgMPEG-1 Part 2
.tsyolo predict source=video.tsMPEGトランスポートストリーム
.wmvyolo predict source=video.wmvWindows Media Video
.webmyolo predict source=video.webmWebM Project

Resultsの使用#

すべてのUltralytics predict() 呼び出しは、Results オブジェクトのリストを返します。

Results
from ultralytics import YOLO

# 事前学習済みYOLO26nモデルを読み込む
model = YOLO("yolo26n.pt")

# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")
results = model(
    [
        "https://ultralytics.com/images/bus.jpg",
        "https://ultralytics.com/images/zidane.jpg",
    ]
)  # バッチ推論

Results オブジェクトには、次の属性があります。

属性種類説明
orig_imgnp.ndarray元画像をNumPy配列で表したものです。
orig_shapetuple元画像の形状を(高さ、幅)形式で表したものです。
boxesBoxes, optional検出されたバウンディングボックスを含むBoxesオブジェクトです。
masksMasks, optional検出されたマスクを含むMasksオブジェクトです。
probsProbs, optional分類タスクの各クラスの確率を含むProbsオブジェクトです。
keypointsKeypoints, optional各オブジェクトで検出されたキーポイントを含むKeypointsオブジェクトです。
obbOBB, optional方向付きバウンディングボックスを含むOBBオブジェクトです。
semantic_maskSemanticMask, optionalピクセルごとの密なクラスマップを含むSemanticMaskオブジェクトです。
depthDepthMap, optionalピクセルごとの密な深度マップを含むDepthMapオブジェクトです。
speeddict画像ごとの前処理、推論、後処理の速度をミリ秒単位で示す辞書です。
namesdictクラスインデックスとクラス名を対応付ける辞書です。
pathstr画像ファイルへのパスです。
save_dirstr, optional結果の保存先ディレクトリです。

タスク別のResults#

以下のフィールドに値が設定されるかどうかは、モデルのタスクによって異なります。まだタスクを選んでいない場合は、検出、セグメンテーション、セマンティックセグメンテーション、深度推定、分類、姿勢、OBBを比較してください。各予測では、画像またはフレームごとに1つの Results オブジェクトが返されます。上記の共通フィールドは常に使用でき、タスク固有の予測データは以下のフィールドに格納されます。YOLOの座標テンソルと信頼度テンソルは torch.float32 です。確率テンソルは torch.float32 ですが、FP16推論(quantize=16)を使用すると torch.float16 になります。result.numpy() の後、テンソルは対応するNumPyデータ型のNumPy配列になります。インスタンスマスクは torch.uint8 のバイナリテンソルです。一方、セマンティックマスクではクラス数に応じて、クラスID用に実用上最小の整数データ型である torch.uint8、torch.int16、または torch.int32 が使用されます。

属性種類形状説明
result.boxesBoxes(N)検出ボックスです。
result.boxes.datatorch.float32(N,6/7)生の [x1,y1,x2,y2,conf,cls] と、任意のトラックIDです。
result.boxes.xyxytorch.float32(N,4)xyxy のピクセルボックスです。
result.boxes.conftorch.float32(N,)信頼度スコアです。
result.boxes.clstorch.float32(N,)クラスIDです。名前を取得するには int にキャストします。

Resultsオブジェクトには、次のメソッドがあります。

メソッド戻り値の型説明
update()Noneボックス、マスク、確率、obb、キーポイント、セマンティックマスク、深度などの新しいデータでResultsオブジェクトを更新します。
cpu()ResultsすべてのテンソルをCPUメモリに移動したResultsオブジェクトのコピーを返します。
numpy()ResultsすべてのテンソルをNumPy配列に変換したResultsオブジェクトのコピーを返します。
cuda()ResultsすべてのテンソルをGPUメモリに移動したResultsオブジェクトのコピーを返します。
to()Resultsテンソルを指定したデバイスとdtypeに移動したResultsオブジェクトのコピーを返します。
new()Results同じ画像、パス、names、speed属性を持つ新しいResultsオブジェクトを作成します。
plot()np.ndarray入力BGR画像に検出結果をプロットし、注釈付き画像を返します。
show()None推論結果を注釈として追加した画像を表示します。
save()str推論結果を注釈として追加した画像をファイルに保存し、ファイル名を返します。
verbose()str各タスクのログ文字列を返し、検出と分類の結果を詳しく示します。
save_txt()str検出結果をテキストファイルに保存し、保存したファイルのパスを返します。
save_crop()None検出画像のクロップを指定したディレクトリに保存します。
summary()List[Dict[str, Any]]推論結果を、オプションで正規化した要約辞書に変換します。
to_df()DataFrame検出結果をPolars DataFrameに変換します。
to_csv()str検出結果をCSV形式に変換します。
to_json()str検出結果をJSON形式に変換します。

詳細については、Resultsクラスのドキュメントを参照してください。

ボックス#

Boxesオブジェクトを使用して、バウンディングボックスのインデックス指定、操作、形式変換を行えます。

ボックス
from ultralytics import YOLO

# 事前学習済みYOLO26nモデルを読み込む
model = YOLO("yolo26n.pt")

# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")  # 結果リスト

# 結果を表示
for r in results:
    print(r.boxes)  # 検出バウンディングボックスを含むBoxesオブジェクトを出力

Boxesクラスのメソッドとプロパティについて、名前、型、説明を含む表を以下に示します。

名前種類説明
cpu()メソッドオブジェクトをCPUメモリに移動します。
numpy()メソッドオブジェクトをNumPy配列に変換します。
cuda()メソッドオブジェクトをCUDAメモリに移動します。
to()メソッドオブジェクトを指定したデバイスに移動します。
xyxyプロパティ(torch.Tensor)ボックスをxyxy形式で返します。
confプロパティ(torch.Tensor)ボックスの信頼度を返します。
clsプロパティ(torch.Tensor)ボックスのクラス値を返します。
idプロパティ(torch.Tensor)ボックスのトラックIDを返します(利用可能な場合)。
xywhプロパティ(torch.Tensor)ボックスをxywh形式で返します。
xyxynプロパティ(torch.Tensor)元の画像サイズで正規化したボックスをxyxy形式で返します。
xywhnプロパティ(torch.Tensor)元の画像サイズで正規化したボックスをxywh形式で返します。

詳細については、Boxesクラスのドキュメントを参照してください。

マスク#

Masksオブジェクトを使用して、マスクのインデックス指定、操作、セグメントへの変換を行えます。

マスク
from ultralytics import YOLO

# 事前学習済みのYOLO26n-segセグメンテーションモデルを読み込む
model = YOLO("yolo26n-seg.pt")

# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")  # 結果リスト

# 結果を表示
for r in results:
    print(r.masks)  # 検出されたインスタンスマスクを含むMasksオブジェクトを出力

Masksクラスのメソッドとプロパティについて、名前、型、説明を含む表を以下に示します。

名前種類説明
dataプロパティ(torch.Tensor)torch.uint8は、形状が(N,H,W)で、値が0または1のバイナリマスクテンソルです。
cpu()メソッドマスクテンソルをCPUメモリ上で返します。
numpy()メソッドマスクテンソルをNumPy配列として返します。
cuda()メソッドマスクテンソルをGPUメモリ上で返します。
to()メソッド指定したデバイスとdtypeのマスクテンソルを返します。
xynプロパティ(list[np.ndarray])正規化されたマスクポリゴンのリストです。
xyプロパティ(list[np.ndarray])ピクセル座標のマスクポリゴンのリストです。

詳細については、Masksクラスのドキュメントを参照してください。

SemanticMask#

SemanticMaskは、セマンティックセグメンテーションの結果を表す単一の高密度クラスマップを格納します。Masksとは異なり、オブジェクトごとのバイナリマスクは含まず、ポリゴン用のヘルパーも提供しません。

SemanticMask
from ultralytics import YOLO

# 事前学習済みのYOLO26n-semセマンティックモデルを読み込む
model = YOLO("yolo26n-sem.pt")

# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")  # 結果リスト

# 結果を表示
for r in results:
    print(r.semantic_mask.data)  # H x WのクラスIDマップを出力
名前種類説明
dataプロパティ(torch.Tensor)形状が(H,W)のクラスIDマップです。dtypeは、クラス数に応じてtorch.uint8、torch.int16、またはtorch.int32になります。
shapeプロパティ(tuple)クラスマップの形状です。通常はresult.orig_shapeと一致します。
cpu()メソッドセマンティックマスクテンソルをCPUメモリ上で返します。
numpy()メソッドセマンティックマスクテンソルをNumPy配列として返します。
cuda()メソッドセマンティックマスクテンソルをGPUメモリ上で返します。
to()メソッド指定したデバイスとdtypeのセマンティックマスクテンソルを返します。

キーポイント#

Keypointsオブジェクトを使用して、座標のインデックス指定、操作、正規化を行えます。

キーポイント
from ultralytics import YOLO

# 事前学習済みのYOLO26n-poseポーズモデルを読み込む
model = YOLO("yolo26n-pose.pt")

# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")  # 結果リスト

# 結果を表示
for r in results:
    print(r.keypoints)  # 検出されたキーポイントを含むKeypointsオブジェクトを出力

Keypointsクラスのメソッドとプロパティについて、名前、型、説明を含む表を以下に示します。

名前種類説明
cpu()メソッドキーポイントテンソルをCPUメモリ上で返します。
numpy()メソッドキーポイントテンソルをNumPy配列として返します。
cuda()メソッドキーポイントテンソルをGPUメモリ上で返します。
to()メソッド指定したデバイスとdtypeのキーポイントテンソルを返します。
xynプロパティ(torch.Tensor)形状が(N,K,2)の正規化されたキーポイント座標です。
xyプロパティ(torch.Tensor)形状が(N,K,2)のピクセル単位のキーポイント座標です。
confプロパティ(torch.Tensor)キーポイントの信頼度を返します。利用できない場合はNoneを返します。

詳細については、Keypointsクラスのドキュメントを参照してください。

確率#

Probsオブジェクトを使用して、top1とtop5の分類インデックスおよびスコアを取得できます。

確率
from ultralytics import YOLO

# 事前学習済みのYOLO26n-cls分類モデルを読み込む
model = YOLO("yolo26n-cls.pt")

# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")  # 結果リスト

# 結果を表示
for r in results:
    print(r.probs)  # 検出されたクラス確率を含むProbsオブジェクトを出力

Probsクラスのメソッドとプロパティをまとめた表を以下に示します。

名前種類説明
cpu()メソッドprobsテンソルのコピーをCPUメモリ上に返します。
numpy()メソッドprobsテンソルのコピーをNumPy配列として返します。
cuda()メソッドprobsテンソルのコピーをGPUメモリ上に返します。
to()メソッド指定したデバイスとdtypeでprobsテンソルのコピーを返します。
top1プロパティ(int)トップ1クラスのインデックス。
top5プロパティ(list[int])トップ5クラスのインデックス。
top1confプロパティ(torch.Tensor)トップ1クラスの信頼度。
top5confプロパティ(torch.Tensor)トップ5クラスの信頼度。

詳細については、Probsクラスのドキュメントを参照してください。

OBB#

OBBオブジェクトを使用して、方向付きバウンディングボックスのインデックス付け、操作、さまざまな形式への変換を行えます。

OBB
from ultralytics import YOLO

# 事前学習済みYOLO26nモデルを読み込む
model = YOLO("yolo26n-obb.pt")

# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/boats.jpg")  # 結果リスト

# 結果を表示
for r in results:
    print(r.obb)  # 方向付き検出バウンディングボックスを含むOBBオブジェクトを出力する

OBBクラスのメソッドとプロパティについて、名前、型、説明を含む表を以下に示します。

名前種類説明
cpu()メソッドオブジェクトをCPUメモリに移動します。
numpy()メソッドオブジェクトをNumPy配列に変換します。
cuda()メソッドオブジェクトをCUDAメモリに移動します。
to()メソッドオブジェクトを指定したデバイスに移動します。
confプロパティ(torch.Tensor)ボックスの信頼度を返します。
clsプロパティ(torch.Tensor)ボックスのクラス値を返します。
idプロパティ(torch.Tensor)ボックスのトラックIDを返します(利用可能な場合)。
xyxyプロパティ(torch.Tensor)水平バウンディングボックスをxyxy形式で返します。
xywhrプロパティ(torch.Tensor)回転バウンディングボックスをxywhr形式で返します。
xyxyxyxyプロパティ(torch.Tensor)回転バウンディングボックスをxyxyxyxy形式で返します。
xyxyxyxynプロパティ(torch.Tensor)画像サイズで正規化した回転バウンディングボックスをxyxyxyxy形式で返します。

詳細については、OBBクラスのドキュメントを参照してください。

結果のプロット#

Resultsオブジェクトのplot()メソッドを使用すると、検出されたオブジェクト(バウンディングボックス、マスク、キーポイント、確率など)を元の画像に重ねて、予測結果を可視化できます。このメソッドは注釈付き画像をNumPy配列として返すため、簡単に表示または保存できます。

プロット
from PIL import Image

from ultralytics import YOLO

# Load a pretrained YOLO26n model
model = YOLO("yolo26n.pt")

# Run inference on 'bus.jpg'
results = model(["https://ultralytics.com/images/bus.jpg", "https://ultralytics.com/images/zidane.jpg"])  # results list

# Visualize the results
for i, r in enumerate(results):
    # Plot results image
    im_bgr = r.plot()  # BGR-order numpy array
    im_rgb = Image.fromarray(im_bgr[..., ::-1])  # RGB-order PIL image

    # Show results to screen (in supported environments)
    r.show()

    # Save results to disk
    r.save(filename=f"results{i}.jpg")

plot()メソッドのパラメーター#

plot()メソッドでは、出力をカスタマイズするためのさまざまな引数を使用できます。

引数種類説明デフォルト
confbool検出の信頼度スコアを含めます。True
line_widthfloatバウンディングボックスの線幅です。Noneの場合、画像サイズに応じて拡大縮小されます。None
font_sizefloatテキストのフォントサイズです。Noneの場合、画像サイズに応じて拡大縮小されます。None
fontstrテキスト注釈に使用するフォント名です。'Arial.ttf'
pilbool画像をPIL Imageオブジェクトとして返します。False
imgnp.ndarray | torch.Tensor代替画像です。テンソルは連続したHWC BGR uint8形式である必要があります。None
kpt_radiusint描画するキーポイントの半径です。5
kpt_lineboolキーポイントを線で接続します。True
labelsbool注釈にクラスラベルを含めます。True
boxesbool画像にバウンディングボックスを重ねます。True
masksbool画像にマスクを重ねます。True
probsbool分類確率を含めます。True
showboolデフォルトの画像ビューアーを使用して、注釈付き画像を直接表示します。False
saveboolfilenameで指定したファイルに注釈付き画像を保存します。False
filenamestrsaveがTrueの場合に注釈付き画像を保存するファイルのパスと名前です。None
color_modestr「instance」や「class」などのカラーモードを指定します。'class'
txt_colortuple[int, int, int]分類ラベルのテキスト色(BGR)です。(255, 255, 255)

スレッドセーフな推論#

複数のYOLOモデルを異なるスレッドで並行して実行する場合、推論中のスレッドセーフ性を確保することが重要です。スレッドセーフな推論では、各スレッドの予測が分離され、互いに干渉しないため、競合状態を回避し、一貫性と信頼性のある出力を実現できます。

マルチスレッドアプリケーションでYOLOモデルを使用する場合は、競合を防ぐため、スレッドごとに個別のモデルオブジェクトをインスタンス化するか、スレッドローカルストレージを使用することが重要です。

スレッドセーフな推論

スレッドセーフな推論を行うには、各スレッド内でモデルを1つインスタンス化します。

from threading import Thread

from ultralytics import YOLO

def thread_safe_predict(model, image_path):
    """Performs thread-safe prediction on an image using a locally instantiated YOLO model."""
    model = YOLO(model)
    results = model.predict(image_path)
    # 結果を処理する

# それぞれが独自のモデルインスタンスを持つスレッドを開始する
Thread(target=thread_safe_predict, args=("yolo26n.pt", "image1.jpg")).start()
Thread(target=thread_safe_predict, args=("yolo26n.pt", "image2.jpg")).start()

YOLOモデルを使用したスレッドセーフな推論の詳細と手順については、YOLOスレッドセーフ推論ガイドをご覧ください。このガイドでは、よくある問題を回避し、マルチスレッド推論を円滑に実行するために必要な情報をすべて紹介しています。

ストリーミングソースのforループ#

OpenCV(cv2)とYOLOを使用して、ビデオフレームに推論を実行するPythonスクリプトの例です。このスクリプトでは、必要なパッケージ(opencv-pythonおよびultralytics)がすでにインストールされていることを前提としています。

ストリーミングforループ
import cv2

from ultralytics import YOLO

# YOLOモデルを読み込む
model = YOLO("yolo26n.pt")

# ビデオファイルを開く
video_path = "path/to/your/video/file.mp4"
cap = cv2.VideoCapture(video_path)

# ビデオフレームをループ処理する
while cap.isOpened():
    # ビデオからフレームを読み込む
    success, frame = cap.read()

    if success:
        # フレームにYOLO推論を実行する
        results = model(frame)

        # フレーム上に結果を可視化する
        annotated_frame = results[0].plot()

        # 注釈付きフレームを表示する
        cv2.imshow("YOLO Inference", annotated_frame)

        # 'q'が押された場合にループを終了する
        if cv2.waitKey(1) & 0xFF == ord("q"):
            break
    else:
        # ビデオの最後に到達した場合にループを終了する
        break

# ビデオキャプチャオブジェクトを解放し、表示ウィンドウを閉じる
cap.release()
cv2.destroyAllWindows()

このスクリプトはビデオの各フレームに予測を実行し、結果を可視化してウィンドウに表示します。「q」を押すとループを終了できます。

次のステップ#

事前学習済みモデルの次の段階に進む準備はできていますか?タスクが問題に適しているか確認し、データセットガイドを参考に独自のデータを形式化してから、そのデータで学習してください。

よくある質問#

  • Ultralytics YOLOは、リアルタイムの物体検出、インスタンスセグメンテーション、セマンティックセグメンテーション、深度推定、分類、姿勢推定、および方向付きバウンディングボックス(OBB)検出に対応する最先端のモデルです。predictモードを使用すると、画像、ビデオ、ライブストリームなど、さまざまなデータソースに対して高速な推論を実行できます。パフォーマンスと汎用性を重視して設計されており、バッチ処理モードとストリーミングモードも備えています。機能の詳細については、Ultralytics YOLOのpredictモードをご覧ください。

  • Ultralytics YOLOは、個々の画像、ビデオ、ディレクトリ、URL、ストリームなど、幅広いデータソースを処理できます。model.predict()呼び出しでデータソースを指定できます。たとえば、ローカル画像には'image.jpg'を、URLには'https://ultralytics.com/images/bus.jpg'を使用します。ドキュメントの推論ソースでは、さまざまなソースの詳細な例をご覧いただけます。

  • 推論速度を最適化し、メモリを効率的に管理するには、予測器の呼び出しメソッドでstream=Trueを設定してストリーミングモードを使用できます。ストリーミングモードでは、すべてのフレームをメモリに読み込む代わりに、メモリ効率の高いResultsオブジェクトのジェネレーターが生成されます。長いビデオや大規模なデータセットを処理する場合に特に便利です。ストリーミングモードの詳細をご覧ください。

  • YOLOのmodel.predict()メソッドでは、conf、iou、imgsz、deviceなど、さまざまな引数を使用できます。これらの引数を使って推論プロセスをカスタマイズし、信頼度のしきい値、画像サイズ、計算に使用するデバイスなどのパラメーターを設定できます。各引数の詳しい説明は、推論引数のセクションをご覧ください。

  • model.embed(source)を使用すると、最後から2番目のレイヤーから特徴埋め込みを抽出できます。または、特定のレイヤーを選択するには、embed=[layer_index]をmodel.predict()に渡します。

    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    source = "https://ultralytics.com/images/bus.jpg"
    
    results = model.predict(source)  # 結果オブジェクト
    embeddings = model.embed(source)  # torch.Tensor埋め込みのリスト
  • YOLOで推論を実行すると、Resultsオブジェクトに注釈付き画像を表示および保存するメソッドが含まれます。result.show()やresult.save(filename="result.jpg")などのメソッドを使用して、結果を可視化して保存できます。ファイル名のパスに存在しない親ディレクトリは自動的に作成されます(例:result.save("path/to/result.jpg"))。これらのメソッドの一覧については、結果の操作のセクションをご覧ください。

コメント