Ultralytics YOLO27:

Tiger-Poseデータセット#

はじめに#

Ultralyticsは、ポーズ推定タスク向けに設計された汎用性の高いコレクションであるTiger-Poseデータセットを提供しています。このデータセットは、YouTube動画から取得した263枚の画像で構成されており、210枚がトレーニング用、53枚が検証用に割り当てられています。ポーズ推定アルゴリズムのテストやトラブルシューティングに適した優れたリソースです。

トレーニング用のデータが210枚と扱いやすい規模である一方、Tiger-Poseデータセットは多様性を備えているため、トレーニングパイプラインの評価や潜在的なエラーの特定に適しています。また、より大規模なデータセットでポーズ推定に取り組む前の有用な準備段階としても利用できます。

この小規模なデータセットでパイプラインが正常にトレーニングできたら、独自の動物または物体のキーポイントに置き換え、ブラウザーから離れることなくUltralytics Platformでトレーニングを拡大できます。

データセットの構成#

  • 画像の総数: 263枚(トレーニング210枚 / 検証53枚)。
  • キーポイント: トラ1頭あたり12個(visibilityフラグなし)。
  • ダウンロードサイズ: ~49.8 MB。
  • ディレクトリ構成: YOLO形式のキーポイントが、labels/{train,val}の下にimages/{train,val}ディレクトリとともに保存されています。


Watch: Train an Ultralytics YOLO Pose Model on the Tiger-Pose Dataset

データセット YAML#

YAMLファイルは、データセットの設定の詳細を指定するための手段です。ファイルパス、クラス定義、その他の関連情報など、重要なデータが含まれています。具体的には、tiger-pose.yamlファイルについては、Ultralytics Tiger-Poseデータセット設定ファイルを確認できます。

ultralytics/cfg/datasets/tiger-pose.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# Tiger Pose dataset by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/tiger-pose
# Example usage: yolo train data=tiger-pose.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── tiger-pose ← downloads here (49.8 MB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: tiger-pose # dataset root dir
train: images/train # train images (relative to 'path') 210 images
val: images/val # val images (relative to 'path') 53 images

# Keypoints
kpt_shape: [12, 2] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11]

# Classes
names:
  0: tiger

# Keypoint names per class
kpt_names:
  0:
    - nose
    - head
    - withers
    - tail_base
    - right_hind_hock
    - right_hind_paw
    - left_hind_paw
    - left_hind_hock
    - right_front_wrist
    - right_front_paw
    - left_front_wrist
    - left_front_paw

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/tiger-pose.zip

使用方法#

Tiger-PoseデータセットでYOLO26n-poseモデルを、画像サイズ640、100エポックでトレーニングするには、次のコードスニペットを使用できます。利用可能な引数の一覧については、モデルのトレーニングページを参照してください。

トレーニング例
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-pose.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)

サンプル画像とアノテーション#

以下に、Tiger-Poseデータセットの画像例と、それぞれに対応するアノテーションを示します。

Tiger pose estimation dataset mosaic training batch
  • モザイク化画像: この画像は、モザイク化されたデータセット画像で構成されたトレーニングバッチを示しています。モザイク化は、トレーニング中に複数の画像を1枚の画像に組み合わせ、各トレーニングバッチ内の物体やシーンの多様性を高める技法です。これにより、さまざまな物体サイズ、アスペクト比、コンテキストに対するモデルの汎化性能を向上させます。

この例は、Tiger-Poseデータセットに含まれる画像の多様性と複雑さ、およびトレーニングプロセスでモザイキングを使用する利点を示しています。

推論例#

トレーニング後、最適なチェックポイントを読み込み、新しい画像または動画で推論を実行します。引数の一覧については、予測ページを参照してください。

推論例
from ultralytics import YOLO

# Load a model
model = YOLO("path/to/best.pt")  # load a tiger-pose trained model

# Run inference
results = model.predict(source="https://youtu.be/Gc6K5eKrTNQ", show=True)

引用と謝辞#

Ultralyticsは、Tiger-PoseデータセットのアノテーションをAGPL-3.0ライセンスの下で公開しています。元の動画には元の利用規約が適用されるため、抽出したフレームを使用または再配布する前に確認してください。

FAQ#

  • Ultralytics Tiger-Poseデータセットは、YouTube動画から取得した263枚の画像で構成され、ポーズ推定タスク向けに設計されています。データセットはトレーニング用画像210枚と検証用画像53枚に分割されており、ポーズ推定アルゴリズムのテスト、トレーニング、改善に適しています。

  • yolo26n-pose.ptを読み込み、model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)を呼び出します。完全なPythonおよびCLIのコードスニペットについては、上記のトレーニング例を、引数の一覧についてはトレーニングページを参照してください。

  • tiger-pose.yamlファイルでは、データセットのパス、トレーニング/検証用画像ディレクトリ、単一クラス(tiger)、およびkpt_shape: [12, 2](各インスタンスあたり12個のキーポイント、visibilityフラグなし)が定義されています。正確な設定については、Ultralytics Tiger-Poseデータセット設定ファイルを参照してください。

  • トレーニング済みのチェックポイント(例: path/to/best.pt)を読み込み、model.predict(source=..., show=True)を呼び出します。完全なPythonおよびCLIのコードスニペットについては、上記の推論例を、引数の一覧については予測ページを参照してください。

  • 合計263枚の画像(トレーニング210枚 / 検証53枚)、1クラス、インスタンスあたり12個のキーポイント、~49.8 MBのダウンロードサイズを備えたTiger-Poseは、すばやく扱えるほど小規模でありながら、ポーズトレーニングパイプラインのサニティチェックを行い、より大規模なデータセットに取り組む前にエラーを特定できるだけの多様性も備えています。

コメント