Ultralytics YOLO27:

データセット#

Ultralytics Platformのデータセットは、トレーニングデータを効率的に管理するためのソリューションを提供します。アップロード後、プラットフォームが画像、ラベル、統計情報を自動的に処理します。

処理が完了し、train スプリットに少なくとも1枚の画像、val または test スプリットのいずれかに少なくとも1枚の画像、さらにラベル付き画像が少なくとも1枚あると、データセットはトレーニング可能になります。3つの条件をすべて満たすとデータセットヘッダーに Ready バッジが表示され、それ以外の場合は Not Ready バッジが表示されます。バッジをクリックすると、不足している条件を正確に確認できます。

エージェントで画像を収集する#

Agentsを使用して、選択した範囲内の信頼度など、モデル検出が条件を満たしたときにデータセットへ画像を追加します。その条件をDatasetブロックに接続し、編集可能な宛先を選択します。画像はラベルなしでtrainスプリットに届き、既存のコピーはスキップされます。既存のannotation editorで画像を確認し、ラベル付けします。

データセットをアップロード#

Ultralytics Platformは、柔軟性を高めるために複数のアップロード形式に対応しています。

すでに別の場所にデータがありますか?

すでにRoboflowにデータセットがある場合は、Integrationsを使用して直接インポートできます。手動でのエクスポートや再アップロードは必要ありません。Google Cloud StorageAmazon S3、またはAzure Blob Storageのデータは、Cloud storageを使用してその場で利用できます。Enterpriseワークスペースでは、On Premiseを使用してローカルデータのインデックス作成とトレーニングを行えます。ピクセルデータをPlatformに送信する必要はありません。

サポートされているフォーマット#

形式拡張子注記最大サイズ
JPEG.jpg.jpeg最も一般的で推奨50 MB
PNG.png透明度に対応50 MB
WebP.webp最新形式で高圧縮率50 MB
BMP.bmp非圧縮50 MB
TIFF.tiff.tif高品質50 MB
HEIC.heiciPhoneの写真50 MB
AVIF.avif次世代形式50 MB
JP2.jp2JPEG 200050 MB
DNG.dngカメラのRAWデータ50 MB
MPO.mpo複数画像オブジェクト50 MB

動画コーデックのサポート#

ファイル拡張子だけでは十分ではありません。コーデックを処理中にデコードできない場合、動画の処理に失敗することがあります。

H.264 MP4を使用

MP4コンテナ内のH.264動画は、デコーダーのサポート範囲が最も広く、安全な選択肢です。動画を処理できない場合は、FFmpegで再エンコードしてください。

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

データセットの準備#

プラットフォームは、Ultralytics YOLOCOCOセマンティックPNGマスク深度データセットUltralytics NDJSON、および生データ(アノテーションなし)のアップロードをサポートしています。

data.yaml ファイルを含む標準的なYOLOディレクトリ構造を使用してください。

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

YAMLファイルでデータセットの設定を定義します。

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
RAWアップロード

RAW: アノテーションのない画像(ラベルなし)をアップロードします。annotation editorを使用してPlatform上で直接アノテーションを付ける予定がある場合に便利です。

フラットなディレクトリ構造

明示的なスプリットフォルダーなしで画像をアップロードすることもできます。Platformはアップロード中にアクティブなスプリットターゲットを適用します。スプリットターゲットが設定されておらず、アップロード後に val が空になる場合、またはDepth用の対応マップが2組未満になる場合、分類以外のデータセットではトレーニング画像が自動的に val に移動され、データセットがすぐにトレーニング可能になります。分類データセットはディレクトリベースのスプリットを使用するため、この処理の対象外です。後からbulk move-to-splitまたはsplit redistributionを使用して画像を再割り当てできます。

形式の自動検出

形式は自動的に検出されます。namestrain、または val キーを含む data.yaml を持つデータセットは、YOLOとして扱われます。imagesannotationscategories 配列を含むCOCO JSONファイルを持つデータセットは、COCOとして扱われます。.ndjson エクスポートはUltralytics NDJSONとしてインポートされます。画像のみでアノテーションがないデータセットは、RAWとして扱われます。

アーカイブに複数のYAMLファイルが含まれている場合、Platformはアーカイブのルートに最も近い標準名(data.yamldata.ymldataset.yamldataset.yml)を優先します。曖昧さを避けるため、1つのアーカイブにつき、明確な名前のYAMLを1つだけ保持してください。

Pascal VOC XMLはインポートされません

Pascal VOC XML形式のラベルファイルは検出されますが、アノテーションはインポートされません。画像はアノテーションなしでアップロードされます。アップロード開始前にPlatformが警告("Pascal VOC labels detected")を表示します。まずVOC XMLをYOLOまたはCOCOに変換してください。詳しくはformat conversion toolsを参照してください。

ラベルがクラスIDを参照しているにもかかわらずクラス名が指定されていない場合、Platformは連続したプレースホルダー名(class0class1、…)を生成します。これらは後からClasses tabで名前を変更できます。

タスク別の形式の詳細については、supported tasksDatasets Overviewを参照してください。

アップロードプロセス#

データセットを作成するには、次の手順を実行します。

  1. サイドバーで Annotate に移動します
  2. New Datasetをクリックします
  3. データソースのタブを選択します(下記のData Sourcesを参照)
  4. 名前を追加します。URLスラッグは自動的に生成され、編集もできます。任意で説明も追加できます。
  5. タスクタイプ(supported tasksを参照)、任意のライセンス(available licensesを参照)、公開設定(パブリックまたはプライベート)を選択します
  6. ローカルファイルの場合は Create & Upload、URLまたは接続済みソースの場合は Create & Import、空の状態から開始する場合は Create Dataset をクリックします

Ultralytics Platform Datasets Upload Dialog Task Selector

既存のデータセットにファイルを追加するには、該当するデータセットのページを開き、ギャラリーにファイルをドラッグするか、ページヘッダーのアップロードアイコンをクリックします。データセットのタスクがすでに定義されているため、アップロードアイコンをクリックするとブラウザのネイティブファイルピッカーが直接開きます。

データソース#

New Dataset ダイアログには4つのソースがあります。

ソース説明
アップロードファイルをドラッグするか、参照して選択します。画像、動画、アーカイブ、NDJSONに対応しています。
URL.zip.tar.tar.gz.tgz、または .ndjson ファイルへの直接リンクを貼り付けます。Platformがサーバー側でダウンロードおよび取り込みを行います。
CloudGoogle Cloud StorageAmazon S3、またはAzure Blob Storageのデータをその場で使用します(ProおよびEnterprise)。
On PremiseOn Premiseワーカーを介して、自社のマシンから外部に出ることのないデータのインデックス作成とトレーニングを行います(Enterprise)。
URLインポートの制限

URLインポートには、プランごとのアップロード上限(Freeは10 GB / Proは20 GB / Enterpriseは50 GB)と残りのストレージ容量の両方が適用され、より小さい方が上限になります。リンクはHTTPまたはHTTPS経由で公開アクセスでき、対応する拡張子で終わっている必要があります。

アップロード開始前#

Platformは、何かをアップロードする前にブラウザーでファイルを検証するため、長時間の転送後ではなく、一般的な問題をすぐに確認できます。アーカイブについては、破損、空、パスワード保護、YAML構文エラーがないか確認され、サイズ超過のファイルは名前とともに一覧表示されます。

その後、2つのダイアログが表示される場合があります。

アーカイブでクラス名が定義されており、データセットにすでにクラスがある場合、Map imported classes ダイアログには、インポートされる各クラスにつき1行が表示されます。各クラスについて、統合先となる既存のクラスを選択するか、新しいクラスを作成するか、スキップします。名前が完全一致するクラスはあらかじめ選択され、スキップしたクラスとそのアノテーションはインポートされません。

アップロード後、プラットフォームによってデータが自動的に処理されます。

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. 検証: フォーマットとサイズをチェックします
  2. 正規化: 大きな画像のサイズを変更(最大4096px、最小辺28px)し、グレースケールをRGBに変換し、透明部分を白の背景に合成し、EXIFの向きを適用します
  3. サムネイル: 256pxのWebPプレビューを生成します
  4. ラベルの解析: YOLO、COCO、NDJSONのラベルを抽出します
  5. 統計情報: クラス分布と画像の寸法を計算します
保存される画像エンコーディング

リサイズや色の変更が不要な場合、AVIFおよびWebPのオリジナル画像はバイト単位でそのまま保存されます。それ以外はすべて再エンコードされます。WebPソースはWebPのまま、それ以外のすべての形式(JPEG、PNG、BMP、TIFF、HEIC、JP2、DNG、MPO)は品質92のJPEGになります。元のファイル名とソース拡張子はメタデータとして保持されます。

Ultralytics Platformのデータセットアップロード進行状況バー

アップロード前の検証

アップロード前に、データセットをローカルで検証できます。

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
画像サイズの要件

画像の短辺は28px以上である必要があります。これより小さい画像は処理中に拒否されます。長辺が4096pxを超える画像は、アスペクト比を維持したまま自動的にリサイズされます。

画像を参照#

データセットの画像を複数のレイアウトで表示します。

ギャラリーのツールバーからクラスタリングパネルを開くと、データセットをインタラクティブな2D散布図として探索できます。

表示説明
グリッドアノテーションオーバーレイ付きのサムネイルグリッド(デフォルト)
コンパクトすばやく確認するための小さなサムネイル
テーブルサムネイル、ファイル名、寸法、サイズ、分割、クラス、ラベル数を含む一覧

アノテーション付きのUltralytics Platformデータセットギャラリーのグリッド表示

並べ替えとフィルタリング#

効率的に参照できるよう、画像を並べ替えたりフィルタリングしたりできます。

各オプションは昇順(↑)と降順(↓)を切り替えます。

並べ替え説明
作成日時 ↑/↓アップロード順(デフォルトは↓)
名前 ↑/↓ファイル名のアルファベット順
高さ ↑/↓画像の高さ(ピクセル)
幅 ↑/↓画像の幅(ピクセル)
サイズ ↑/↓ディスク上のファイルサイズ
アノテーション ↑/↓画像ごとのアノテーション数
大規模なデータセット

100,000枚を超えるデータセットでは、ギャラリーの応答性を維持するため、名前、幅、高さ、サイズによる並べ替えが非表示になります。作成日時とアノテーション数による並べ替えは引き続き利用できます。

未ラベル画像の検索

AnnotationsフィルターをUnannotatedに設定すると、まだアノテーションが必要な画像をすばやく見つけられます。ラベリングの進捗を追跡したい大規模なデータセットで特に便利です。

カスタムメタデータの検索

検索ボックスはギャラリーのツールバー右側にあり、グリッド、コンパクト、テーブルのすべての表示モードをフィルタリングします。画像のファイル名(ファイル拡張子は省略可能)に加えて、カスタムメタデータのキー、スカラー値、配列の要素にも一致するため、{"ship_type": "yacht"}を持つimg_0042という名前の画像は、img_0042またはyachtで検索すると見つかります。

サブオブジェクト内にネストされた値は一致しません。24文字の画像IDを貼り付けると、テキスト検索を迂回して、その画像を直接検索します。

フルスクリーンビューアー#

画像をクリックすると、次の機能を備えたフルスクリーンビューアーが開きます。

  • ナビゲーション: 矢印キーまたはサムネイルプレビューで参照します
  • 画像情報: Platformが生成したプロパティ、カスタムメタデータ、EXIFなどの埋め込みファイルメタデータを確認します
  • カスタムメタデータ: オーナーと編集者は、最大500,000文字のシリアライズ済み文字数および最大128文字のトップレベルキーを含むJSONオブジェクトを追加または置換できます
  • アノテーション: アノテーションオーバーレイの表示を切り替えます
  • クラスの内訳: クラスごとのラベル数を色のインジケーター付きで表示します
  • アノテーション: 編集アクセス権がある場合、デスクトップでフルスクリーンビューアーを開くと、アノテーションコントロールがすぐに有効になります
  • ダウンロード: 元の画像ファイルをダウンロードします
  • 削除: データセットから画像を削除します
  • ズーム: Cmd/Ctrl+ScrollCmd/Ctrl++、またはCmd/Ctrl+=で拡大し、Cmd/Ctrl+-で縮小します
  • 表示をリセット: Cmd/Ctrl + 0またはリセットボタンを使用して、画像をビューアーに収まるように表示します
  • パン: ズーム中にSpaceを押したままドラッグすると、キャンバスをパンできます
  • ピクセル表示: ピクセル化されたレンダリングを切り替えて、細部を確認します
  • 深度カーテン: 深度データセットでは、ドラッグ可能な仕切りを動かして、RGB画像とカラー化された深度マップをワイプ表示します

メタデータパネル付きのUltralytics Platformデータセットフルスクリーンビューアー

分割でフィルタリング#

データセットの分割に基づいて画像をフィルタリングします。

分割目的
トレーニングモデルのトレーニングに使用
Valトレーニング中の検証に使用
Test最終評価に使用

クラスタリング#

Clusteringパネルは、データセットをインタラクティブな2D散布図に投影し、視覚的に類似した画像を近くに配置します。これを使用して、クラスターの把握、重複や外れ値の検出、データ全体における分割やクラスの分布の確認を、ギャラリーを離れずに行えます。データセットページのギャラリーツールバーにある散布図アイコンから開きます。

Ultralytics Platformデータセットのクラスタリング空状態

分析の実行#

分析を開始します。

  1. データセットを開き、ギャラリーのツールバーにある散布図アイコンをクリックします
  2. Analyze Datasetをクリックします
  3. 進行状況バーが完了するまで待ちます。結果は同じパネルに表示されます

分析はComputing embeddingsClusteringの2段階でバックグラウンド実行され、データセットのサイズによっては数分かかる場合があります。パネルを閉じたり、ページを離れて後から戻ったりできます。

分析の要件

分析するには、エラーのない画像が20枚以上、200,000枚以下含まれているデータセットが必要です。クラウドまたはOn Premiseストレージを基盤とする接続済みデータセットは、まだサポートされていません。

可視化#

分析が完了すると、パネルに分析対象となったすべての画像の2D散布図、凡例、ポイントカウンターが表示されます。ギャラリーのフィルター(分割、クラス、ラベル済み/未ラベル)を使用すると、フィルター対象外のポイントが薄く表示され、必要なサブセットに集中できます。カウンターにはvisible / total pointsと表示されます。

Ultralytics Platformのデータセットクラスタリング散布図

色分け#

パネルツールバーのColor byドロップダウンで、データポイントの色分け方法を変更できます。表示モードはいつでも切り替えられます。プロットの色はすぐに変わるため、クラスター全体で分割、クラス、画像プロパティがどのように分布しているかを確認できます。

オプション色分け
分割Train / Val / Test
クラス各画像の最初のアノテーションクラス
画像の幅
高さ画像の高さ
サイズファイルサイズ
アノテーション画像あたりのアノテーション数

Ultralytics Platformのデータセットクラスタリング色モード

ラッソ選択#

領域の周囲を自由形式で選択して、プロット上のポイントを強調表示します。ギャラリーは一致する画像に絞り込まれるため、通常の画像操作を使用して、画像の確認、再ラベル付け、移動、削除を行えます。

選択をクリア

チャート上部のチップに選択中のポイント数が表示されます。×をクリックすると、ラッソ選択がクリアされ、ギャラリー全体の表示に戻ります。

選択サイズ

ラッソで選択できる画像は最大1,000枚です。選択範囲がそれを超える場合、Platformはサンプリングした1,000枚を表示し、より小さい領域を描くよう提案します。

パンとズーム#

マウスとキーボードから直接大規模な散布図を操作するか、プロット左下のズームボタンを使用できます。

入力操作
スクロールプロットを2Dでパン
Cmd/Ctrl+スクロールカーソル位置を基準にズームインまたはズームアウト
Spaceを押し続けるドラッグしてパンするモードに切り替え
リセットボタンプロット全体の範囲に戻す

再分析#

分析後にデータセットが変更された場合(新しい画像が追加された場合や、分析済みの件数がデータセットと一致しなくなった場合)、所有者と編集者にはパネル上部にRe-analyzeボタンが表示されます。

Re-analyzeをクリックすると、埋め込みと2D投影が最初から再計算されます。

類似画像の検索#

同じ埋め込みが、パブリックデータセット全体での類似度検索を可能にします。編集可能なデータセットにおいて、グリッドまたはコンパクトビュー(またはテーブルビューで選択された単行)内の画像を右クリックし、類似画像を検索を選択します。ダイアログには、データセットがすでに保持している画像や他のデータセットにおける選択画像のコピーを除外した、最も近いパブリック画像が最大24件、そのソースデータセット、ライセンス、および類似度スコアとともにリストされます。必要なものを選択してデータセットに追加をクリックすると、それらはラベルなし画像として train スプリットに追加され、ストレージの容量としてカウントされ、アノテーションの準備が整います。

埋め込みを持たない画像(まだ分析されていないデータセット内、または最後の分析以降に追加されたもの)には Analyze this dataset in Clustering to find similar images が表示されます。このダイアログは接続されたデータセットでは使用できません。モデルの画像ごとの検証診断は、最もパフォーマンスの低い画像から同じ検索を実行します。

データセットタブ#

各データセットページには、データセットの状態と権限に応じて最大6つのタブが表示されます。

Imagesタブ#

アノテーションオーバーレイ付きの画像ギャラリーを表示するデフォルトビューです。グリッド、コンパクト、テーブルの表示モードに対応しています。ここにファイルをドラッグ&ドロップすると、画像を追加できます。

Classesタブ#

このタブは、データセットに画像があり、そのタスクにクラスが存在する場合に表示されます。

データセットのアノテーションクラスを管理できます。

  • クラスヒストグラム: クラスごとのアノテーション数を頻度順に表示する棒グラフです。線形スケールと対数スケールを切り替えられます
  • クラステーブル: インデックス、名前、アノテーション数、画像数を含む、並べ替えと検索に対応したテーブルです
  • クラス名の編集: 任意のクラス名をクリックすると、インラインで名前を変更できます
  • クラスの色の編集: カラースウォッチをクリックすると、クラスの色を変更できます
  • 新しいクラスの追加: 下部の入力欄を使用してクラスを追加できます
  • クラスのマージ: 2つ以上の行を選択し、Merge into oneをクリックします
  • クラスの削除: 1つ以上の行を選択し、Deleteをクリックします

Ultralytics PlatformのデータセットClassesタブのヒストグラムとテーブル

不均衡なデータセット向けの対数スケール

データセットにクラスの不均衡(例: "person"のアノテーションが10,000件ある一方で、"bicycle"が50件しかない)がある場合は、クラスヒストグラムのLog Scale切り替えを使用すると、すべてのクラスを明確に可視化できます。

クラスのマージ#

マージすると、重複するラベルや重なり合うラベルを統合できます。たとえば、carautomobilevehicleを1つのクラスにまとめられます。

  1. 行のチェックボックスを使用して、2つ以上のクラスを選択します
  2. テーブルヘッダーのMerge into oneをクリックするか、選択範囲を右クリックします
  3. 選択したクラスのうち、他のクラスをマージする対象クラスを選択します
  4. 確認します

元のクラスに属するすべてのアノテーションが対象クラスに再割り当てされ、元のクラスは削除されます。アノテーションは削除されないため、データセットのアノテーション総数は変わりません。

クラスの削除#

  1. 行のチェックボックスを使用して、1つ以上のクラスを選択します
  2. テーブルヘッダーのDeleteをクリックするか、選択範囲を右クリックします
  3. 確認します

クラスを削除すると、そのクラスとすべてのアノテーションが削除されます。分類データセットではラベルのみが削除され、画像は残るため、未アノテーションの状態になります。

クラスインデックスのシフト

クラスIDは位置によって決まります。クラスをマージまたは削除すると、空いた位置を埋めるため、それより後ろにあるすべてのクラスインデックスが繰り上がります。そのため、変更前に作成したエクスポートやラベルファイルは新しいインデックスと一致しなくなります。以前の番号が必要な場合は、先にバージョンを作成してください。

統計のサンプリング

クラス数は最大100,000枚の画像から計算されます。100,000枚を超えるデータセットでは、ヒストグラムの上に「このデータセットの100,000枚のサブセットに基づいています。」という注記が表示されます。

Chartsタブ#

このタブは、データセットに画像がある場合に表示されます。

データセットから自動的に計算される統計情報です。

チャートは次の順序で表示され、該当するデータがない場合は省略されます。生画像データセットにはアノテーションチャートが表示されず、Points per Instanceはセグメントデータとポーズデータの場合にのみ表示されます。

チャート説明
分割の分布Train/Val/Testの画像数とラベル付き画像の割合を示すドーナツチャート
上位クラスアノテーション数が最も多い10クラスを示すドーナツチャート。残りは「その他」として表示されます
画像サイズ画像の幅と高さの分布を平均値とともに重ねて表示するヒストグラム
画像ファイルサイズ画像ファイルサイズの分布を示すヒストグラム
画像サイズ2Dアスペクト比のガイドライン付きの、幅と高さの2Dヒートマップ
アノテーション位置バウンディングボックスの中心位置を示す2Dヒートマップ
画像形式元画像の形式(JPG、PNGなど)の分布
バウンディングボックスのサイズバウンディングボックスの幅と高さを重ねて表示するヒストグラム
画像あたりのオブジェクト数画像あたりのアノテーション数を示すヒストグラム
インスタンスあたりのポイント数アノテーションあたりのポリゴン頂点数またはキーポイント数(セグメント/ポーズ)

Ultralytics PlatformのデータセットChartsタブの統計グリッド

統計情報のキャッシュ

Platformは計算済みの統計情報をキャッシュし、画像、アノテーション、クラス、分割が変更されるとキャッシュを無効化します。100,000枚を超えるデータセットでは、チャートは100,000枚の画像のサブセットから計算され、その旨がグリッド上部に表示されます。

全画面ヒートマップ

任意のヒートマップで展開ボタンをクリックすると、全画面モードで表示できます。より大きく詳細な表示になるため、大規模なデータセットの空間パターンを把握するのに役立ちます。

Modelsタブ#

このデータセットでトレーニングしたすべてのモデルを、検索可能なテーブルで表示します:

説明
名前リンク付きモデル名
プロジェクトアイコン付き親プロジェクト
バージョントレーニングに使用した変更不可のデータセットバージョン(存在する場合)
ステータストレーニングステータスバッジ
タスクYOLOタスクタイプ
エポック数最良エポック / 合計エポック数
mAP50-95平均適合率
mAP50IoU 0.50でのmAP
作成日時作成日

Ultralytics Platform Datasets Models Tab Trained Models Table

エラータブ#

このタブは、1つ以上のファイルの処理に失敗した場合にのみ表示されます。

処理に失敗した画像には、次の情報が表示されます:

  • エラーバナー: 失敗した画像の合計数とガイダンス
  • エラーテーブル: ファイル名、ユーザーフレンドリーなエラーの説明、修正のヒント、プレビューサムネイル
  • よくあるエラーには、破損したファイル、サポートされていない形式、小さすぎる画像(最小28px)、サポートされていないカラーモードなどがあります

Ultralytics Platform Datasets Errors Tab Processing Failures

よくある処理エラー
エラー原因修正方法
画像ファイルを読み取れません破損しているか、サポートされていない形式です画像エディターから再エクスポートします
不完全または破損しています転送中にファイルが切り詰められました元のファイルを再ダウンロードします
サポートされていない画像形式ですPlatformでデコードできない形式ですJPG、PNG、またはWebPに変換します
ファイル権限エラーファイルがロックされているか、読み取り保護されていますファイルのロックを解除して再アップロードします
画像が小さすぎます最小寸法が28px未満ですより高解像度の元画像を使用します
サポートされていないカラーモードですCMYKまたはインデックスカラーのカラーモードですRGBモードに変換します

バージョンタブ#

再現可能なトレーニングのために、データセットの変更不可なNDJSONスナップショットを作成します。各バージョンには、作成時点の画像数、クラス数、アノテーション数、ファイルサイズが記録されます。

説明
バージョンバージョン番号(v1、v2、...)
説明ユーザーが指定した説明(編集可能)
画像スナップショット作成時点の画像数
クラススナップショット作成時点のクラス数
アノテーションスナップショット作成時点のアノテーション数
サイズNDJSONエクスポートファイルのサイズ
作成日時バージョンの作成日時
アクションダウンロードまたは復元

バージョンを作成するには:

  1. Versionsタブを開きます
  2. 必要に応じて説明を入力します(例: "Added 500 training images" または "Fixed mislabeled classes")
  3. New Versionをクリックします
  4. 新しいバージョンがテーブルに表示されます

各バージョンには連番(v1、v2、v3...)が付けられ、変更不可です。バージョン自体を編集または削除することはできず、変更できるのは説明のみです。行のアクションを使用すると、いつでも任意のバージョンをダウンロードまたは復元できます。

バージョンの復元

復元すると、選択したスナップショットでデータセットの現在の画像、分割、クラス、アノテーションが置き換えられます。事前に現在の状態を別のバージョンとして保存していない限り、元に戻すことはできません。再構築中、データセットはprocessingステータスでロックされます。復元中に再アップロードは行われないため、大規模なデータセットでも通常は短時間で完了します。

トレーニング中にバージョンを保存する

Cloud TrainingダイアログSave Dataset Versionを有効にすると、トレーニングに使用した正確なデータセットにモデルを関連付けることができます。データセットの内容が変更されていない場合、Platformは一致するバージョンを再利用し、変更された場合にのみ新しいバージョンを作成します。

準備完了したデータセットのみ

バージョンの作成と復元は、データセットがreadyステータスになった後に利用できます。接続済みクラウドデータセットまたはOn Premiseデータセットではバージョンを利用できません。

バージョンを作成するタイミング

画像の追加、アノテーションの修正、分割の再バランスなど、データセットに大きな変更を加える前後にバージョンを作成します。これにより、異なるデータセットの状態間でモデルのパフォーマンスを比較できます。

NDJSONファイルサイズ

表示されるサイズは、画像URLとアノテーションを含むNDJSONエクスポートファイルのサイズであり、画像自体のサイズではありません。実際の画像データは別途保存され、署名付きURLを介してアクセスされます。スナップショットファイルもワークスペースのストレージクォータにカウントされるため、空き容量がない場合はバージョンの作成に失敗します。

データセットをエクスポートする#

データセットヘッダーまたはバージョンタブからNDJSONをダウンロードして、オフラインで使用できるようにデータセットをエクスポートします。

エクスポートするには:

  1. データセットヘッダーのDownloadボタン(ダウンロードアイコン)をクリックします
  2. 現在のNDJSONスナップショットを直接ダウンロードします
  3. 後で再ダウンロードできる変更不可の番号付きスナップショットが必要な場合は、Versionsタブを使用します

Ultralytics Platform Datasets Export Ndjson Download

NDJSONフォーマットは1行に1つのJSONオブジェクトを保存します。1行目にデータセットのメタデータが含まれ、その後に画像1枚につき1行が続きます。

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

オプションの画像レベルのmetadataオブジェクトは、NDJSONファイルをPlatformにインポートする際にも保持されます。画像の全画面情報パネルから確認または編集できます。プログラムによるアーカイブのアップロードでは、Ingest Dataset Data APIが同等のimageMetadataパスマップを受け付けます。

Poseデータセットには、データセットヘッダー行にkpt_shapeフィールドも含まれます。このフィールドが未設定の場合は、アノテーションから推測されます。

Depthエクスポートでは、データセット行に"task": "depth""depth_scale": 1000を指定します。各画像行には、対応するプレーンなuint16 PNGのdepth.urlが含まれます。Ultralyticsは画像URLとDepth URLを同時にダウンロードし、同じスケールのトレーニング用YAMLを書き込むため、NDJSONファイルをmodel.train(data=...)に直接渡せます。

署名付きURL

エクスポートされたNDJSON内の画像URLには署名が付いており、7日間有効です。データセットが変更されていない場合、Platformはエクスポートを最大6日間キャッシュして再利用するため、新たにダウンロードしたファイルには常に少なくとも1日の有効期間が残ります。より早く新しいURLが必要な場合は、データセットを変更するか、新しいバージョンを作成します。

On Premiseデータセット

画像バイトがPlatformに到達しないOn Premiseデータセットでは、エクスポートを利用できません。

完全な仕様については、Ultralytics NDJSON形式のドキュメントを参照してください。

画像操作#

クイックアクション#

GridまたはCompactビューで任意の画像を右クリックすると、クイックアクションにアクセスできます:

操作説明
Move to Split画像をTrain、Val、またはTestの分割に再割り当てします
類似画像を検索パブリックデータセットから似た画像を検索して追加する(類似画像を検索を参照)
類似画像を生成画像のAI生成バリエーションを最大16個(デフォルトでは4個)作成し、保持するものをラベルなし画像として追加する
Download元の画像ファイルをダウンロードします
Deleteデータセットから画像を削除します

Ultralytics Platform Datasets Image Card Context Menu

単一操作と一括操作

画像のコンテキストメニューは単一の画像に対して操作します。複数の画像に対する一括操作には、チェックボックス選択が可能なTableビューを使用します。

一括で分割に移動#

選択した画像を同じデータセット内の別の分割に再割り当てします。

  1. Table ビューに切り替えます
  2. チェックボックスを使用して画像を選択します
  3. 右クリックしてコンテキストメニューを開きます
  4. Move to split > TrainValidation、または Test を選択します

グリッドビューでは、画像を分割フィルターのタブにドラッグ&ドロップすることもできます。画像を移動すると移動先の分割に同一の画像がすでに存在して衝突する場合、Platform はスキップ、両方を保持、置換のいずれかを選択するよう求めます。

Train/Val 分割の整理

すべての画像を1つのデータセットにアップロードし、一括移動機能でサブセットを train、validation、test の分割に整理します。

分割の再配分#

カスタム比率を使用して、すべての画像を train、validation、test の分割に再配分します。

  1. データセットツールバーの split bar をクリックして、Redistribute Splits ダイアログを開きます
  2. 以下のいずれかの方法で分割の割合を調整します
  3. リアルタイムの画像数プレビューを確認して、配分を確定します
  4. Apply をクリックして、設定した割合に従ってすべての画像をランダムに再割り当てします

Ultralytics Platform Datasets Split Redistribution Dialog

このダイアログでは、ターゲットの分割比率を設定する3つの方法が提供されます。

メソッド説明
ドラッグ色付きセグメント間のハンドルをドラッグして、分割の境界を視覚的に調整します
入力任意の分割の割合入力を編集します(残り2つの分割は比例配分で自動調整されます)
自動ワンクリックで train/validation を80/20に設定し、test の分割を0%にします

適用する前に、各分割に入る画像数をリアルタイムプレビューで正確に確認できます。

80/20分割(クイック設定)

Auto ボタンをクリックすると、推奨される train/validation の80/20分割を即座に設定できます。これはトレーニングで最も一般的な比率です。

一括削除#

複数の画像を一度に削除します。

  1. テーブルビューで画像を選択します
  2. 右クリックして Delete を選択するか、Cmd/Ctrl+Delete を押します
  3. 削除を確定します

データセット URI#

ul:// URI形式を使用して Platform のデータセットを参照します(Platform データセットの使用を参照)。

ul://username/datasets/dataset-slug

データセットまたはモデルのWeb URLを直接貼り付けることもできます(例: https://platform.ultralytics.com/username/datasets/dataset-slug)。URLは自動的に ul:// URIへ書き換えられます。データセットのリストを渡すと、各データセットで1つのベースモデルを順番にファインチューニングできます。例: model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"])

このURIを使用すると、どこからでもモデルをトレーニングできます。

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Platform データでどこからでもトレーニング

ul:// URIは、あらゆる環境で使用できます。

  • ローカルマシン: ハードウェア上でトレーニングし、データは自動的にダウンロードされます
  • Google Colab: ノートブックから Platform のデータセットにアクセスできます
  • リモートサーバー: データセット全体にアクセスできるクラウドVM上でトレーニングできます

利用可能なライセンス#

Platform は、データセットに対して以下のライセンスをサポートしています。

ライセンス
なしライセンス未選択
CC0-1.0パブリックドメイン
PDM-1.0パブリックドメイン
CC-BY-2.5許諾的
CC-BY-3.0許諾的
CC-BY-4.0許諾的
CC-BY-NC-2.0非商用
CC-BY-NC-3.0非商用
CC-BY-NC-4.0非商用
CC-BY-SA-3.0コピーレフト
CC-BY-SA-4.0コピーレフト
CC-BY-NC-SA-3.0コピーレフト
CC-BY-NC-SA-4.0コピーレフト
CC-BY-ND-4.0二次的著作物の作成不可
CC-BY-NC-ND-2.0非商用
CC-BY-NC-ND-4.0非商用
Apache-2.0許諾的
MIT許諾的
BSD-3-Clause許諾的
AGPL-3.0コピーレフト
GPL-2.0コピーレフト
GPL-3.0コピーレフト
LGPL-3.0コピーレフト
ODbL-1.0コピーレフト
DbCL-1.0ODbLが必要です
研究目的のみ制限付き
その他カスタム
コピーレフトライセンス

コピーレフトライセンス(AGPL-3.0、GPL-2.0、GPL-3.0、LGPL-3.0、ODbL-1.0、CC-BY-SA-3.0、CC-BY-SA-4.0、CC-BY-NC-SA-3.0、CC-BY-NC-SA-4.0)を持つデータセットをクローンする場合、そのクローンはライセンスを継承し、ライセンスセレクターがロックされます。

公開設定#

データセットを閲覧できるユーザーを管理します。

設定説明
プライベート自分と許可されたワークスペースメンバーがアクセスできます
パブリックExplore ページを含め、誰でも閲覧できます

公開設定は、New Dataset ダイアログのトグルスイッチを使用してデータセットの作成時に設定します。パブリックデータセットは Explore ページに表示されます。

データセットの編集#

データセットのメタデータは、ダイアログを開かずにデータセットページ上で直接インライン編集できます。

  • 名前: データセット名をクリックして編集します。変更はフォーカスが外れたとき、または Enter で自動保存されます。名前は100文字以内に制限されています。
  • 説明: 説明(または「説明を追加...」プレースホルダー)をクリックして編集します。変更は自動保存されます。説明は1,000文字以内に制限されています。
  • タスクタイプ: タスクバッジをクリックして、別のタスクタイプを選択します。
  • ライセンス: ライセンスセレクターをクリックして、データセットのライセンスを変更します。
  • アイコン: データセットのアイコンをクリックして、自分の画像をアップロードするか、データセットに含まれる画像をアイコンに設定するか、文字と色を選択します。
タスクタイプの変更

各画像には、すべてのタスクタイプのアノテーションがまとめて保存されます。データセットのタスクタイプを変更すると、エディターに表示され、エクスポートおよびトレーニングに含まれるアノテーションが決まります。他のタスクタイプのアノテーションはデータベースに保持され、元のタスクタイプに戻すと再び表示されます。Depth は例外です。Depth の正解データはアノテーションではなくペアファイルであるため、画像を保持しているデータセットは Depth への切り替え、または Depth からの切り替えができません。代わりに再インポートしてください。

カスタムメタデータ#

More actions を開き、Information を選択して2つのセクションを確認します。

  • Ultralytics Metadata: データセットID、所有者、タスク、画像数とアノテーション数、ストレージリージョン、タイムスタンプなど、Platform の読み取り専用の詳細情報です
  • Custom Metadata: データの出所、撮影条件、顧客ID、ガバナンス、その他のコンテキストデータに使用できる独自のJSONオブジェクトです

ワークスペース閲覧者はメタデータを確認でき、編集アクセス権を持つメンバーはカスタムメタデータオブジェクトを置き換えられます。シリアライズされたメタデータオブジェクトは500,000文字以内、トップレベルの各キーは128文字以内に制限されています。空のオブジェクト({})を保存すると、カスタムメタデータを消去できます。

データセットのクローン#

自分が所有していないパブリックデータセットを表示しているときに Clone Dataset をクリックすると、クローンダイアログが開きます。移行先のワークスペース、名前、公開設定、ライセンスを確認してから、クローンを確定します。コピーには、すべての画像、アノテーション、クラス定義が含まれます。パブリックなソースデータセットは、デフォルトの公開設定がパブリックのワークスペースでは、デフォルトでパブリックのままになります。Enterprise ワークスペースで作成されたクローンは、デフォルトでプライベートになります。元のデータセットにコピーレフトライセンスが付与されている場合、クローンにも継承され、ライセンスセレクターはロックされます。

移行先のスラッグがすでに使用されている場合は自動的に名前が変更され、クローンにはコピーを格納するのに十分な残りのストレージクォータが必要です。

接続済みデータセット

クラウドストレージ または オンプレミス ソースを基盤とするデータセットは、Platform が画像のバイトデータを保持していないため、クローンできません。

スターと共有#

  • スター: スターボタンをクリックしてデータセットをブックマークします。スター数はすべてのユーザーに表示されます。
  • 共有: パブリックデータセットでは、共有ボタンをクリックしてリンクをコピーしたり、埋め込みスニペットを取得したり、ソーシャルプラットフォームで共有したりできます。

データセットの削除#

不要になったデータセットを削除します。

  1. データセットヘッダーで More actions ボタン)を開きます
  2. Delete Dataset を選択します
  3. ダイアログで確認します: 「これにより、[name] はごみ箱に移動します。30日以内であれば復元できます。」

同じメニューには Information もあり、Custom Metadata で説明されているメタデータダイアログが開きます。また、Refresh を選択すると、サーバーからデータセットを再読み込みします。

ごみ箱と復元

削除したデータセットは完全に削除されず、ごみ箱に移動します。30日以内であれば Settings > Trash から復元できます。

データセットでトレーニング#

データセットから直接トレーニングを開始します:

  1. データセットページで New Model をクリックします
  2. プロジェクトを選択するか、新規作成します
  3. トレーニングパラメーターを設定します
  4. トレーニングを開始します
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

詳細については、Cloud Training を参照してください。

FAQ#

  • データは、選択したリージョン(US、EU、またはAP)で処理および保存されます。画像は次のように処理されます:

    1. 形式とサイズが検証されます
    2. 最小寸法が28px未満の場合は拒否されます
    3. 4096pxを超える場合は、アスペクト比を維持して正規化され、最適化されたストレージ用にエンコードされます
    4. 重複排除された状態で保存されるため、同一の画像は1回のみ保持されます
    5. 高速なブラウジング用に、256pxのWebPサムネイルが生成されます
  • Ultralytics Platformはストレージを効率的に管理します:

    • 重複排除: 同じデータリージョン内の同一画像は1回のみ保存されます
    • 整合性: アップロードされたデータの整合性が検証されます
    • 効率性: クローンでは画像をコピーせず、保存済みの画像を再利用します。ただし、保存先ワークスペースのストレージクォータには引き続きカウントされます
    • リージョン: データは選択したリージョン(US、EU、またはAP)に保持されます
  • はい。データセットギャラリーにファイルをドラッグするか、ページヘッダーのアップロードアイコンをクリックすると、ブラウザーのネイティブファイルピッカーが直接開きます。処理後、新しい統計情報が自動的に計算されます。

  • 一括分割移動機能を使用します:

    1. テーブルビューで画像を選択します
    2. 右クリックして Move to split を選択します
    3. 移動先の分割(Train、Validation、またはTest)を選択します
  • Ultralytics Platformは、YOLOラベル、COCO JSON、Ultralytics NDJSON、および未加工の画像アップロードをサポートしています。Pascal VOC XMLラベルは検出されますが、インポートはされません:

    正規化された座標(0~1の範囲)を含む、画像ごとに1つの .txt ファイル:

    タスク形式
    Detectclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Semanticclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    ポーズclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    分類ディレクトリ構造train/cats/train/dogs/

    ポーズ可視性フラグ:0=ラベルなし、1=ラベルはあるがオクルージョンされている、2=ラベルがあり可視。セマンティックデータセットでは、ポリゴンファイルの代わりにPNGマスクを受け入れることもできます(セマンティックマスクを参照)。

  • はい。各画像には、6種類すべてのアノテーションタスク(detect、segment、semantic、classify、pose、OBB)のアノテーションがまとめて保存されます。データセットのアクティブなタスクタイプは、既存のアノテーションを失うことなくいつでも切り替えられます。アクティブなタスクタイプに一致するアノテーションのみがエディターに表示され、エクスポートとトレーニングに含まれます。他のタスクのアノテーションは保持され、元のタスクに戻すと再び表示されます。

  • はい:

    上限
    データセットあたりのクラス数25,000
    画像あたりのアノテーション数10,000
    アノテーションあたりの座標数10,000
    データセット名100文字
    データセットの説明1,000文字
    カスタムメタデータシリアライズ後の文字数500,000文字
    メタデータのトップレベルキー128文字
  • クラウドストレージまたはオンプレミスソースから読み取るデータセットでは、ピクセルデータがPlatformの外部に保持されます。そのため、Platformが画像バイトのコピーを所有する必要がある機能は利用できません:

    機能クラウド接続オンプレミス
    スマートおよびバッチアノテーション利用不可利用不可
    クラスタリング分析利用不可利用不可
    クローン作成利用不可利用不可
    バージョンスナップショット利用不可利用不可
    NDJSONエクスポート利用可能利用不可
    セマンティックPNGマスクのインポート利用不可利用可能

    ブラウジング、手動アノテーション、クラス管理、分割、統計情報、トレーニングはすべて通常どおり機能します。

コメント