Ultralytics YOLO27:

Наборы данных#

Наборы данных Ultralytics Platform позволяют легко управлять данными для обучения. После загрузки платформа автоматически обрабатывает изображения, метки и статистику.

Набор данных готов к обучению после завершения обработки, если в выборке train есть хотя бы одно изображение, в выборке val или test — хотя бы одно изображение, а также есть хотя бы одно размеченное изображение. В заголовке набора данных отображается значок Ready, когда выполнены все три условия, и значок Not Ready в противном случае — нажми на значок, чтобы узнать, какого именно условия не хватает.

Сбор изображений с помощью агентов#

Используй Agents, чтобы добавлять изображения в набор данных, когда обнаружение модели соответствует заданному условию, например когда уверенность попадает в выбранный диапазон. Свяжи условие с блоком Набор данных и выбери доступное для редактирования место назначения. Изображения поступают без меток в выборку train; существующие копии пропускаются. Проверь и разметь их с помощью существующего редактора аннотаций.

Загрузка набора данных#

Ultralytics Platform поддерживает загрузку данных в разных форматах.

Данные уже хранятся в другом месте?

Если у тебя уже есть наборы данных в Roboflow, используй интеграции, чтобы импортировать их напрямую — вручную экспортировать или загружать повторно не нужно. Данные в Google Cloud Storage, Amazon S3 или Azure Blob Storage можно использовать на месте через Облачное хранилище. Рабочие пространства Enterprise могут использовать On Premise, чтобы индексировать локальные данные и обучать на них модели, не отправляя изображения в Platform.

Поддерживаемые форматы#

ФорматРасширенияПримечанияМаксимальный размер
JPEG.jpg, .jpegСамый распространённый, рекомендуется50 MB
PNG.pngПоддерживает прозрачность50 MB
WebP.webpСовременный формат с хорошим сжатием50 MB
BMP.bmpБез сжатия50 MB
TIFF.tiff, .tifВысокое качество50 MB
HEIC.heicФотографии с iPhone50 MB
AVIF.avifФормат нового поколения50 MB
JP2.jp2JPEG 200050 MB
DNG.dngФормат RAW с камеры50 MB
MPO.mpoОбъект с несколькими изображениями50 MB

Поддержка видеокодеков#

Одного расширения файла недостаточно: видео всё равно может не обработаться, если его кодек нельзя декодировать.

Используй H.264 MP4

Видео H.264 в контейнере MP4 поддерживается наибольшим числом декодеров и является самым надёжным вариантом. Если видео не обрабатывается, перекодируй его с помощью FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Подготовка набора данных#

Platform поддерживает Ultralytics YOLO, COCO, JSON LabelMe, семантические PNG-маски, наборы данных глубины, Ultralytics NDJSON и Labelbox NDJSON, а также загрузку исходных (неразмеченных) данных:

Используй стандартную структуру каталогов YOLO с файлом data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

Файл YAML задаёт конфигурацию набора данных:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Загрузка исходных данных

Исходные данные: загружай неразмеченные изображения (без меток). Это удобно, если ты планируешь размечать данные прямо на платформе с помощью редактора аннотаций.

Плоская структура каталогов

Также можно загружать изображения без отдельных папок для выборок. Во время загрузки Platform учитывает активную целевую выборку. Если целевая выборка не задана, а после загрузки в val не окажется изображений — или окажется меньше двух парных карт глубины — изображения обучающей выборки в наборах данных не для классификации автоматически перемещаются в val, чтобы набор данных сразу был готов к обучению. Наборы данных для классификации пропускаются, поскольку для них разбиение задаётся структурой каталогов. Позже ты всегда можешь переназначить изображения с помощью функций массового перемещения в выборку или перераспределения по выборкам.

Автоопределение формата

Формат определяется автоматически: датасеты с файлом data.yaml, содержащим ключи names, train или val, распознаются как YOLO. Датасеты с JSON-файлами COCO (содержащими массивы images, annotations и categories) распознаются как COCO. Если файла COCO нет, отдельные JSON-файлы LabelMe для каждого изображения (содержащие shapes и imagePath) считываются как аннотации LabelMe. Экспорты .ndjson импортируются как NDJSON Ultralytics или как экспорты Labelbox, если их строки содержат ключ data_row. Датасеты, содержащие только изображения без аннотаций, распознаются как необработанные.

Если архив содержит несколько YAML-файлов, Platform отдает предпочтение стандартным именам (data.yaml, data.yml, dataset.yaml, dataset.yml), расположенным ближе к корню архива. Чтобы избежать неоднозначности, оставь в каждом архиве один YAML-файл с понятным именем.

Импорт меток Pascal VOC XML не поддерживается

Файлы меток в формате Pascal VOC XML обнаруживаются, но их аннотации не импортируются — изображения загружаются без них, а если в папке, например images/ или JPEGImages/, находится пять или более изображений, им также присваивается класс с именем этой папки. Platform предупредит тебя до начала загрузки («Обнаружены метки Pascal VOC»). Сначала преобразуй VOC XML в YOLO или COCO; см. инструменты преобразования форматов.

Если метки ссылаются на идентификаторы классов, но имена классов не указаны, Platform переназначает идентификаторы на плотную последовательность с нуля и присваивает каждому классу имя на основе исходного идентификатора (class0, class3, …). Позже ты сможешь переименовать их на вкладке «Классы».

Подробнее о форматах для конкретных задач см. в разделе «Поддерживаемые задачи» и в обзоре датасетов.

Процесс загрузки#

Чтобы создать датасет:

  1. Перейди в Annotate на боковой панели
  2. Нажми New Dataset
  3. Выбери вкладку источника данных (см. раздел «Источники данных» ниже)
  4. Укажи имя — URL-слаг будет создан автоматически, и его можно будет изменить, — а также при желании добавь описание
  5. Выбери тип задачи (см. раздел «Поддерживаемые задачи»), при желании укажи лицензию (см. раздел «Доступные лицензии») и выбери видимость (публичный или приватный)
  6. Нажми Create & Upload для загрузки локальных файлов, Create & Import для URL или подключенного источника либо Create Dataset, чтобы начать с пустого датасета

Диалог загрузки датасетов Ultralytics Platform: выбор задачи

Чтобы добавить файлы в существующий датасет, открой его страницу и перетащи файлы в галерею или нажми значок загрузки в заголовке страницы. Значок загрузки сразу открывает стандартное окно выбора файлов браузера, поскольку задача датасета уже задана.

Источники данных#

В диалоговом окне New Dataset доступны четыре источника:

ИсточникОписание
ЗагрузкаПеретащи файлы в окно или выбери их: изображения, видео, архивы или NDJSON
URLВставь прямую ссылку на файл .zip, .tar, .tar.gz, .tgz или .ndjson; Platform скачает его и обработает на сервере
ОблакоРаботай с данными непосредственно в Google Cloud Storage, Amazon S3 или Azure Blob Storage (Pro и Enterprise)
Локальная инфраструктураИндексируй данные и обучай модели на них, не покидая собственные компьютеры, с помощью воркеров On Premise (Enterprise)

Датасеты глубины можно создать только через Upload или URL; вкладки Cloud и On Premise недоступны для задачи глубины.

Ограничения на импорт по URL

На импорт по URL распространяются два ограничения: лимит на одну загрузку согласно твоему тарифу (10 ГБ для Free / 20 ГБ для Pro / 50 ГБ для Enterprise) и оставшийся объем хранилища. Применяется меньшее из них. Ссылка должна быть общедоступна по HTTP или HTTPS и вести на файл с поддерживаемым расширением.

Перед началом загрузки#

Platform проверяет файлы в браузере до начала загрузки, поэтому распространенные проблемы обнаруживаются сразу, а не после долгой передачи данных. Архивы проверяются на повреждения, пустое содержимое, защиту паролем и ошибки синтаксиса YAML; слишком большие файлы перечисляются по именам.

После этого могут появиться два диалоговых окна:

Если в ZIP-архиве указаны названия классов, а в наборе данных уже есть классы, в диалоговом окне Map classes отображается по одной строке для каждого входящего класса. Сопоставь каждый класс с существующим или создай новый либо сними флажок Включить, чтобы пропустить класс. Совпадающие названия (без учета регистра, кроме названий длиной в один или два символа) выбираются автоматически, а аннотации пропущенных классов не импортируются.

После загрузки платформа автоматически обработает данные:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Проверка: проверка формата и размера
  2. Нормализация: большие изображения уменьшаются (максимум 4096 пикселей, минимальный размер — 28 пикселей), изображения в оттенках серого преобразуются в RGB, прозрачность заменяется белым фоном, применяется ориентация EXIF; исходные TIFF-файлы сохраняются в загруженном виде
  3. Миниатюры: создаются превью WebP размером 256 пикселей
  4. Разбор меток: извлекаются метки YOLO, COCO, LabelMe и NDJSON от Ultralytics или Labelbox
  5. Статистика: вычисляются распределение классов и размеры изображений
Кодирование хранимых изображений

Исходные TIFF-файлы всегда сохраняются побайтно; исходные AVIF и WebP тоже сохраняются без изменений, если не требуется изменение размера или цвета. Все остальные файлы перекодируются: источники WebP остаются в формате WebP, а все остальные источники (JPEG, PNG, BMP, HEIC, JP2, DNG, MPO, а также AVIF с измененным размером или цветом) преобразуются в JPEG с качеством 92. Исходное имя файла и расширение сохраняются в метаданных.

Индикатор выполнения загрузки датасетов Ultralytics Platform

Проверка перед загрузкой

Перед загрузкой ты можешь проверить датасет локально:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Требования к размеру изображений

Короткая сторона изображения должна быть не меньше 28 пикселей. Изображения меньшего размера отклоняются при обработке. Если длинная сторона изображения превышает 4096 пикселей, оно автоматически уменьшается с сохранением пропорций, за исключением исходных TIFF-файлов, которые сохраняются в загруженном виде.

Просмотр изображений#

Просматривай изображения датасета в разных режимах отображения.

Открой панель «Кластеризация» на панели инструментов галереи, чтобы изучить датасет в виде интерактивной двумерной диаграммы рассеяния.

Режим отображенияОписание
СеткаСетка миниатюр с наложенными аннотациями (по умолчанию)
КомпактныйУменьшенные миниатюры для быстрого просмотра
ТаблицаСписок с миниатюрой, именем файла, размерами, размером файла, подмножеством, классами и количеством меток

Галерея датасетов Ultralytics Platform в режиме сетки с аннотациями

Сортировка и фильтрация#

Для удобного просмотра изображения можно сортировать и фильтровать:

Каждый вариант позволяет переключаться между сортировкой по возрастанию (↑) и убыванию (↓):

СортировкаОписание
Дата создания ↑/↓Порядок загрузки (по умолчанию ↓)
Имя ↑/↓Имена файлов в алфавитном порядке
Высота ↑/↓Высота изображения в пикселях
Ширина ↑/↓Ширина изображения в пикселях
Размер ↑/↓Размер файла на диске
Аннотации ↑/↓Количество аннотаций на изображение
Большие датасеты

Для датасетов с более чем 100 000 изображений сортировка по имени, ширине, высоте и размеру скрыта, чтобы галерея работала без задержек. Сортировка по дате создания и количеству аннотаций остается доступной.

Поиск изображений без меток

Установи фильтр Annotations в значение Unannotated, чтобы быстро найти изображения, которые еще нужно аннотировать. Это особенно удобно для больших датасетов, в которых важно отслеживать ход разметки.

Поиск изображений

Поле поиска находится справа на панели инструментов галереи и фильтрует изображения во всех режимах отображения — сетке, компактном режиме и таблице. Поиск выполняется по имени файла изображения (расширение файла можно не указывать), имени любого класса, аннотированного на изображении, а также ключам пользовательских метаданных, скалярным значениям и элементам массивов. Например, изображение с именем img_0042, аннотацией boat и метаданными {"ship_type": "yacht"} можно найти по запросу img_0042, boat или yacht.

Значения во вложенных объектах не учитываются при поиске. Вставь 24-символьный идентификатор изображения или 32-символьный хеш содержимого, чтобы найти именно это изображение напрямую, минуя текстовый поиск.

Результаты сортируются по релевантности: сначала идут изображения, совпадающие по имени файла, классу или метаданным, затем — до 1 000 дополнительных похожих изображений, например forklift near a doorway. Во время поиска сортировка недоступна, а если запрос заканчивается расширением файла, похожие изображения не показываются.

Полноэкранный просмотр#

Нажми на любое изображение, чтобы открыть его в полноэкранном режиме и получить доступ к следующим возможностям:

  • Навигация: переходи между изображениями с помощью клавиш со стрелками или миниатюр
  • Информация об изображении: просматривай свойства, созданные Platform, пользовательские метаданные и встроенные метаданные файла, например EXIF
  • Пользовательские метаданные: Владельцы и редакторы могут добавлять или заменять объект JSON, включая вложенные значения общим размером до 500 000 сериализованных символов и ключи верхнего уровня длиной до 128 символов
  • Аннотации: включить или выключить отображение наложения аннотаций
  • Разбивка по классам: количество меток для каждого класса с цветовыми индикаторами
  • Разметка: если у тебя есть права на редактирование, инструменты разметки сразу становятся активными при открытии полноэкранного просмотрщика на компьютере
  • Размытие лиц: щёлкни правой кнопкой мыши по аннотации, чтобы просмотреть результат и применить размытие лиц на изображении, если эта функция доступна
  • Скачать: скачать исходный файл изображения
  • Удалить: удалить изображение из датасета
  • Масштаб: используй Cmd/Ctrl+Scroll, Cmd/Ctrl++ или Cmd/Ctrl+=, чтобы увеличить масштаб, и Cmd/Ctrl+-, чтобы уменьшить
  • Сбросить вид: используй Cmd/Ctrl + 0 или кнопку сброса, чтобы подогнать изображение под размер просмотрщика
  • Перемещение: удерживай Space и перетаскивай или перетаскивай средней кнопкой мыши, чтобы перемещаться по холсту при любом масштабе
  • Просмотр пикселей: включить или выключить пикселизацию для детального изучения
  • Шторка глубины: в датасетах глубины разделитель можно перетаскивать, чтобы переключаться между RGB-изображением и его цветной картой глубины

Полноэкранный просмотрщик датасетов Ultralytics Platform с панелью метаданных

Фильтр по выборке#

Фильтруй изображения по выборке датасета:

ПодвыборкаНазначение
ОбучениеИспользуется для обучения модели
ВалидацияИспользуется для валидации во время обучения
ТестИспользуется для итоговой оценки

Кластеризация#

Панель Clustering отображает датасет в виде интерактивной двумерной диаграммы рассеяния: визуально похожие изображения располагаются близко друг к другу. Используй её, чтобы выявлять кластеры, находить дубликаты и выбросы, а также изучать распределение выборок и классов в данных — не покидая галерею. Открой панель, нажав значок диаграммы рассеяния на панели инструментов галереи на странице любого датасета. Панель доступна только на компьютере. Пользователи без прав на редактирование увидят значок после анализа датасета.

Пустое состояние кластеризации датасетов Ultralytics Platform

Выполнение анализа#

Запусти анализ:

  1. Открой датасет и нажми значок диаграммы рассеяния на панели инструментов галереи
  2. Нажми Analyze Dataset
  3. Дождись завершения индикатора выполнения — результаты появятся в той же панели

Анализ выполняется в фоновом режиме в два этапа: Computing embeddings и Clustering. В зависимости от размера датасета он может занять несколько минут. Можно закрыть панель или покинуть страницу и вернуться позже.

Требования к анализу

Для анализа датасет должен содержать не менее 20 и не более 200 000 изображений без ошибок. Подключённые датасеты, использующие облачное хранилище или локальное хранилище On Premise, пока не поддерживаются.

Визуализация#

После завершения анализа на панели появится двумерная диаграмма рассеяния со всеми проанализированными изображениями, легендой и счётчиком точек. Фильтры галереи (выборка, класс, наличие или отсутствие меток) приглушают точки, не соответствующие фильтрам, чтобы ты мог сосредоточиться на нужной подвыборке. Счётчик будет показывать visible / total points.

Диаграмма рассеяния кластеризации датасетов Ultralytics Platform

Цветовая схема#

Измени способ окрашивания точек данных с помощью раскрывающегося списка Color by на панели инструментов. Переключай режимы просмотра в любое время — цвета диаграммы изменятся мгновенно, и ты увидишь, как выборки, классы и свойства изображений распределены по кластерам:

ПараметрОкрашивание
ВыборкиTrain / Val / Test
КлассыПервый класс аннотации на каждом изображении
КластерыВизуальный остров на схеме, начиная с самого крупного; Разрозненные — точки за пределами всех островов, Не вычислено — для схем, проанализированных до появления этой функции
ШиринаШирина изображения
ВысотаВысота изображения
РазмерРазмер файла
АннотацииКоличество аннотаций на изображении

Режимы цветового кодирования кластеризации датасетов Ultralytics Platform

Выделение лассо и щелчком#

Обведи область произвольной формы, чтобы выделить точки на диаграмме, или щёлкни точку, чтобы выбрать все точки того же цвета (только эту точку при окрашивании по ширине, высоте, размеру или аннотациям). Чтобы снять выделение, щёлкни пустую область диаграммы. В галерее останутся только соответствующие изображения — их можно просматривать, менять метки, перемещать или удалять с помощью стандартных операций с изображениями.

Снять выделение

Над диаграммой отображается число выбранных точек. Нажми × или щёлкни пустую область диаграммы, чтобы снять выделение и вернуться к просмотру всей галереи.

Размер выборки

При выделении лассо или щелчком выбирается не более 1 000 изображений. Если критериям соответствуют изображения сверх этого лимита, Platform покажет выборку из 1 000 изображений и предложит выделить область поменьше.

Панорамирование и масштабирование#

Перемещайся по большим диаграммам рассеяния с помощью мыши и клавиатуры или кнопок масштабирования в левом нижнем углу диаграммы:

ДействиеДействие
ПрокруткаПеремещение по диаграмме в двух измерениях
Cmd/Ctrl+прокруткаУвеличить или уменьшить масштаб относительно положения курсора
Удерживать пробелПереключиться в режим перемещения перетаскиванием
Кнопка сбросаПоказать диаграмму в полном масштабе

Повторный анализ#

Если после анализа датасет изменился — появились новые изображения или число проанализированных изображений больше не совпадает с числом изображений в датасете — либо анализ был выполнен до появления цветовой схемы Кластеры, в верхней части панели появится кнопка Re-analyze. Она доступна владельцам и редакторам.

Нажми Re-analyze, чтобы заново вычислить эмбеддинги и двумерную проекцию.

Поиск похожих изображений#

Те же эмбеддинги используются для поиска похожих изображений в общедоступных датасетах, а также в твоих личных и командных датасетах. В датасете, который ты можешь редактировать, щёлкни правой кнопкой мыши по изображению в режиме Сетка или Компактный (или по единственной выбранной строке в режиме Таблица) и выбери Найти похожие изображения. В диалоговом окне рядом с исходным изображением будут показаны до 24 наиболее похожих изображений с оценкой сходства для каждого. Из поиска исключаются изображения, уже имеющиеся в твоём датасете, и копии выбранного изображения в других датасетах. Щёлкни изображение, чтобы просмотреть его в полном размере и увидеть исходный датасет, лицензию и оценку сходства. Отметь нужные изображения флажками (или выбери все), затем нажми Добавить N в датасет: изображения добавятся в выборку train без меток, будут учтены в объёме хранилища и станут доступны для разметки.

Диалог поиска похожих изображений в датасетах Ultralytics Platform

Для изображения без эмбеддинга — из ещё не проанализированного датасета или добавленного после последнего анализа — эмбеддинг вычисляется при открытии диалогового окна. Поэтому предварительно запускать анализ кластеризации не нужно. Диалоговое окно недоступно для подключённых датасетов. Диагностика валидации для каждого изображения модели выполняет тот же поиск, используя изображения с наихудшими показателями.

Вкладки датасета#

На странице каждого датасета может отображаться до шести вкладок — в зависимости от состояния датасета и твоих прав:

Вкладка «Изображения»#

Вид по умолчанию: галерея изображений с наложением аннотаций. Поддерживаются режимы сетки, компактный и табличный. Перетащи сюда файлы, чтобы добавить изображения.

Вкладка «Классы»#

Эта вкладка появляется, если в датасете есть изображения, а его задача предусматривает классы.

Управляй классами аннотаций в датасете:

  • Гистограмма классов: столбчатая диаграмма с количеством аннотаций для каждого класса, отсортированных по частоте; можно переключаться между линейной и логарифмической шкалой
  • Таблица классов: таблица с сортировкой и поиском, содержащая индекс, название, количество аннотаций и количество изображений
  • Изменение названий классов: щёлкни название любого класса, чтобы изменить его прямо в таблице
  • Изменение цветов классов: щёлкни образец цвета, чтобы изменить цвет класса
  • Добавление класса: добавляй классы с помощью поля ввода внизу
  • Объединение классов: выбери две или более строк и нажми Merge into one
  • Удаление классов: выбери одну или несколько строк и нажми Delete

Гистограмма и таблица на вкладке классов датасетов Ultralytics Platform

Логарифмическая шкала для несбалансированных датасетов

Если в датасете классы несбалансированы (например, 10 000 аннотаций «человек» и всего 50 аннотаций «велосипед»), включи переключатель Log Scale на гистограмме классов, чтобы наглядно отображались все классы.

Объединение классов#

Объединение помогает свести дублирующиеся или пересекающиеся метки в один класс — например, объединить car, automobile и vehicle:

  1. Выбери два или более класса с помощью флажков в строках
  2. Нажми Merge into one в заголовке таблицы или щёлкни правой кнопкой мыши по выделенным строкам
  3. Выбери, какой из отмеченных классов станет целевым, а в него будут объединены остальные
  4. Подтверди действие

Все аннотации исходных классов переназначаются целевому классу, а исходные классы удаляются. Аннотации не удаляются, поэтому общее количество аннотаций в датасете не меняется.

Удаление классов#

  1. Выбери один или несколько классов с помощью флажков в строках
  2. Нажми Delete в заголовке таблицы или щёлкни правой кнопкой мыши по выделенным строкам
  3. Подтверди действие

При удалении класса удаляется сам класс и все его аннотации. В датасетах для классификации удаляются метки, но изображения остаются без разметки.

Индексы классов смещаются

Идентификаторы классов определяются их позициями. Объединение или удаление класса сдвигает все индексы классов выше него вниз, чтобы закрыть пробел, поэтому экспорты и файлы разметки, созданные до изменения, больше не соответствуют новым индексам. Сначала создай версию, если тебе нужна прежняя нумерация.

Выборка статистики

Количество классов рассчитывается не более чем для 100 000 изображений. Для более крупных датасетов над гистограммой отображается примечание: «Основано на подмножестве этого датасета из 100 000 изображений».

Вкладка «Графики»#

Эта вкладка появляется, если в датасете есть изображения.

Автоматически рассчитанная статистика по твоему датасету:

Графики расположены в указанном порядке; каждый график пропускается, если в датасете для него нет данных: для датасета только с исходными изображениями графики разметки не отображаются, а Points per Instance появляется только для данных сегментации и поз:

ГрафикОписание
Распределение по выборкамКольцевая диаграмма количества изображений в выборках train/val/test и доли размеченных изображений
Самые распространённые классыКольцевая диаграмма 10 самых частых классов разметки; остальные объединены в категорию «Другие»
Размеры изображенийГистограмма распределения ширины и высоты изображений (значения наложены друг на друга) со средним значением
Размер файла изображенияГистограмма распределения размеров файлов изображений
Размеры изображений в 2DТепловая карта ширины и высоты в 2D с направляющими линиями соотношения сторон
Расположение объектов разметкиТепловая карта центров ограничивающих рамок в 2D
Форматы изображенийРаспределение исходных форматов изображений (JPG, PNG и т. д.)
Размеры ограничивающих рамокГистограмма ширины и высоты ограничивающих рамок (значения наложены друг на друга)
Объекты на изображениеГистограмма количества объектов разметки на изображение
Точки на экземплярКоличество вершин полигона или ключевых точек на объект разметки (сегментация/поза)

Вкладка «Графики» с сеткой статистики датасета в Ultralytics Platform

Кэширование статистики

Platform кэширует рассчитанную статистику и сбрасывает её при изменении изображений, разметки, классов или выборок. Для датасетов размером более 100 000 изображений графики строятся по подмножеству из 100 000 изображений; об этом указано над сеткой.

Полноэкранные тепловые карты

Нажми кнопку разворачивания на любой тепловой карте, чтобы открыть её в полноэкранном режиме. Так ты увидишь более крупное и подробное изображение — это помогает понять пространственные закономерности в больших датасетах.

Вкладка «Модели»#

Просматривай все модели, обученные на этом датасете, в таблице с поиском:

СтолбецОписание
МодельРодительский проект и название модели со ссылками
ВерсияНеизменяемая версия датасета, использованная для обучения; отображается, если для какой-либо модели из списка использовалась такая версия
СтатусЗначок статуса обучения
ЗадачаТип задачи YOLO
ЭпохиЛучшая эпоха / общее количество эпох
МетрикиДве основные метрики для каждой задачи в таблице, например mAP50 и mAP50-95 для детекции или точность Top-1 и Top-5
СозданаДата создания

Вкладка «Модели» с таблицей обученных моделей в датасетах Ultralytics Platform

Вкладка «Ошибки»#

Эта вкладка появляется, только если не удалось обработать один или несколько файлов.

Здесь перечислены изображения, обработка которых завершилась ошибкой:

  • Баннер ошибки: общее количество изображений с ошибкой и рекомендации
  • Таблица ошибок: имя файла, понятное описание ошибки, подсказки по её устранению и миниатюра для предварительного просмотра
  • К распространённым ошибкам относятся повреждённые файлы, неподдерживаемые форматы, слишком маленькие изображения (минимум 28 пикселей) и неподдерживаемые цветовые режимы.

Вкладка «Ошибки» с ошибками обработки в датасетах Ultralytics Platform

Распространённые ошибки обработки
ОшибкаПричинаРешение
Не удалось прочитать файл изображенияФайл повреждён или имеет неподдерживаемый форматПовторно экспортируй изображение из графического редактора
Файл неполный или повреждёнФайл был обрезан при передачеСкачай исходный файл заново
Неподдерживаемый формат изображенияPlatform не может декодировать этот форматПреобразуй изображение в JPG, PNG или WebP
Ошибка доступа к файлуФайл заблокирован или защищён от чтенияРазблокируй файл и загрузи его повторно
Изображение слишком маленькоеМинимальный размер — менее 28 pxИспользуй исходные изображения с более высоким разрешением
Неподдерживаемый цветовой режимCMYK или индексированный цветовой режимПреобразуй изображение в режим RGB

Вкладка «Версии»#

Создавай неизменяемые снимки датасета в формате NDJSON для воспроизводимого обучения. В каждом снимке сохраняются количество изображений, классов и объектов разметки, а также объём добавленного хранилища на момент создания.

СтолбецОписание
ВерсияНомер версии (v1, v2, ...)
ОписаниеОписание, указанное пользователем (можно изменить)
ИзображенияКоличество изображений на момент создания снимка
КлассыКоличество классов на момент создания снимка
АннотацииКоличество объектов разметки на момент создания снимка
РазмерОбъём хранилища, добавленный этой версией
СозданаДата создания версии
ДействияСравнить, скачать или восстановить

Чтобы создать версию:

  1. Открой вкладку Versions
  2. При желании укажи описание (например, «Добавлено 500 обучающих изображений» или «Исправлены неверные метки классов»)
  3. Нажми New Version
  4. Новая версия появится в таблице. Если датасет совпадает с существующей версией, например сразу после её восстановления, эта версия будет использована повторно и получит новое описание, если ты его указал.

Версии нумеруются последовательно (v1, v2, v3...) и являются неизменяемыми: их нельзя редактировать или удалять, можно менять только их описания. В любое время используй действия в строке, чтобы скачать или восстановить нужную версию.

Сравнение версий#

Нажми значок сравнения у любой версии после v1, чтобы посмотреть, что изменилось с предыдущей версии. Сравнение версий начинается с предыдущей версии; выбери другую в меню From. Счётчики в разделах Images, Annotations, Classes и Settings показывают количество добавленных, удалённых и изменённых изображений, а также изображений, перенесённых в другую выборку, и добавленных или удалённых объектов разметки; также они показывают названия добавленных, удалённых или переименованных классов и изменившиеся настройки датасета. Каждое изменённое изображение отображается со значком. Выбери изображение, чтобы посмотреть его Before и After, а также метки, сохранённые в каждой версии. Если изображения и объекты разметки идентичны, в диалоговом окне отображается No changes; если изменились только определения классов или настройки датасета — No image changes.

Восстановление версии

При восстановлении текущие изображения, выборки, классы и разметка датасета заменяются выбранным снимком. Отменить это действие нельзя, если сначала не сохранить текущее состояние как другую версию. На время перестроения датасет блокируется и получает статус processing. При восстановлении повторная загрузка файлов не выполняется, поэтому даже большие датасеты обычно восстанавливаются быстро.

Сохранение версии во время обучения

Включи Save Dataset Version в диалоговом окне облачного обучения, чтобы связать модель с точной версией датасета, использованной для обучения. Если содержимое датасета не изменилось, Platform повторно использует соответствующую версию и создаёт новую, только если содержимое изменилось.

Только готовые датасеты

Создание и восстановление версий доступны, когда датасет получает статус ready. Версии недоступны для подключённых облачных датасетов и датасетов On Premise.

Когда создавать версии

Создавай версию до и после значительных изменений набора данных — добавления изображений, исправления аннотаций или изменения пропорций разбиения. Так ты сможешь сравнивать производительность модели для разных состояний набора данных.

Размер версии

Указанный размер — это объем сжатого хранилища снимков, добавленный версией: записи изображений (URL, разбиения, аннотации и метаданные) и настройки набора данных, но не пиксели изображений. Данные снимка, не изменившиеся с момента предыдущей версии, используются совместно и учитываются в размере версии, в которой они были сохранены впервые. Фактические данные изображений хранятся отдельно, доступ к ним осуществляется по подписанным URL. Объем хранилища снимков учитывается в квоте хранилища рабочей области, поэтому создание новой версии завершится ошибкой, если свободного места не осталось; повторное использование соответствующей версии — нет.

Экспорт набора данных#

Экспортируй набор данных для автономного использования: скачай NDJSON из заголовка набора данных или на вкладке Versions.

Чтобы экспортировать данные:

  1. Нажми кнопку Download (значок загрузки) в заголовке набора данных
  2. Скачай текущий снимок NDJSON напрямую
  3. Если нужен неизменяемый пронумерованный снимок, который можно будет скачать позже, используй вкладку Versions

Экспорт наборов данных Ultralytics Platform: загрузка NDJSON

В формате NDJSON каждая строка содержит один объект JSON. Первая строка содержит метаданные набора данных, за ней следует по одной строке на каждое изображение:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

Необязательный объект metadata на уровне изображения сохраняется при импорте файла NDJSON в Platform. Его можно посмотреть или отредактировать на полноэкранной панели сведений об изображении. Для программной загрузки архивов API приема данных набора данных принимает эквивалентную карту путей imageMetadata.

В заголовке набора данных с позами также указывается поле kpt_shape; если оно еще не задано, значение определяется по аннотациям.

В экспортах глубины в строке набора данных указываются "task": "depth" и "depth_scale": 1000. В каждой строке изображения есть depth.url для соответствующего PNG в формате plain uint16. Ultralytics параллельно скачивает URL изображений и глубины, а затем создает YAML для обучения с тем же масштабом, поэтому файл NDJSON можно напрямую передать в model.train(data=...).

Подписанные URL

URL изображений в экспортированном NDJSON подписаны и действуют 7 дней. Если набор данных не менялся, Platform повторно использует экспорт из кеша не более 6 дней, поэтому после новой загрузки URL всегда будут действительны еще как минимум сутки. Если тебе нужны новые URL раньше, измени набор данных или создай новую версию.

Наборы данных On Premise

Экспорт недоступен для наборов данных On Premise, изображения которых никогда не передаются в Platform.

Полную спецификацию смотри в документации по формату NDJSON Ultralytics.

Операции с изображениями#

Быстрые действия#

Щелкни правой кнопкой мыши по изображению в режиме Grid или Compact либо по единственной выбранной строке в режиме Table, чтобы открыть быстрые действия. Доступные действия зависят от твоих прав на редактирование и источника набора данных:

ДействиеОписание
Переместить в разбиениеПереназначь изображение в разбиение Train, Val или Test
Найти похожие изображенияНайди похожие изображения в общедоступных, своих и командных наборах данных, чтобы добавить их (см. раздел Поиск похожих изображений)
Создать похожие изображенияСоздай варианты изображений с помощью ИИ и добавь те, которые решишь оставить (см. раздел Создание похожих изображений)
Размыть лицаРазмой лица, обнаруженные на изображении (см. раздел Размытие лиц)
Копировать / ВырезатьСкопируй или вырежи изображение, чтобы вставить его в другой набор данных (см. раздел Копирование и перемещение изображений)
ВставитьВставь скопированные или вырезанные изображения в этот набор данных; действие отображается, если в буфере обмена находятся изображения из другого набора данных
СкачатьСкачай исходный файл изображения
УдалитьУдали изображение из набора данных

Контекстное меню карточки изображения в наборах данных Ultralytics Platform

Отдельные и массовые действия

Контекстное меню изображения действует на изображение, по которому ты щелкнул, за исключением действия Вставить, добавляющего изображения из буфера обмена. Для массовых операций с несколькими изображениями используй режим Table и выбери их с помощью флажков.

Массовое перемещение в разбиение#

Переназначь выбранные изображения в другое разбиение того же набора данных:

  1. Переключись в режим Table
  2. Выбери изображения с помощью флажков
  3. Щелкни правой кнопкой мыши, чтобы открыть контекстное меню
  4. Выбери Move to split > Train, Validation или Test

Также можно перетащить изображения на вкладки фильтров разбиений в режиме сетки. Если при перемещении изображения в целевом разбиении окажется идентичное изображение, Platform предложит пропустить его, сохранить оба изображения или заменить существующее.

Организация разбиений Train/Val

Загрузи все изображения в один набор данных, затем с помощью массового перемещения в разбиение распределяй их по подмножествам Train, Validation и Test.

Перераспределение разбиений#

Перераспредели все изображения между разбиениями Train, Validation и Test, задав собственные пропорции:

  1. Нажми split bar на панели инструментов набора данных, чтобы открыть диалоговое окно Redistribute Splits
  2. Настрой процентные доли разбиений одним из способов ниже
  3. Проверь предварительный просмотр текущего количества изображений, чтобы подтвердить распределение
  4. Нажми Apply, чтобы случайным образом переназначить все изображения согласно заданным процентным долям

Диалоговое окно перераспределения разбиений наборов данных в Ultralytics Platform

В диалоговом окне есть три способа задать целевые пропорции разбиений:

МетодОписание
ПеретаскиваниеПеретаскивай маркеры между цветными сегментами, чтобы визуально настроить границы разбиений
Ввод значенияИзмени процентное значение для любого разбиения (доли двух остальных разбиений автоматически скорректируются пропорционально)
АвтоматическиНастрой разбиение Train/Validation в пропорции 80/20 одним нажатием; доля Test при этом будет равна 0%

Перед применением изменений предварительный просмотр в реальном времени показывает точное количество изображений в каждом разбиении.

Быстрое разбиение 80/20

Нажми кнопку Auto, чтобы сразу настроить рекомендуемое разбиение Train/Validation в пропорции 80/20. Это самая распространенная пропорция для обучения.

Массовое удаление#

Удали несколько изображений одновременно:

  1. Выбери изображения в режиме таблицы
  2. Щелкни правой кнопкой мыши и выбери Delete или нажми Cmd/Ctrl+Delete
  3. Подтверди удаление

Копирование и перемещение изображений#

Копируй или перемещай изображения из одного доступного для редактирования набора данных в другой, в том числе в набор данных из другой рабочей области:

  1. В исходном наборе данных щелкни правой кнопкой мыши по изображению в режиме Grid или Compact и выбери Copy или Cut либо выбери изображения в режиме Table и нажми Cmd/Ctrl+C или Cmd/Ctrl+X. Команда Esc очищает буфер обмена.
  2. Открой целевой набор данных, щелкни правой кнопкой мыши по изображению и выбери Paste либо нажми Cmd/Ctrl+V.

Вставленные изображения сохраняют свои метки и разбиения, а изображения, которые уже есть в целевом наборе данных и относятся к тому же разбиению, пропускаются. Действие Cut удаляет вставленные изображения из исходного набора данных; Copy оставляет исходный набор без изменений. У исходного и целевого наборов данных должны совпадать задача, а также быть совместимыми каналы изображений, настройки ключевых точек позы и масштаб глубины — даже если у копируемых изображений нет меток. Пустой целевой набор данных может унаследовать незаданные настройки каналов изображений и позы. Вставлять изображения в подключенный набор данных нельзя.

Классы сопоставляются по названию без учета регистра, кроме названий длиной в один или два символа; если в целевом наборе данных нет классов, он получает список классов исходного набора. Если во вставляемом изображении используется класс, которого нет в целевом наборе, в диалоговом окне Сопоставить классы предлагается связать каждый такой класс с классом набора данных или новым классом либо снять флажок Включить, чтобы удалить метки этого класса; изображения вставляются в любом случае.

Создание похожих изображений#

Создавай новые обучающие изображения на основе уже имеющихся. В доступном для редактирования наборе данных щелкни правой кнопкой мыши по изображению в режиме Grid или Compact (или по единственной выбранной строке в режиме Table) и выбери Generate similar images. Platform описывает новые сцены, вдохновленные изображением, и создает по одному изображению для каждой сцены, поэтому результаты сохраняют объекты и стиль исходного изображения, не копируя его.

ПараметрОписание
МодельUltralytics Image 4B (по умолчанию) работает быстрее всех; Ultralytics Image 6B создает изображения в другом стиле и работает дольше
Количество изображенийКоличество вариантов для создания: от 1 до 16 (по умолчанию — 4)
Размер изображенияЦелевая длина большей стороны: от 256 до 2048 px с шагом 64 (по умолчанию — 1024)
ИнструкцииНеобязательное описание того, что нужно изменить или сохранить, например освещение, ракурс, фон или объекты

Диалоговое окно создания похожих изображений в наборах данных Ultralytics Platform

Ultralytics Image 9B и Krea 2 Turbo также есть в списке, но выбрать их можно только после включения Раннего доступа. Krea 2 Turbo — самый медленный вариант. Если это поддерживается, исходные пропорции сохраняются. Для очень узких изображений может потребоваться увеличить размер длинной стороны, а размеры выходного изображения округляются и ограничиваются значениями, поддерживаемыми генератором.

Нажми Generate или нажми ⌘/Ctrl+Enter в поле Instructions. Готовые изображения появляются по мере создания и выделяются автоматически. Кнопка Stop останавливает выполняющуюся серию, сохраняя уже полученные изображения. Чтобы попробовать другие инструкции или настройки, измени их и нажми Generate more: каждая новая серия появляется над предыдущими, выделение которых сохраняется. Нажми на изображение, чтобы просмотреть его в полном размере, сними флажок у ненужных изображений и нажми Add N to dataset. Сохраненные изображения загружаются в формате JPEG, получают имена исходных изображений и не содержат меток; они учитываются в объеме хранилища и готовы к аннотированию. Для них используется активный фильтр разбиения: перед созданием выбери Train, чтобы добавить изображения в train. Если выбрано All, применяются стандартные правила распределения загружаемых изображений по разбиениям, включая автоматическое выделение валидационной выборки при необходимости. Кнопка Cancel удаляет предварительно просмотренные изображения, не добавляя их. Для созданных изображений применяются настройки размытия лиц при загрузке набора данных. Это действие недоступно для подключенных наборов данных.

Размытие лиц#

Размывай лица на изображениях в доступном для редактирования наборе данных, например, чтобы защитить конфиденциальность людей в твоих данных. Размытие лиц недоступно для подключенных наборов данных и наборов данных, в которых больше трех каналов изображения.

  • Одно изображение: щелкни правой кнопкой мыши по изображению в режиме Grid или Compact (или по единственной выбранной строке в режиме Table) либо по аннотации в полноэкранном просмотре и выбери Blur faces.
  • Весь набор данных: открой More actions (⋯) на странице набора данных и выбери Blur faces.

Сначала в диалоговом окне отображается предварительный просмотр обнаруженных лиц на изображениях (не более шести) или на одном изображении; сами изображения при этом не изменяются. Настрой параметры Confidence (по умолчанию 0.25) и Box scale (0.5–1.5, по умолчанию 1; параметр масштабирует рамку лица относительно ее центра), чтобы заново запустить предварительный просмотр. Затем нажми Apply, чтобы заменить исходные пиксели на каждом изображении, где обнаружены лица. Изображения, на которых лица не обнаружены, не меняются; метки и разбиения сохраняются. Некоторые лица могут остаться необнаруженными, поэтому проверь результат. Размытие автоматически не создает снимок версии. Размытие всего набора данных стоит $1.00 за 1 000 обработанных изображений, минимальная стоимость одного запуска — $0.01 (оплата проводится как Auto-Annotation). Перед применением диалоговое окно показывает расчетную стоимость; предварительный просмотр и размытие одного изображения бесплатны.

Предварительный просмотр диалогового окна размытия лиц в наборах данных Ultralytics Platform

Чтобы размывать лица при загрузке изображений, включи Blur faces при создании набора данных из Upload или URL либо включи Blur future uploads в диалоговом окне Blur faces для всего набора данных. Переключатель Blur future uploads сохраняет настройку сразу, даже если закрыть диалоговое окно, не нажав Apply. Изображения, загруженные в набор данных после этого, размываются во время обработки бесплатно; изменение этой настройки не размывает изображения, уже имеющиеся в наборе данных.

URI набора данных#

Ссылайся на наборы данных Platform, используя формат URI ul:// (см. раздел Использование наборов данных Platform):

ul://username/datasets/dataset-slug

Также можно вставить URL веб-страницы набора данных или модели напрямую (например, https://platform.ultralytics.com/username/datasets/dataset-slug); он автоматически преобразуется в URI ul://. Если передать список наборов данных, одна базовая модель будет последовательно дообучаться на каждом из них, например model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Используй этот URI, чтобы обучать модели из любой точки:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Обучай модели где угодно, используя данные Platform

URI ul:// работает в любой среде:

  • Локальный компьютер: обучай модели на своём оборудовании, данные загрузятся автоматически
  • Google Colab: используй наборы данных Platform в ноутбуках
  • Удалённые серверы: обучай модели на облачных виртуальных машинах с полным доступом к наборам данных

Доступные лицензии#

Для наборов данных Platform поддерживает следующие лицензии:

ЛицензияТип
НетЛицензия не выбрана
CC0-1.0Общественное достояние
PDM-1.0Общественное достояние
CC-BY-2.5Разрешительная
CC-BY-3.0Разрешительная
CC-BY-4.0Разрешительная
CC-BY-NC-2.0Некоммерческое использование
CC-BY-NC-3.0Некоммерческое использование
CC-BY-NC-4.0Некоммерческое использование
CC-BY-SA-3.0Копилефт
CC-BY-SA-4.0Копилефт
CC-BY-NC-SA-3.0Копилефт
CC-BY-NC-SA-4.0Копилефт
CC-BY-ND-4.0Без производных работ
CC-BY-NC-ND-2.0Некоммерческое использование
CC-BY-NC-ND-4.0Некоммерческое использование
Apache-2.0Разрешительная
MITРазрешительная
BSD-3-ClauseРазрешительная
AGPL-3.0Копилефт
GPL-2.0Копилефт
GPL-3.0Копилефт
LGPL-3.0Копилефт
ODbL-1.0Копилефт
DbCL-1.0Требуется ODbL
Только для исследованийОграниченная
ДругаяПользовательская
Лицензии с копилефтом

При клонировании набора данных с лицензией с копилефтом (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0) клон наследует лицензию, а выбор лицензии блокируется.

Настройки видимости#

Укажи, кто может видеть твой набор данных:

ПараметрОписание
ПриватныйДоступ есть у тебя и участников рабочего пространства с соответствующими разрешениями
ПубличныйПросматривать может кто угодно, в том числе со страницы Explore

Видимость задаётся при создании набора данных в диалоговом окне New Dataset с помощью переключателя. Чтобы изменить настройку позже, нажми на значок Публичный или Приватный рядом с названием набора данных в хлебных крошках страницы; при публикации набора данных потребуется подтверждение. Наборы данных On Premise всегда приватные. Публичные наборы данных отображаются на странице Explore.

Редактирование набора данных#

Метаданные набора данных редактируются прямо на его странице — диалоговое окно не требуется:

  • Название: нажми на название набора данных, чтобы изменить его. Изменения сохраняются автоматически после потери фокуса или Enter. Длина названия не должна превышать 100 символов.
  • Описание: нажми на описание (или на текст-заполнитель «Добавить описание...»), чтобы изменить его. Изменения сохраняются автоматически. Длина описания не должна превышать 1 000 символов.
  • Тип задачи: нажми на значок типа задачи, чтобы выбрать другой тип.
  • Лицензия: нажми на поле выбора лицензии, чтобы изменить лицензию набора данных.
  • Значок: нажми на значок набора данных, чтобы загрузить собственное изображение, установить в качестве значка одно из изображений набора данных или выбрать букву и цвет.
Изменение типа задачи

Для каждого изображения хранятся аннотации всех типов задач. Изменение типа задачи набора данных определяет, какие аннотации отображаются в редакторе и включаются в экспорт и обучение. Аннотации других типов задач сохраняются в базе данных и снова отображаются при переключении обратно. Исключение — глубина: эталонные данные хранятся в отдельном парном файле, а не как аннотация, поэтому переключить набор данных на тип задачи глубины или с него можно только при отсутствии изображений — вместо этого импортируй набор данных заново.

Пользовательские метаданные#

Открой Другие действия и выбери Информация, чтобы просмотреть два раздела:

  • Метаданные Ultralytics: доступные только для чтения сведения Platform, например идентификатор набора данных, владелец, тип задачи, количество изображений и аннотаций, регион хранения и временные метки
  • Пользовательские метаданные: собственный JSON-объект с данными о происхождении, условиях съёмки, идентификаторах клиентов, управлении или другой контекстной информацией

Пользователи рабочего пространства могут просматривать метаданные, а участники с правом редактирования могут заменить объект пользовательских метаданных. Сериализованный объект метаданных может содержать не более 500 000 символов, а длина каждого ключа верхнего уровня ограничена 128 символами. Сохрани пустой объект ({}), чтобы очистить пользовательские метаданные.

Клонирование набора данных#

Просматривая публичный набор данных, которым ты не владеешь, нажми Clone Dataset, чтобы открыть диалоговое окно клонирования. Проверь целевое рабочее пространство, название, видимость и лицензию, затем подтверди клонирование. Копия включает все изображения, аннотации и определения классов. В рабочих пространствах, где по умолчанию используются публичные наборы данных, исходные публичные наборы данных остаются публичными. Клоны в рабочих пространствах Enterprise по умолчанию приватные. Если у исходного набора данных лицензия с копилефтом, клон наследует её, а выбор лицензии блокируется.

В диалоговом окне клонирования кнопка Клонировать набор данных остаётся неактивной, если этот URL уже используется в целевом рабочем пространстве. Для клонирования также должно хватать оставшейся квоты хранилища на копию.

Подключённые наборы данных

Наборы данных, подключённые к источникам облачного хранилища или On Premise, нельзя клонировать, поскольку Platform не хранит файлы их изображений.

Добавление в избранное и публикация#

  • Добавить в избранное: нажми на кнопку со звездой, чтобы добавить набор данных в закладки. Количество звёзд видно всем пользователям.
  • Поделиться: чтобы поделиться публичным набором данных, нажми кнопку «Поделиться»: можно скопировать ссылку, получить фрагмент для вставки или опубликовать ссылку в социальных сетях.

Удаление набора данных#

Удали ненужный набор данных:

  1. Открой Другие действия (кнопка …) в заголовке набора данных
  2. Выбери Удалить набор данных
  3. Подтверди действие в диалоговом окне: «[name] будет перемещён в корзину. Его можно восстановить в течение 30 дней».

В этом же меню есть пункт Информация, открывающий диалоговое окно с метаданными, описанное в разделе Пользовательские метаданные, и пункт Обновить, который повторно загружает данные набора с сервера.

Корзина и восстановление

Удалённые наборы данных перемещаются в корзину, а не удаляются навсегда. Ты можешь восстановить их в течение 30 дней по адресу Settings > Trash.

Обучение на наборе данных#

Начни обучение прямо из набора данных:

  1. Нажми New Model на странице набора данных
  2. Выбери проект или создай новый
  3. Настрой параметры обучения
  4. Начни обучение
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Подробнее см. в разделе Облачное обучение.

Часто задаваемые вопросы#

  • Данные обрабатываются и хранятся в выбранном тобой регионе (US, EU или AP). Изображения:

    1. Проверяются на соответствие формату и ограничениям по размеру
    2. Отклоняются, если минимальный размер меньше 28px
    3. Нормализуются, если размер превышает 4096px (с сохранением соотношения сторон; кодируются для оптимизации хранения; TIFF сохраняются в исходном виде)
    4. Хранятся с дедупликацией: идентичные изображения сохраняются только один раз
    5. Для быстрого просмотра создаются миниатюры WebP размером 256px
  • Ultralytics Platform эффективно управляет хранилищем:

    • Удаление дубликатов: одинаковые изображения в одном регионе хранения сохраняются только один раз
    • Целостность: для загруженных данных проверяется их целостность
    • Эффективность: в клонах используются уже сохранённые изображения, а не их копии, но они всё равно учитываются в квоте хранилища целевого рабочего пространства
    • Региональное хранение: данные остаются в выбранном тобой регионе (US, EU или AP)
  • Да. Перетащи файлы в галерею датасета или нажми значок загрузки в заголовке страницы — откроется стандартное окно выбора файлов в браузере. После обработки автоматически рассчитывается обновлённая статистика.

  • Да. Скопируй или вырежи изображения в одном датасете и вставь их в другой датасет, который можно редактировать; метки и сплиты сохранятся, а Cut удалит изображения из исходного датасета. Классы сопоставляются по названию, а диалоговое окно Map classes позволяет обработать классы, которых нет в целевом датасете. Подробнее: Копирование и перемещение изображений.

  • Используй функцию массового перемещения в сплит:

    1. Выбери изображения в режиме таблицы
    2. Щёлкни правой кнопкой мыши и выбери Move to split
    3. Выбери целевой сплит (Train, Validation или Test)
  • Ultralytics Platform поддерживает метки YOLO, COCO JSON, JSON LabelMe, NDJSON Ultralytics и Labelbox, семантические PNG-маски и карты глубины, а также загрузку исходных изображений. Метки Pascal VOC XML обнаруживаются, но не импортируются:

    Один файл .txt на изображение с нормализованными координатами (диапазон 0–1):

    ЗадачаФорматПример
    Обнаружениеclass cx cy w h0 0.5 0.5 0.2 0.3
    Сегментацияclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Семантическаяclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Позаclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    КлассификацияСтруктура каталоговtrain/cats/, train/dogs/

    Флаги видимости ключевых точек: 0=не размечена, 1=размечена, но перекрыта, 2=размечена и видна. Семантические датасеты также поддерживают PNG-маски вместо файлов с полигонами (см. Семантические маски).

  • Да. Для каждого изображения вместе хранятся аннотации всех 6 типов задач разметки (detect, segment, semantic, classify, pose, OBB). Ты можешь в любой момент изменить активный тип задачи датасета, не теряя существующие аннотации. В редакторе и при экспорте и обучении отображаются и используются только аннотации активного типа задачи — аннотации для других задач сохраняются и снова появляются при переключении обратно.

  • Да:

    ОграничениеЗначение
    Классов в датасете25,000
    Аннотаций на изображение10,000
    Координат на аннотацию10,000
    Название датасета100 символов
    Описание датасета1 000 символов
    Пользовательские метаданные500 000 сериализованных символов
    Ключ верхнего уровня метаданных128 символов
  • Датасеты, использующие данные из облачного хранилища или источников On Premise, хранят изображения за пределами Platform, поэтому функции, которым нужны собственные копии данных изображений в Platform, недоступны:

    ХарактеристикаПодключено к облакуOn Premise
    Интеллектуальная и пакетная разметкаНедоступноНедоступно
    Кластерный анализНедоступноНедоступно
    КлонированиеНедоступноНедоступно
    Снимки версийНедоступноНедоступно
    Экспорт NDJSONДоступноНедоступно
    Импорт семантических PNG-масокНедоступноДоступно
    Размытие лицНедоступноНедоступно
    Поиск похожих изображенийНедоступноНедоступно
    Генерация похожих изображенийНедоступноНедоступно
    Вставка изображений в датасетНедоступноНедоступно

    Просмотр, ручная разметка, управление классами, сплитами, статистикой и обучение работают в обычном режиме.

Комментарии