YOLO Vision 2026:

Наборы данных#

Датасеты Ultralytics Platform представляют собой готовое решение для управления обучающими данными. После загрузки платформа автоматически обрабатывает изображения, разметку и статистику.

Датасет готов к обучению, как только завершится обработка и в нем появится хотя бы одно изображение в выборке train, хотя бы одно изображение в выборке val или test, а также хотя бы одно размеченное изображение. Заголовок датасета отображает значок Ready, когда выполнены все три условия, и значок Not Ready в противном случае — нажми на значок, чтобы увидеть, какое именно условие не выполнено.

Загрузить датасет#

Ultralytics Platform принимает данные в различных форматах для обеспечения гибкости работы.

У тебя уже есть данные в другом месте?

Если у тебя уже есть датасеты в Roboflow, используй Integrations для их импорта напрямую — ручной экспорт или повторная загрузка не требуются. Данные из Google Cloud Storage, Amazon S3 или Azure Blob Storage можно использовать напрямую с помощью параметра Cloud storage. Корпоративные воркспейсы могут использовать On Premise для индексации локальных данных и обучения на них без отправки пикселей на Platform.

Поддерживаемые форматы#

ФорматРасширенияПримечанияМакс. размер
JPEG.jpg, .jpegСамые популярные, рекомендуемые50 MB
PNG.pngПоддерживает прозрачность50 MB
WebP.webpСовременный формат, хорошая степень сжатия50 MB
BMP.bmpБез сжатия50 MB
TIFF.tiff, .tifВысокое качество50 MB
HEIC.heicФото с iPhone50 MB
AVIF.avifФормат нового поколения50 MB
JP2.jp2JPEG 200050 MB
DNG.dngRaw (необработанные) с камер50 MB
MPO.mpoMulti-picture object (объект с несколькими изображениями)50 MB

Поддержка видеокодеков#

Само по себе расширение файла не гарантирует успех: видео все равно может не пройти обработку, если его кодек не удается декодировать.

Используй H.264 MP4

Видео H.264 в контейнере MP4 имеет наибольшую поддержку декодеров и является самым надежным выбором. Если видео не обрабатывается, перекодируй его с помощью FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Подготовка датасета#

Платформа поддерживает Ultralytics YOLO, COCO, датасеты глубины, Ultralytics NDJSON и сырые (неразмеченные) загрузки:

Используй стандартную структуру каталогов YOLO с файлом data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

YAML-файл определяет конфигурацию твоего датасета:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Загрузка необработанных данных

Raw: Загрузка неразмеченных изображений (без меток). Полезно, когда ты планируешь размечать данные прямо на платформе с помощью редактора разметки.

Плоская структура папок

Ты также можешь загружать изображения без явных папок с разделением. Платформа учитывает активную целевую выборку при загрузке. Если целевая выборка не задана и после загрузки val остается пустым — или содержит менее двух парных карт для глубины — датасеты (за исключением классификации) автоматически перемещают изображения обучения в val, чтобы датасет был сразу готов к обучению. Датасеты классификации пропускаются, так как они используют разделение на основе каталогов. Ты всегда можешь переназначить изображения позже с помощью массового перемещения в выборку или перераспределения выборок.

Автоматическое определение формата

Формат определяется автоматически: датасеты с файлом data.yaml, содержащим ключи names, train или val, обрабатываются как YOLO. Датасеты с файлами JSON в формате COCO (содержащие массивы images, annotations и categories) обрабатываются как COCO. Экспорты .ndjson импортируются как Ultralytics NDJSON. Датасеты, содержащие только изображения и не имеющие аннотаций, обрабатываются как raw.

Если архив содержит несколько YAML-файлов, Platform отдает предпочтение стандартным именам (data.yaml, data.yml, dataset.yaml, dataset.yml), находящимся ближе всего к корню архива. Оставляй один файл YAML с понятным именем на один архив во избежание путаницы.

Файлы Pascal VOC XML не импортируются

Файлы разметки в формате Pascal VOC XML обнаруживаются, но их аннотации не импортируются — изображения загружаются без разметки. Platform предупреждает тебя до начала загрузки («Обнаружена разметка Pascal VOC»). Сначала конвертируй VOC XML в формат YOLO или COCO; см. инструменты конвертации форматов.

Если разметка ссылается на ID классов, но имена классов не указаны, Platform генерирует общие имена-заглушки (class0, class1, …), которые ты сможешь переименовать позже на вкладке «Классы».

Подробности о форматах для конкретных задач см. в разделах поддерживаемые задачи и Обзор датасетов.

Процесс загрузки#

Чтобы создать датасет:

  1. Перейди в Annotate на боковой панели
  2. Нажми New Dataset
  3. Выбери вкладку источника данных (см. Источники данных ниже)
  4. Укажи имя (URL-слаг создается автоматически, его можно изменить), а также добавь описание по желанию
  5. Выбери тип задачи (см. поддерживаемые задачи), лицензию (опционально, см. доступные лицензии) и видимость (публичный или приватный)
  6. Нажми Create & Upload для локальных файлов, Create & Import для URL или подключенного источника либо Create Dataset, чтобы начать с пустого датасета

Ultralytics Platform Datasets Upload Dialog Task Selector Чтобы добавить файлы в существующий датасет, открой его страницу и либо перетащи файлы в галерею, либо нажми значок загрузки в шапке страницы. Значок загрузки открывает нативный выбор файлов твоего браузера напрямую, так как задача датасета уже определена.

Источники данных#

Диалоговое окно New Dataset предлагает четыре источника:

ИсточникОписание
ЗагрузкаПеретащи файлы или найди их через проводник — изображения, видео, архивы или NDJSON
URLВставь прямую ссылку на файл .zip, .tar, .tar.gz, .tgz или .ndjson; Platform скачает и обработает его на стороне сервера
ОблакоИспользуй данные на месте из Google Cloud Storage, Amazon S3 или Azure Blob Storage (для тарифов Pro и Enterprise)
ЛокальноИндексируй данные и обучайся на них, не покидая собственную инфраструктуру, с помощью рабочих узлов On Premise (для тарифа Enterprise)
Лимиты импорта по URL

Импорт по URL ограничен как лимитом твоего тарифного плана на одну загрузку (10 ГБ для Free / 20 ГБ для Pro / 50 ГБ для Enterprise), так и оставшейся квотой хранилища (выбирается меньшее из значений). Ссылка должна быть общедоступной по протоколу HTTP или HTTPS и заканчиваться поддерживаемым расширением.

До начала загрузки#

Platform проверяет файлы в браузере перед началом любой загрузки, поэтому распространенные проблемы выявляются сразу, а не после долгой передачи данных. Архивы проверяются на повреждения, отсутствие файлов, защиту паролем и синтаксические ошибки YAML, а слишком большие файлы выводятся списком по именам.

После этого могут появиться два диалоговых окна:

Когда архив содержит имена классов, а в твоем датасете уже есть классы, диалоговое окно Map imported classes выводит по одной строке для каждого нового класса. Для каждого из них выбери существующий класс для объединения, создай новый класс или пропусти его. Точные совпадения имен выбираются автоматически, а пропущенные классы и их разметка не импортируются.

После загрузки платформа автоматически обрабатывает твои данные:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Валидация: Проверка формата и размера
  2. Нормализация: крупные изображения масштабируются (максимум 4096 пикселей, минимальная сторона 28 пикселей), оттенки серого преобразуются в RGB, прозрачность сводится на белом фоне, а также применяется EXIF-ориентация
  3. Миниатюры: Создаются превью в формате WebP размером 256px
  4. Разбор разметки: извлекаются данные разметки YOLO, COCO и NDJSON
  5. Статистика: Вычисляются распределения классов и размеры изображений
Кодирование сохраненных изображений

Оригиналы в форматах AVIF и WebP сохраняются байт-в-байт, если не требуется изменение размера или цвета. Все остальное перекодируется: источники WebP остаются в формате WebP, а все остальные форматы (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) преобразуются в JPEG с качеством 92. Исходное имя файла и расширение сохраняются в качестве метаданных.

Ultralytics Platform Datasets Upload Progress Bar

Валидация перед загрузкой

Ты можешь проверить свой датасет локально перед загрузкой:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Требования к размеру изображений

Изображения должны быть не менее 28px по своей короткой стороне. Изображения меньшего размера отклоняются при обработке. Изображения, превышающие 4096px по своей длинной стороне, автоматически масштабируются с сохранением соотношения сторон.

Обзор изображений#

Просматривай изображения своего датасета в различных макетах.

Открой панель Clustering на панели инструментов галереи, чтобы изучить свой датасет в виде интерактивной двумерной диаграммы рассеяния.

ВидОписание
СеткаСетка миниатюр с наложенной разметкой (по умолчанию)
CompactУменьшенные миниатюры для быстрого просмотра
TableСписок с миниатюрой, именем файла, размерами, размером в байтах, выборкой, классами и количеством меток

Ultralytics Platform Datasets Gallery Grid View With Annotations

Сортировка и фильтрация#

Изображения можно сортировать и фильтровать для эффективного просмотра:

Каждая опция переключается между по возрастанию (↑) и по убыванию (↓):

СортироватьОписание
Дата создания ↑/↓Порядок загрузки (по умолчанию ↓)
Имя ↑/↓Имя файла по алфавиту
Высота ↑/↓Высота изображения в пикселях
Ширина ↑/↓Ширина изображения в пикселях
Размер ↑/↓Размер файла на диске
Аннотации ↑/↓Количество аннотаций на изображение
Большие наборы данных

Для датасетов с количеством изображений более 100 000 сортировка по имени, ширине, высоте и размеру скрывается для поддержания быстродействия галереи. Сортировка по дате создания и количеству разметки остается доступной.

Поиск неразмеченных изображений

Используй фильтр Annotations, установленный в значение Unannotated, чтобы быстро находить изображения, которые еще нуждаются в разметке. Это особенно полезно для больших датасетов, когда нужно отслеживать прогресс разметки.

Поиск по пользовательским метаданным

Строка поиска располагается справа на панели инструментов галереи и фильтрует все режимы отображения — в виде сетки, компактный и в виде таблицы. Она сопоставляется с именем файла изображения (расширение файла необязательно), а также с пользовательскими ключами метаданных, скалярными значениями и элементами массивов, поэтому изображение с именем img_0042, содержащее {"ship_type": "yacht"}, находится поиском по запросу img_0042 или yacht.

Значения, вложенные во внутренние объекты, не сопоставляются. Вставка 24-значного ID изображения позволяет напрямую найти именно это изображение, минуя текстовый поиск.

Полноэкранный просмотрщик#

Нажми на любое изображение, чтобы открыть полноэкранный просмотрщик с помощью:

  • Навигация: клавиши со стрелками или миниатюры для просмотра
  • Информация об изображении: просмотр сгенерированных Platform свойств, пользовательских метаданных и встроенных метаданных файла, таких как EXIF
  • Пользовательские метаданные: Владельцы и редакторы могут добавлять или заменять JSON-объект, включая вложенные значения размером до 500 000 сериализованных символов и ключи верхнего уровня длиной до 128 символов
  • Аннотации: переключение видимости слоя аннотаций
  • Распределение классов: количество разметок по классам с цветовыми индикаторами
  • Annotate: Когда у тебя есть права на редактирование, элементы управления разметкой активируются сразу после открытия средства просмотра на полный экран на десктопе
  • Загрузка: скачивание исходного файла изображения
  • Удаление: удаление изображения из набора данных
  • Масштабирование: Cmd/Ctrl+Scroll, Cmd/Ctrl++ или Cmd/Ctrl+= для приближения и Cmd/Ctrl+- для отдаления
  • Сброс вида: Cmd/Ctrl + 0 или кнопка сброса, чтобы подогнать изображение под размер окна просмотра
  • Панорамирование: удерживай Space и перетаскивай мышью для перемещения холста при масштабировании
  • Пиксельный вид: включение пиксельного рендеринга для детального изучения
  • Шторка глубины: на датасетах глубины перетаскиваемый разделитель стирает границы между RGB-изображением и его цветной картой глубины

Ultralytics Platform Datasets Fullscreen Viewer With Metadata Panel

Фильтр по сплиту#

Фильтрация изображений по их сплиту в наборе данных:

SplitЦель
ОбучениеИспользуется для обучения модели
ValИспользуется для валидации во время обучения
TestИспользуется для финальной оценки

Кластеризация#

Панель Clustering проецирует твой датасет на интерактивную двумерную диаграмму рассеяния, где визуально похожие изображения располагаются близко друг к другу. Используй её для выявления кластеров, поиска дубликатов и выбросов, а также для проверки распределения сплитов и классов по твоим данным — не покидая галерею. Открой её с помощью значка графика рассеяния на панели инструментов галереи на любой странице датасета.

Ultralytics Platform Datasets Clustering Empty State

Запуск анализа#

Запуск анализа:

  1. Открой набор данных и нажми на значок диаграммы рассеяния на панели инструментов галереи
  2. Нажми Analyze Dataset
  3. Дождись завершения работы индикатора выполнения — результаты появятся на той же панели

Анализ выполняется в фоновом режиме в два этапа (Computing embeddings и Clustering) и может занять несколько минут в зависимости от размера твоего датасета. Ты можешь закрыть панель или покинуть страницу и вернуться позже.

Требования к анализу

Для анализа датасет должен содержать не менее 20 и не более 200 000 изображений без ошибок. Подключенные датасеты, размещенные в облачном или локальном (On Premise) хранилище, пока не поддерживаются.

Визуализация#

После завершения анализа на панели отображается двумерная диаграмма рассеяния всех проанализированных изображений с легендой и счетчиком точек. Фильтры галереи (выборка, класс, размеченные/неразмеченные) затемняют точки вне фильтра, чтобы ты мог сосредоточиться на нужной подгруппе — счетчик при этом показывает visible / total points.

Ultralytics Platform Datasets Clustering Scatter Plot

Раскраска по#

Измени способ раскраски точек данных с помощью выпадающего списка Color by на панели инструментов. Переключай режимы отображения в любой момент — график мгновенно меняет цвета, позволяя увидеть, как сплиты, классы или свойства изображений распределены по твоим кластерам:

ОпцияЗатенение
SplitsTrain / Val / Test
ClassesПервый класс аннотации на каждом изображении
WidthШирина изображения
HeightВысота изображения
SizeРазмер файла
АннотацииКоличество аннотаций на изображение

Ultralytics Platform Datasets Clustering Color Modes

Выделение лассо#

Нарисуй произвольную область выделения вокруг региона, чтобы подсветить точки на графике. Галерея отфильтрует подходящие изображения, и ты сможешь просмотреть их, переразметить, переместить или удалить, используя привычные операции с изображениями.

Очистить выделение

Чип над графиком показывает количество выбранных точек — нажми ×, чтобы сбросить лассо и вернуться к просмотру всей галереи.

Размер выборки

Инструмент выделения лассо охватывает не более 1000 изображений. Если твой выбор превышает это число, Platform показывает выборку из 1000 элементов и предлагает выделить область поменьше.

Панорамирование и масштабирование#

Управляй большими диаграммами рассеяния с помощью мыши и клавиатуры либо кнопками масштабирования в левом нижнем углу графика:

ВводДействие
Scroll (колесико мыши)Панорамирование диаграммы в 2D
Cmd/Ctrl+ScrollПриближение или отдаление относительно курсора
Удерживание SpaceПереключение в режим перетаскивания (панорамирования)
Кнопка сбросаВернуться к полному масштабу графика

Повторный анализ#

Если твой датасет изменился после анализа (поступили новые изображения или количество проанализированных элементов больше не совпадает с датасетом), в верхней части панели для владельцев и редакторов появляется кнопка Re-analyze.

Нажми Re-analyze, чтобы пересчитать векторные представления (эмбеддинги) и 2D-проекцию с нуля.

Вкладки набора данных#

Каждая страница набора данных может отображать до шести вкладок в зависимости от состояния набора данных и твоих прав доступа:

Вкладка Images#

Вид по умолчанию, показывающий галерею изображений с наложенными аннотациями. Поддерживаются режимы сетки, компактный и табличный. Перетаскивай файлы сюда, чтобы добавить больше изображений.

Вкладка Classes#

Эта вкладка появляется, когда в датасете есть изображения, а для его задачи заданы классы.

Управляй классами аннотаций для своего набора данных:

  • Гистограмма классов: столбчатая диаграмма, показывающая количество разметок по классам, отсортированная по частоте, с переключателем линейной/логарифмической шкалы
  • Таблица классов: таблица с возможностью сортировки и поиска, содержащая индекс, имя, количество разметок и количество изображений
  • Редактирование названий классов: нажми на любое название класса, чтобы изменить его прямо в таблице.
  • Редактирование цветов классов: нажми на образец цвета, чтобы изменить цвет класса.
  • Добавление нового класса: используй поле ввода в нижней части, чтобы добавить классы.
  • Объединить классы: выбери две или более строки и нажми Merge into one
  • Удалить классы: выбери одну или более строк и нажми Delete

Ultralytics Platform Datasets Classes Tab Histogram And Table

Логарифмическая шкала для несбалансированных наборов данных

Если в твоем датасете наблюдается дисбаланс классов (например, 10 000 аннотаций класса "person" и всего 50 класса "bicycle"), используй переключатель Log Scale на гистограмме классов, чтобы четко визуализировать все классы.

Объединение классов#

Объединение консолидирует дублирующиеся или пересекающиеся метки — например, сводит car, automobile и vehicle в один класс:

  1. Выбери два или более классов с помощью флажков в строках
  2. Нажми Merge into one в заголовке таблицы или кликни правой кнопкой мыши по выделению
  3. Выбери, в какой из выбранных классов (целевой) будут объединены остальные
  4. Подтверди действие

Каждая разметка, принадлежащая исходным классам, переназначается целевому классу, а исходные классы удаляются. Никакие аннотации не удаляются, поэтому общее количество разметок в датасете остается неизменным.

Удаление классов#

  1. Выбери один или более классов с помощью флажков в строках
  2. Нажми Delete в заголовке таблицы или кликни правой кнопкой мыши по выделению
  3. Подтверди действие

Удаление класса приводит к удалению самого класса и всей его разметки. Для датасетов классификации метки удаляются, но изображения остаются, становясь неразмеченными.

Сдвиг индексов классов

ID классов привязаны к их позициям. Объединение или удаление класса сдвигает вниз все индексы последующих классов, чтобы заполнить образовавшийся пробел, поэтому экспорты и файлы разметки, созданные до этого изменения, перестанут соответствовать новым индексам. Создай версию предварительно, если тебе нужна старая нумерация.

Выборка статистики

Количество классов вычисляется не более чем по 100 000 изображениям. На больших датасетах над гистограммой отображается примечание «На основе подмножества этого датасета размером 100 000 изображений».

Вкладка «Графики»#

Эта вкладка появляется, когда в наборе данных есть изображения.

Автоматическая статистика, рассчитанная для твоего набора данных:

Графики отображаются в указанном порядке, и каждый из них скрывается, если в датасете нет соответствующих данных: датасет с исходными изображениями не показывает графики разметки, а Points per Instance появляется только для данных сегментации и поз:

ГрафикОписание
Распределение по выборкамКольцевая диаграмма количества изображений и процентов размеченных данных для выборок train/val/test.
Популярные классыКольцевая диаграмма 10 наиболее частых классов разметки, остальные объединены в категорию «Прочие»
Размеры изображенийГистограмма распределения ширины и высоты изображений (наложенные друг на друга) со средним значением.
Размер файлов изображенийГистограмма распределения размеров файлов изображений.
Размеры изображений 2D2D-теплокарта ширины и высоты с направляющими линиями соотношения сторон.
Расположение аннотаций2D-теплокарта центральных позиций ограничивающих прямоугольников (bbox).
Форматы изображенийРаспределение исходных форматов изображений (JPG, PNG и т.д.).
Размеры ограничивающих прямоугольниковГистограмма ширины и высоты ограничивающих прямоугольников (наложенные друг на друга).
Объектов на изображениеГистограмма количества аннотаций на одно изображение.
Точек на экземплярКоличество вершин полигона или ключевых точек на одну аннотацию (сегментация/поза).

Ultralytics Platform Datasets Charts Tab Statistics Grid

Кэширование статистики

Platform кэширует вычисленную статистику и сбрасывает кэш при изменении изображений, разметки, классов или выборок. На датасетах размером более 100 000 изображений графики вычисляются по подмножеству из 100 000 изображений, о чем сообщается над сеткой.

Полноэкранные теплокарты

Нажми кнопку развертывания на любой теплокарте, чтобы просмотреть ее в полноэкранном режиме. Это обеспечивает более крупный и детализированный вид — полезно для понимания пространственных закономерностей в больших наборах данных.

Вкладка «Модели»#

Просматривай все модели, обученные на этом наборе данных, в таблице с возможностью поиска:

СтолбецОписание
ИмяНазвание модели со ссылкой
ПроектРодительский проект с иконкой
ВерсияНеизменяемая версия датасета, используемая для обучения, если таковая имеется
СтатусБейдж статуса обучения
ЗадачаТип задачи YOLO
ЭпохиЛучшая эпоха / общее количество эпох
mAP50-95Средняя точность (Mean average precision)
mAP50mAP при IoU 0.50
СозданоДата создания

Ultralytics Platform Datasets Models Tab Trained Models Table

Вкладка «Ошибки»#

Эта вкладка появляется только в том случае, если один или несколько файлов не прошли обработку.

Изображения, которые не прошли обработку, перечислены здесь с:

  • Баннер ошибки: общее количество изображений с ошибками и рекомендации
  • Таблица ошибок: имя файла, понятное описание ошибки, советы по исправлению и миниатюра для предпросмотра
  • Распространенные ошибки включают поврежденные файлы, неподдерживаемые форматы, слишком маленькие изображения (минимум 28px) и неподдерживаемые цветовые режимы

Ultralytics Platform Datasets Errors Tab Processing Failures

Распространенные ошибки обработки
ОшибкаПричинаИсправление
Невозможно прочитать файл изображенияПоврежденный или неподдерживаемый форматЭкспортируй повторно из графического редактора
Неполный или поврежденный файлФайл был усечен во время передачиСкачай исходный файл повторно
Неподдерживаемый формат изображенияФормат, который Platform не может декодироватьКонвертируй в JPG, PNG или WebP
Ошибка прав доступа к файлуФайл заблокирован или защищен от чтенияРазблокируй файл и повтори загрузку
Изображение слишком маленькоеМинимальный размер стороны меньше 28pxИспользуй исходные изображения более высокого разрешения
Неподдерживаемый цветовой режимЦветовой режим CMYK или индексированные цветаКонвертируй в режим RGB

Вкладка «Версии»#

Создавай неизменяемые NDJSON-снимки твоего набора данных для воспроизводимого обучения. Каждая версия фиксирует количество изображений, количество классов, количество аннотаций и размер файла на момент создания.

СтолбецОписание
ВерсияНомер версии (v1, v2, ...)
ОписаниеОписание, предоставленное пользователем (редактируемое)
ИзображенияКоличество изображений на момент создания снимка
КлассыКоличество классов на момент создания снимка
АннотацииКоличество аннотаций на момент создания снимка
РазмерРазмер файла экспорта NDJSON
СозданоВремя создания версии
ДействияСкачать или восстановить

Чтобы создать версию:

  1. Открой вкладку Версии
  2. При необходимости введи описание (например, «Добавлено 500 изображений для обучения» или «Исправлены ошибки в разметке классов»)
  3. Нажми Создать версию
  4. Новая версия появится в таблице

Каждая версия нумеруется последовательно (v1, v2, v3...) и является неизменяемой — версии нельзя редактировать или удалять, можно лишь менять их описание. Используй действия в строке, чтобы скачать или восстановить любую версию в любой момент.

Восстановление версии

Восстановление заменяет текущие изображения, выборки, классы и разметку датасета выбранным снимком и не может быть отменено, если предварительно не сохранить текущее состояние как другую версию. Во время восстановления датасет блокируется со статусом processing. При восстановлении ничего не загружается заново, поэтому этот процесс обычно проходит быстро даже на больших датасетах.

Сохранение версии во время обучения

Включи опцию Save Dataset Version в диалоговом окне облачного обучения, чтобы связать модель с точной версией датасета, использованной для обучения. Platform повторно использует подходящую версию, если содержимое датасета не изменилось, и создает новую версию только тогда, когда оно изменилось.

Только готовые наборы данных

Создание и восстановление версий доступны после того, как датасет достигнет статуса ready. Версии недоступны для подключенных облачных датасетов или датасетов On Premise.

Когда создавать версии

Создавай версию до и после внесения значительных изменений в свой набор данных — добавления изображений, исправления аннотаций или перебалансировки выборок. Это позволит тебе сравнивать производительность моделей для разных состояний набора данных.

Размер файла NDJSON

Указываемый размер — это размер экспортного файла NDJSON, который содержит URL изображений и разметку, а не сами изображения. Сами данные изображений хранятся отдельно и доступны по подписанным URL. Файл снимка все равно учитывается в квоте хранилища твоего рабочего пространства, поэтому создание версии завершится ошибкой, если у тебя не осталось свободного места.

Экспортировать набор данных#

Экспортируй набор данных для использования в автономном режиме с помощью загрузки NDJSON из заголовка набора данных или вкладки «Версии».

Для экспорта:

  1. Нажми кнопку Download (иконка загрузки) в заголовке набора данных
  2. Скачивай текущий снимок NDJSON напрямую
  3. Используй вкладку Versions, если тебе нужен неизменяемый пронумерованный снимок, который можно скачать повторно позже

Ultralytics Platform Datasets Export Ndjson Download Формат NDJSON хранит один объект JSON на каждую строку. Первая строка содержит метаданные датасета, за ней следует по одной строке на каждое изображение:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

Необязательный объект metadata на уровне изображения сохраняется при импорте NDJSON-файла в Platform. Ты можешь просмотреть или отредактировать его на полноэкранной информационной панели изображения. Для программной загрузки архивов API добавления данных датасета принимает эквивалентную карту путей imageMetadata.

Датасеты поз также содержат поле kpt_shape в строке заголовка датасета, которое вычисляется из разметки, если оно еще не задано.

Экспорт глубин объявляет "task": "depth" и "depth_scale": 1000 в строке датасета. Каждая строка изображения включает depth.url для парного простого 16-битного PNG. Ultralytics загружает URL-адреса изображений и глубин одновременно и записывает обучающий файл YAML с тем же масштабом, поэтому файл NDJSON можно напрямую передать в model.train(data=...).

Подписанные URL

URL изображений в экспортированном файле NDJSON подписаны и действительны в течение 7 дней. Platform повторно использует кэшированный экспорт на срок до 6 дней, если датасет не изменился, поэтому свежая загрузка всегда имеет как минимум один день срока действия. Если тебе нужны новые URL раньше, измени датасет или создай новую версию.

Датасеты On Premise

Экспорт недоступен для датасетов On Premise, байты изображений которых никогда не попадают в Platform.

Полную спецификацию см. в документации по формату Ultralytics NDJSON.

Операции с изображениями#

Быстрые действия#

Нажми правой кнопкой мыши на любое изображение в режиме Grid или Compact, чтобы получить доступ к быстрым действиям:

ДействиеОписание
Move to Split (Переместить в выборку)Переназначь изображение в выборку Train, Val или Test
СкачиваниеСкачай исходный файл изображения
Delete (Удалить)Удали изображение из набора данных

Ultralytics Platform Datasets Image Card Context Menu

Одиночные и массовые операции

Контекстное меню изображения работает с одним изображением. Для массовых операций с несколькими изображениями используй представление Table с выбором через флажки.

Массовое перемещение в выборку#

Переназначь выбранные изображения в другую выборку внутри того же набора данных:

  1. Переключись в режим Table
  2. Выбери изображения с помощью флажков
  3. Нажми правой кнопкой мыши, чтобы открыть контекстное меню
  4. Выбери Move to split > Train, Validation или Test

Ты также можешь перетаскивать изображения на вкладки фильтров выборок в режиме сетки. Если перемещение изображения приведет к конфликту с идентичным изображением, уже находящимся в целевой выборке, Platform спросит, нужно ли пропустить файл, оставить оба или заменить.

Организация выборок Train/Val

Загрузи все изображения в один набор данных, а затем используй массовое перемещение в выборку для распределения подмножеств на обучающую, валидационную и тестовую выборки.

Перераспределение выборок#

Перераспредели все изображения между обучающей, валидационной и тестовой выборками, используя пользовательские коэффициенты:

  1. Нажми на панель выборки в панели инструментов набора данных, чтобы открыть диалоговое окно Redistribute Splits
  2. Настрой процентное соотношение выборок, используя любой из методов ниже
  3. Изучи динамический предварительный просмотр количества изображений, чтобы подтвердить распределение
  4. Нажми Apply, чтобы случайным образом переназначить все изображения в соответствии с твоими процентами

Ultralytics Platform Datasets Split Redistribution Dialog Диалоговое окно предоставляет три способа установки целевых пропорций сплитов:

МетодОписание
Drag (Перетаскивание)Перетаскивай маркеры между цветными сегментами для визуальной настройки границ выборки
Type (Ввод)Отредактируй процентное значение для любой выборки (остальные две автоматически пересчитаются пропорционально)
Auto (Авто)Один клик для мгновенной установки соотношения 80/20 для обучающей/валидационной выборок при значении 0% для тестовой

Динамический предварительный просмотр точно показывает, сколько изображений попадет в каждую выборку, прежде чем ты применишь изменения.

Быстрая выборка 80/20

Нажми кнопку Auto, чтобы мгновенно установить рекомендуемое соотношение 80/20 для обучающей/валидационной выборок. Это наиболее распространенное соотношение для обучения.

Массовое удаление#

Удали несколько изображений за раз:

  1. Выбери изображения в режиме таблицы
  2. Нажми правой кнопкой мыши и выбери Delete, либо нажми Cmd/Ctrl+Delete
  3. Подтверди удаление

URI набора данных#

Ссылайся на датасеты Platform, используя формат URI ul:// (см. раздел Использование датасетов платформы):

ul://username/datasets/dataset-slug

Ты также можешь напрямую вставить веб-URL датасета или модели (например, https://platform.ultralytics.com/username/datasets/dataset-slug); он автоматически преобразуется в URI ul://. Передача списка датасетов выполняет дообучение одной базовой модели на каждом из них последовательно, например model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Используй этот URI для обучения моделей из любого места:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Обучай где угодно с данными Platform

URI ul:// работает из любой среды:

  • Локальная машина: обучай на своем оборудовании, данные скачиваются автоматически
  • Google Colab: получай доступ к своим наборам данных Platform в ноутбуках
  • Удаленные серверы: обучай на облачных виртуальных машинах с полным доступом к набору данных

Доступные лицензии#

Platform поддерживает следующие лицензии для наборов данных:

ЛицензияТип
НетЛицензия не выбрана
CC0-1.0Общественное достояние
PDM-1.0Общественное достояние
CC-BY-2.5Разрешительная
CC-BY-4.0Разрешительная
CC-BY-NC-2.0Некоммерческая
CC-BY-SA-4.0Копилефт
CC-BY-NC-4.0Некоммерческая
CC-BY-NC-SA-3.0Копилефт
CC-BY-NC-SA-4.0Копилефт
CC-BY-ND-4.0Без производных работ
CC-BY-NC-ND-4.0Некоммерческая
Apache-2.0Разрешительная
MITРазрешительная
AGPL-3.0Копилефт
GPL-3.0Копилефт
Только для исследованийОграниченная
ДругоеПользовательская
Лицензии Copyleft

При клонировании датасета с лицензией copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0) клон наследует эту лицензию, а селектор лицензий блокируется.

Настройки видимости#

Контролируй, кто может видеть твой набор данных:

НастройкаОписание
Private (Частный)Доступ есть у тебя и участников рабочего пространства с соответствующими разрешениями
Public (Публичный)Просмотр доступен всем, в том числе со страницы Explore

Видимость устанавливается при создании датасета в диалоговом окне New Dataset с помощью переключателя. Публичные датасеты видны на странице Explore.

Редактирование набора данных#

Метаданные набора данных редактируются непосредственно на странице набора данных — диалоговое окно не требуется:

  • Имя: Нажми на имя датасета, чтобы отредактировать его. Изменения сохраняются автоматически при потере фокуса или нажатии Enter. Длина имени ограничена 100 символами.
  • Описание: Нажми на описание (или плейсхолдер "Add a description..."), чтобы отредактировать его. Изменения сохраняются автоматически. Описание ограничено 1 000 символов.
  • Task type: Нажми на значок задачи, чтобы выбрать другой тип задачи.
  • License: Нажми на селектор лицензии, чтобы изменить лицензию набора данных.
  • Иконка: Нажми на иконку датасета, чтобы загрузить собственное изображение, сделать одно из изображений датасета иконкой или выбрать букву и цвет.
Изменение типа задачи

Каждое изображение хранит разметку для всех типов задач вместе. Изменение типа задачи датасета определяет, какая разметка отображается в редакторе и включается в экспорт и обучение. Разметка для других типов задач сохраняется в базе данных и появляется снова, когда ты переключаешься обратно. Глубина — это исключение: ее эталонные данные представляют собой парный файл, а не разметку, поэтому датасет может переключаться на глубину или с нее только тогда, когда в нем нет изображений; переимпортируй его вместо этого.

Пользовательские метаданные#

Открой Ещё действия и выбери Информация, чтобы просмотреть два раздела:

  • Метаданные Ultralytics: Сведения о Platform только для чтения, такие как ID датасета, владелец, задача, количество изображений и аннотаций, регион хранения и временные метки
  • Пользовательские метаданные: Твой собственный JSON-объект для отслеживания происхождения, условий съёмки, ID клиентов, управления или других контекстных данных

Наблюдатели рабочей области могут просматривать метаданные, в то время как участники с правом редактирования могут заменять объект пользовательских метаданных. Сериализованный объект метаданных ограничен 500 000 символов, а каждый ключ верхнего уровня ограничен 128 символами. Сохрани пустой объект ({}), чтобы очистить пользовательские метаданные.

Клонирование набора данных#

При просмотре публичного датасета, владельцем которого ты не являешься, нажми Clone Dataset, чтобы открыть диалоговое окно клонирования. Проверь целевой воркспейсе, название, видимость и лицензию, а затем подтверди клонирование. Копия включает все изображения, аннотации и определения классов. Публичные исходные датасеты по умолчанию остаются публичными в воркспейсах, где видимость по умолчанию — публичная; клоны в корпоративных воркспейсах по умолчанию приватные. Если оригинальный датасет имеет лицензию copyleft, клон наследует её, и выбор лицензии будет заблокирован.

Целевой ярлык (slug) автоматически переименовывается, если он уже занят, а для клонирования требуется достаточно свободного дискового пространства под копию.

Подключенные датасеты

Датасеты, использующие облачное хранилище или локальные источники, не могут быть клонированы, поскольку Platform не хранит их бинарные изображения.

Отметить и поделиться#

  • Star: Нажми кнопку со звездочкой, чтобы добавить набор данных в закладки. Количество отметок звездочкой видно всем пользователям.
  • Поделиться: Для публичных датасетов нажми кнопку «Поделиться», чтобы скопировать ссылку, получить код для вставки или поделиться в соцсетях.

Удалить набор данных#

Удаление набора данных, который тебе больше не нужен:

  1. Открой Другие действия (кнопка ) в заголовке датасета
  2. Выбери Удалить датасет
  3. Подтверди действие в диалоговом окне: "Это переместит [name] в корзину. Ты сможешь восстановить его в течение 30 дней."

В этом же меню находится пункт Информация, открывающий диалоговое окно метаданных, описанное в разделе Пользовательские метаданные, а также пункт Обновить, который перезагружает датасет с сервера.

Корзина и восстановление

Удаленные датасеты перемещаются в корзину (Trash), а не удаляются навсегда. Ты можешь восстановить их в течение 30 дней из раздела Settings > Trash.

Обучение на наборе данных#

Начни обучение прямо из своего набора данных:

  1. Нажми New Model на странице датасета
  2. Выбери проект или создай новый
  3. Настрой параметры обучения
  4. Запусти обучение
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Подробности см. в разделе Облачное обучение.

FAQ#

  • Твои данные обрабатываются и хранятся в выбранном регионе (US, EU или AP). Изображения:

    1. Проверяются на формат и размер
    2. Отклоняются, если минимальный размер менее 28px
    3. Нормализуются, если размер превышает 4096px (с сохранением соотношения сторон; кодируются для оптимизированного хранения)
    4. Хранится с дедупликацией, поэтому идентичные изображения сохраняются только один раз
    5. Миниатюры создаются в формате WebP размером 256px для быстрого просмотра
  • Ultralytics Platform эффективно управляет хранилищем:

    • Дедупликация: Идентичные изображения в одной области данных сохраняются один раз
    • Целостность: Загружаемые файлы проверяются на целостность данных
    • Эффективность: Клоны используют уже сохраненные изображения повторно вместо их копирования, при этом они по-прежнему учитываются в квоте хранилища целевого рабочего пространства
    • Regional: Данные остаются в выбранном тобой регионе (US, EU или AP)
  • Да. Перетащи файлы в галерею датасета или нажми значок загрузки в шапке страницы, что напрямую откроет встроенный диалог выбора файлов твоего браузера. Новая статистика рассчитывается автоматически после завершения обработки.

  • Используй функцию массового перемещения в сплит:

    1. Выбери изображения в режиме таблицы
    2. Нажми правую кнопку мыши и выбери Move to split
    3. Выбери целевой сплит (Train, Validation или Test)
  • Ultralytics Platform поддерживает разметку YOLO, COCO JSON, Ultralytics NDJSON и загрузку сырых изображений. Разметка Pascal VOC XML обнаруживается, но не импортируется:

    Один файл .txt на каждое изображение с нормализованными координатами (диапазон 0-1):

    ЗадачаФорматПример
    Обнаружениеclass cx cy w h0 0.5 0.5 0.2 0.3
    Сегментацияclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Позаclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    КлассификацияСтруктура каталоговtrain/cats/, train/dogs/

    Флаги видимости поз: 0=не размечено, 1=размечено, но перекрыто, 2=размечено и видно.

  • Да. Каждое изображение хранит разметку для всех 6 типов задач разметки (detect, segment, semantic, classify, pose, OBB) вместе. Ты можешь переключить активный тип задачи датасета в любой момент без потери существующей разметки. В редакторе и при экспорте и обучении отображается только разметка, соответствующая активному типу задачи; разметка для других задач сохраняется и появляется снова, когда ты переключаешься обратно.

  • Да:

    ЛимитЗначение
    Классов на датасет25,000
    Аннотаций на изображение10,000
    Координат на аннотацию10,000
    Имя датасета100 символов
    Описание датасета1 000 символов
    Пользовательские метаданные500 000 сериализованных символов
    Ключ метаданных верхнего уровня128 символов
  • Датасеты, считывающие данные из облачного хранилища или локальных источников, хранят пиксели вне Platform, поэтому функции, требующие владения копиями бинарных данных изображений на стороне Platform, недоступны:

    ФункцияОблачное подключениеOn Premise
    Умная аннотацияНедоступноНедоступно
    Кластерный анализНедоступноНедоступно
    КлонированиеНедоступноНедоступно
    Снимки версийНедоступноНедоступно
    Экспорт NDJSONДоступноНедоступно

    Просмотр, ручная аннотация, управление классами, выборки (splits), статистика и обучение работают в обычном режиме.

Комментарии