Наборы данных#
Датасеты Ultralytics Platform представляют собой готовое решение для управления обучающими данными. После загрузки платформа автоматически обрабатывает изображения, разметку и статистику.
Датасет готов к обучению, как только завершится обработка и в нем появится хотя бы одно изображение в выборке train, хотя бы одно изображение в выборке val или test, а также хотя бы одно размеченное изображение. Заголовок датасета отображает значок Ready, когда выполнены все три условия, и значок Not Ready в противном случае — нажми на значок, чтобы увидеть, какое именно условие не выполнено.
Загрузить датасет#
Ultralytics Platform принимает данные в различных форматах для обеспечения гибкости работы.
Если у тебя уже есть датасеты в Roboflow, используй Integrations для их импорта напрямую — ручной экспорт или повторная загрузка не требуются. Данные из Google Cloud Storage, Amazon S3 или Azure Blob Storage можно использовать напрямую с помощью параметра Cloud storage. Корпоративные воркспейсы могут использовать On Premise для индексации локальных данных и обучения на них без отправки пикселей на Platform.
Поддерживаемые форматы#
| Формат | Расширения | Примечания | Макс. размер |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Самые популярные, рекомендуемые | 50 MB |
| PNG | .png | Поддерживает прозрачность | 50 MB |
| WebP | .webp | Современный формат, хорошая степень сжатия | 50 MB |
| BMP | .bmp | Без сжатия | 50 MB |
| TIFF | .tiff, .tif | Высокое качество | 50 MB |
| HEIC | .heic | Фото с iPhone | 50 MB |
| AVIF | .avif | Формат нового поколения | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Raw (необработанные) с камер | 50 MB |
| MPO | .mpo | Multi-picture object (объект с несколькими изображениями) | 50 MB |
Поддержка видеокодеков#
Само по себе расширение файла не гарантирует успех: видео все равно может не пройти обработку, если его кодек не удается декодировать.
Видео H.264 в контейнере MP4 имеет наибольшую поддержку декодеров и является самым надежным выбором. Если видео не обрабатывается, перекодируй его с помощью FFmpeg:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4Подготовка датасета#
Платформа поддерживает Ultralytics YOLO, COCO, датасеты глубины, Ultralytics NDJSON и сырые (неразмеченные) загрузки:
Используй стандартную структуру каталогов YOLO с файлом data.yaml:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlYAML-файл определяет конфигурацию твоего датасета:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogRaw: Загрузка неразмеченных изображений (без меток). Полезно, когда ты планируешь размечать данные прямо на платформе с помощью редактора разметки.
Ты также можешь загружать изображения без явных папок с разделением. Платформа учитывает активную целевую выборку при загрузке. Если целевая выборка не задана и после загрузки val остается пустым — или содержит менее двух парных карт для глубины — датасеты (за исключением классификации) автоматически перемещают изображения обучения в val, чтобы датасет был сразу готов к обучению. Датасеты классификации пропускаются, так как они используют разделение на основе каталогов. Ты всегда можешь переназначить изображения позже с помощью массового перемещения в выборку или перераспределения выборок.
Формат определяется автоматически: датасеты с файлом data.yaml, содержащим ключи names, train или val, обрабатываются как YOLO. Датасеты с файлами JSON в формате COCO (содержащие массивы images, annotations и categories) обрабатываются как COCO. Экспорты .ndjson импортируются как Ultralytics NDJSON. Датасеты, содержащие только изображения и не имеющие аннотаций, обрабатываются как raw.
Если архив содержит несколько YAML-файлов, Platform отдает предпочтение стандартным именам (data.yaml, data.yml, dataset.yaml, dataset.yml), находящимся ближе всего к корню архива. Оставляй один файл YAML с понятным именем на один архив во избежание путаницы.
Файлы разметки в формате Pascal VOC XML обнаруживаются, но их аннотации не импортируются — изображения загружаются без разметки. Platform предупреждает тебя до начала загрузки («Обнаружена разметка Pascal VOC»). Сначала конвертируй VOC XML в формат YOLO или COCO; см. инструменты конвертации форматов.
Если разметка ссылается на ID классов, но имена классов не указаны, Platform генерирует общие имена-заглушки (class0, class1, …), которые ты сможешь переименовать позже на вкладке «Классы».
Подробности о форматах для конкретных задач см. в разделах поддерживаемые задачи и Обзор датасетов.
Процесс загрузки#
Чтобы создать датасет:
- Перейди в
Annotateна боковой панели - Нажми
New Dataset - Выбери вкладку источника данных (см. Источники данных ниже)
- Укажи имя (URL-слаг создается автоматически, его можно изменить), а также добавь описание по желанию
- Выбери тип задачи (см. поддерживаемые задачи), лицензию (опционально, см. доступные лицензии) и видимость (публичный или приватный)
- Нажми
Create & Uploadдля локальных файлов,Create & Importдля URL или подключенного источника либоCreate Dataset, чтобы начать с пустого датасета
Чтобы добавить файлы в существующий датасет, открой его страницу и либо перетащи файлы в галерею, либо нажми значок загрузки в шапке страницы. Значок загрузки открывает нативный выбор файлов твоего браузера напрямую, так как задача датасета уже определена.
Источники данных#
Диалоговое окно New Dataset предлагает четыре источника:
| Источник | Описание |
|---|---|
| Загрузка | Перетащи файлы или найди их через проводник — изображения, видео, архивы или NDJSON |
| URL | Вставь прямую ссылку на файл .zip, .tar, .tar.gz, .tgz или .ndjson; Platform скачает и обработает его на стороне сервера |
| Облако | Используй данные на месте из Google Cloud Storage, Amazon S3 или Azure Blob Storage (для тарифов Pro и Enterprise) |
| Локально | Индексируй данные и обучайся на них, не покидая собственную инфраструктуру, с помощью рабочих узлов On Premise (для тарифа Enterprise) |
Импорт по URL ограничен как лимитом твоего тарифного плана на одну загрузку (10 ГБ для Free / 20 ГБ для Pro / 50 ГБ для Enterprise), так и оставшейся квотой хранилища (выбирается меньшее из значений). Ссылка должна быть общедоступной по протоколу HTTP или HTTPS и заканчиваться поддерживаемым расширением.
До начала загрузки#
Platform проверяет файлы в браузере перед началом любой загрузки, поэтому распространенные проблемы выявляются сразу, а не после долгой передачи данных. Архивы проверяются на повреждения, отсутствие файлов, защиту паролем и синтаксические ошибки YAML, а слишком большие файлы выводятся списком по именам.
После этого могут появиться два диалоговых окна:
Когда архив содержит имена классов, а в твоем датасете уже есть классы, диалоговое окно Map imported classes выводит по одной строке для каждого нового класса. Для каждого из них выбери существующий класс для объединения, создай новый класс или пропусти его. Точные совпадения имен выбираются автоматически, а пропущенные классы и их разметка не импортируются.
После загрузки платформа автоматически обрабатывает твои данные:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Валидация: Проверка формата и размера
- Нормализация: крупные изображения масштабируются (максимум 4096 пикселей, минимальная сторона 28 пикселей), оттенки серого преобразуются в RGB, прозрачность сводится на белом фоне, а также применяется EXIF-ориентация
- Миниатюры: Создаются превью в формате WebP размером 256px
- Разбор разметки: извлекаются данные разметки YOLO, COCO и NDJSON
- Статистика: Вычисляются распределения классов и размеры изображений
Оригиналы в форматах AVIF и WebP сохраняются байт-в-байт, если не требуется изменение размера или цвета. Все остальное перекодируется: источники WebP остаются в формате WebP, а все остальные форматы (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) преобразуются в JPEG с качеством 92. Исходное имя файла и расширение сохраняются в качестве метаданных.

Валидация перед загрузкой
Ты можешь проверить свой датасет локально перед загрузкой:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")Изображения должны быть не менее 28px по своей короткой стороне. Изображения меньшего размера отклоняются при обработке. Изображения, превышающие 4096px по своей длинной стороне, автоматически масштабируются с сохранением соотношения сторон.
Обзор изображений#
Просматривай изображения своего датасета в различных макетах.
Открой панель Clustering на панели инструментов галереи, чтобы изучить свой датасет в виде интерактивной двумерной диаграммы рассеяния.
| Вид | Описание |
|---|---|
| Сетка | Сетка миниатюр с наложенной разметкой (по умолчанию) |
| Compact | Уменьшенные миниатюры для быстрого просмотра |
| Table | Список с миниатюрой, именем файла, размерами, размером в байтах, выборкой, классами и количеством меток |

Сортировка и фильтрация#
Изображения можно сортировать и фильтровать для эффективного просмотра:
Каждая опция переключается между по возрастанию (↑) и по убыванию (↓):
| Сортировать | Описание |
|---|---|
| Дата создания ↑/↓ | Порядок загрузки (по умолчанию ↓) |
| Имя ↑/↓ | Имя файла по алфавиту |
| Высота ↑/↓ | Высота изображения в пикселях |
| Ширина ↑/↓ | Ширина изображения в пикселях |
| Размер ↑/↓ | Размер файла на диске |
| Аннотации ↑/↓ | Количество аннотаций на изображение |
Для датасетов с количеством изображений более 100 000 сортировка по имени, ширине, высоте и размеру скрывается для поддержания быстродействия галереи. Сортировка по дате создания и количеству разметки остается доступной.
Используй фильтр Annotations, установленный в значение Unannotated, чтобы быстро находить изображения, которые еще нуждаются в разметке. Это особенно полезно для больших датасетов, когда нужно отслеживать прогресс разметки.
Строка поиска располагается справа на панели инструментов галереи и фильтрует все режимы отображения — в виде сетки, компактный и в виде таблицы. Она сопоставляется с именем файла изображения (расширение файла необязательно), а также с пользовательскими ключами метаданных, скалярными значениями и элементами массивов, поэтому изображение с именем img_0042, содержащее {"ship_type": "yacht"}, находится поиском по запросу img_0042 или yacht.
Значения, вложенные во внутренние объекты, не сопоставляются. Вставка 24-значного ID изображения позволяет напрямую найти именно это изображение, минуя текстовый поиск.
Полноэкранный просмотрщик#
Нажми на любое изображение, чтобы открыть полноэкранный просмотрщик с помощью:
- Навигация: клавиши со стрелками или миниатюры для просмотра
- Информация об изображении: просмотр сгенерированных Platform свойств, пользовательских метаданных и встроенных метаданных файла, таких как EXIF
- Пользовательские метаданные: Владельцы и редакторы могут добавлять или заменять JSON-объект, включая вложенные значения размером до 500 000 сериализованных символов и ключи верхнего уровня длиной до 128 символов
- Аннотации: переключение видимости слоя аннотаций
- Распределение классов: количество разметок по классам с цветовыми индикаторами
- Annotate: Когда у тебя есть права на редактирование, элементы управления разметкой активируются сразу после открытия средства просмотра на полный экран на десктопе
- Загрузка: скачивание исходного файла изображения
- Удаление: удаление изображения из набора данных
- Масштабирование:
Cmd/Ctrl+Scroll,Cmd/Ctrl++илиCmd/Ctrl+=для приближения иCmd/Ctrl+-для отдаления - Сброс вида:
Cmd/Ctrl + 0или кнопка сброса, чтобы подогнать изображение под размер окна просмотра - Панорамирование: удерживай
Spaceи перетаскивай мышью для перемещения холста при масштабировании - Пиксельный вид: включение пиксельного рендеринга для детального изучения
- Шторка глубины: на датасетах глубины перетаскиваемый разделитель стирает границы между RGB-изображением и его цветной картой глубины

Фильтр по сплиту#
Фильтрация изображений по их сплиту в наборе данных:
| Split | Цель |
|---|---|
| Обучение | Используется для обучения модели |
| Val | Используется для валидации во время обучения |
| Test | Используется для финальной оценки |
Кластеризация#
Панель Clustering проецирует твой датасет на интерактивную двумерную диаграмму рассеяния, где визуально похожие изображения располагаются близко друг к другу. Используй её для выявления кластеров, поиска дубликатов и выбросов, а также для проверки распределения сплитов и классов по твоим данным — не покидая галерею. Открой её с помощью значка графика рассеяния на панели инструментов галереи на любой странице датасета.

Запуск анализа#
Запуск анализа:
- Открой набор данных и нажми на значок диаграммы рассеяния на панели инструментов галереи
- Нажми
Analyze Dataset - Дождись завершения работы индикатора выполнения — результаты появятся на той же панели
Анализ выполняется в фоновом режиме в два этапа (Computing embeddings и Clustering) и может занять несколько минут в зависимости от размера твоего датасета. Ты можешь закрыть панель или покинуть страницу и вернуться позже.
Для анализа датасет должен содержать не менее 20 и не более 200 000 изображений без ошибок. Подключенные датасеты, размещенные в облачном или локальном (On Premise) хранилище, пока не поддерживаются.
Визуализация#
После завершения анализа на панели отображается двумерная диаграмма рассеяния всех проанализированных изображений с легендой и счетчиком точек. Фильтры галереи (выборка, класс, размеченные/неразмеченные) затемняют точки вне фильтра, чтобы ты мог сосредоточиться на нужной подгруппе — счетчик при этом показывает visible / total points.

Раскраска по#
Измени способ раскраски точек данных с помощью выпадающего списка Color by на панели инструментов. Переключай режимы отображения в любой момент — график мгновенно меняет цвета, позволяя увидеть, как сплиты, классы или свойства изображений распределены по твоим кластерам:
| Опция | Затенение |
|---|---|
| Splits | Train / Val / Test |
| Classes | Первый класс аннотации на каждом изображении |
| Width | Ширина изображения |
| Height | Высота изображения |
| Size | Размер файла |
| Аннотации | Количество аннотаций на изображение |

Выделение лассо#
Нарисуй произвольную область выделения вокруг региона, чтобы подсветить точки на графике. Галерея отфильтрует подходящие изображения, и ты сможешь просмотреть их, переразметить, переместить или удалить, используя привычные операции с изображениями.
Чип над графиком показывает количество выбранных точек — нажми ×, чтобы сбросить лассо и вернуться к просмотру всей галереи.
Инструмент выделения лассо охватывает не более 1000 изображений. Если твой выбор превышает это число, Platform показывает выборку из 1000 элементов и предлагает выделить область поменьше.
Панорамирование и масштабирование#
Управляй большими диаграммами рассеяния с помощью мыши и клавиатуры либо кнопками масштабирования в левом нижнем углу графика:
| Ввод | Действие |
|---|---|
| Scroll (колесико мыши) | Панорамирование диаграммы в 2D |
| Cmd/Ctrl+Scroll | Приближение или отдаление относительно курсора |
| Удерживание Space | Переключение в режим перетаскивания (панорамирования) |
| Кнопка сброса | Вернуться к полному масштабу графика |
Повторный анализ#
Если твой датасет изменился после анализа (поступили новые изображения или количество проанализированных элементов больше не совпадает с датасетом), в верхней части панели для владельцев и редакторов появляется кнопка Re-analyze.
Нажми Re-analyze, чтобы пересчитать векторные представления (эмбеддинги) и 2D-проекцию с нуля.
Вкладки набора данных#
Каждая страница набора данных может отображать до шести вкладок в зависимости от состояния набора данных и твоих прав доступа:
Вкладка Images#
Вид по умолчанию, показывающий галерею изображений с наложенными аннотациями. Поддерживаются режимы сетки, компактный и табличный. Перетаскивай файлы сюда, чтобы добавить больше изображений.
Вкладка Classes#
Эта вкладка появляется, когда в датасете есть изображения, а для его задачи заданы классы.
Управляй классами аннотаций для своего набора данных:
- Гистограмма классов: столбчатая диаграмма, показывающая количество разметок по классам, отсортированная по частоте, с переключателем линейной/логарифмической шкалы
- Таблица классов: таблица с возможностью сортировки и поиска, содержащая индекс, имя, количество разметок и количество изображений
- Редактирование названий классов: нажми на любое название класса, чтобы изменить его прямо в таблице.
- Редактирование цветов классов: нажми на образец цвета, чтобы изменить цвет класса.
- Добавление нового класса: используй поле ввода в нижней части, чтобы добавить классы.
- Объединить классы: выбери две или более строки и нажми
Merge into one - Удалить классы: выбери одну или более строк и нажми
Delete

Если в твоем датасете наблюдается дисбаланс классов (например, 10 000 аннотаций класса "person" и всего 50 класса "bicycle"), используй переключатель Log Scale на гистограмме классов, чтобы четко визуализировать все классы.
Объединение классов#
Объединение консолидирует дублирующиеся или пересекающиеся метки — например, сводит car, automobile и vehicle в один класс:
- Выбери два или более классов с помощью флажков в строках
- Нажми
Merge into oneв заголовке таблицы или кликни правой кнопкой мыши по выделению - Выбери, в какой из выбранных классов (целевой) будут объединены остальные
- Подтверди действие
Каждая разметка, принадлежащая исходным классам, переназначается целевому классу, а исходные классы удаляются. Никакие аннотации не удаляются, поэтому общее количество разметок в датасете остается неизменным.
Удаление классов#
- Выбери один или более классов с помощью флажков в строках
- Нажми
Deleteв заголовке таблицы или кликни правой кнопкой мыши по выделению - Подтверди действие
Удаление класса приводит к удалению самого класса и всей его разметки. Для датасетов классификации метки удаляются, но изображения остаются, становясь неразмеченными.
ID классов привязаны к их позициям. Объединение или удаление класса сдвигает вниз все индексы последующих классов, чтобы заполнить образовавшийся пробел, поэтому экспорты и файлы разметки, созданные до этого изменения, перестанут соответствовать новым индексам. Создай версию предварительно, если тебе нужна старая нумерация.
Количество классов вычисляется не более чем по 100 000 изображениям. На больших датасетах над гистограммой отображается примечание «На основе подмножества этого датасета размером 100 000 изображений».
Вкладка «Графики»#
Эта вкладка появляется, когда в наборе данных есть изображения.
Автоматическая статистика, рассчитанная для твоего набора данных:
Графики отображаются в указанном порядке, и каждый из них скрывается, если в датасете нет соответствующих данных: датасет с исходными изображениями не показывает графики разметки, а Points per Instance появляется только для данных сегментации и поз:
| График | Описание |
|---|---|
| Распределение по выборкам | Кольцевая диаграмма количества изображений и процентов размеченных данных для выборок train/val/test. |
| Популярные классы | Кольцевая диаграмма 10 наиболее частых классов разметки, остальные объединены в категорию «Прочие» |
| Размеры изображений | Гистограмма распределения ширины и высоты изображений (наложенные друг на друга) со средним значением. |
| Размер файлов изображений | Гистограмма распределения размеров файлов изображений. |
| Размеры изображений 2D | 2D-теплокарта ширины и высоты с направляющими линиями соотношения сторон. |
| Расположение аннотаций | 2D-теплокарта центральных позиций ограничивающих прямоугольников (bbox). |
| Форматы изображений | Распределение исходных форматов изображений (JPG, PNG и т.д.). |
| Размеры ограничивающих прямоугольников | Гистограмма ширины и высоты ограничивающих прямоугольников (наложенные друг на друга). |
| Объектов на изображение | Гистограмма количества аннотаций на одно изображение. |
| Точек на экземпляр | Количество вершин полигона или ключевых точек на одну аннотацию (сегментация/поза). |

Platform кэширует вычисленную статистику и сбрасывает кэш при изменении изображений, разметки, классов или выборок. На датасетах размером более 100 000 изображений графики вычисляются по подмножеству из 100 000 изображений, о чем сообщается над сеткой.
Нажми кнопку развертывания на любой теплокарте, чтобы просмотреть ее в полноэкранном режиме. Это обеспечивает более крупный и детализированный вид — полезно для понимания пространственных закономерностей в больших наборах данных.
Вкладка «Модели»#
Просматривай все модели, обученные на этом наборе данных, в таблице с возможностью поиска:
| Столбец | Описание |
|---|---|
| Имя | Название модели со ссылкой |
| Проект | Родительский проект с иконкой |
| Версия | Неизменяемая версия датасета, используемая для обучения, если таковая имеется |
| Статус | Бейдж статуса обучения |
| Задача | Тип задачи YOLO |
| Эпохи | Лучшая эпоха / общее количество эпох |
| mAP50-95 | Средняя точность (Mean average precision) |
| mAP50 | mAP при IoU 0.50 |
| Создано | Дата создания |

Вкладка «Ошибки»#
Эта вкладка появляется только в том случае, если один или несколько файлов не прошли обработку.
Изображения, которые не прошли обработку, перечислены здесь с:
- Баннер ошибки: общее количество изображений с ошибками и рекомендации
- Таблица ошибок: имя файла, понятное описание ошибки, советы по исправлению и миниатюра для предпросмотра
- Распространенные ошибки включают поврежденные файлы, неподдерживаемые форматы, слишком маленькие изображения (минимум 28px) и неподдерживаемые цветовые режимы

Распространенные ошибки обработки
| Ошибка | Причина | Исправление |
|---|---|---|
| Невозможно прочитать файл изображения | Поврежденный или неподдерживаемый формат | Экспортируй повторно из графического редактора |
| Неполный или поврежденный файл | Файл был усечен во время передачи | Скачай исходный файл повторно |
| Неподдерживаемый формат изображения | Формат, который Platform не может декодировать | Конвертируй в JPG, PNG или WebP |
| Ошибка прав доступа к файлу | Файл заблокирован или защищен от чтения | Разблокируй файл и повтори загрузку |
| Изображение слишком маленькое | Минимальный размер стороны меньше 28px | Используй исходные изображения более высокого разрешения |
| Неподдерживаемый цветовой режим | Цветовой режим CMYK или индексированные цвета | Конвертируй в режим RGB |
Вкладка «Версии»#
Создавай неизменяемые NDJSON-снимки твоего набора данных для воспроизводимого обучения. Каждая версия фиксирует количество изображений, количество классов, количество аннотаций и размер файла на момент создания.
| Столбец | Описание |
|---|---|
| Версия | Номер версии (v1, v2, ...) |
| Описание | Описание, предоставленное пользователем (редактируемое) |
| Изображения | Количество изображений на момент создания снимка |
| Классы | Количество классов на момент создания снимка |
| Аннотации | Количество аннотаций на момент создания снимка |
| Размер | Размер файла экспорта NDJSON |
| Создано | Время создания версии |
| Действия | Скачать или восстановить |
Чтобы создать версию:
- Открой вкладку Версии
- При необходимости введи описание (например, «Добавлено 500 изображений для обучения» или «Исправлены ошибки в разметке классов»)
- Нажми Создать версию
- Новая версия появится в таблице
Каждая версия нумеруется последовательно (v1, v2, v3...) и является неизменяемой — версии нельзя редактировать или удалять, можно лишь менять их описание. Используй действия в строке, чтобы скачать или восстановить любую версию в любой момент.
Восстановление заменяет текущие изображения, выборки, классы и разметку датасета выбранным снимком и не может быть отменено, если предварительно не сохранить текущее состояние как другую версию. Во время восстановления датасет блокируется со статусом processing. При восстановлении ничего не загружается заново, поэтому этот процесс обычно проходит быстро даже на больших датасетах.
Включи опцию Save Dataset Version в диалоговом окне облачного обучения, чтобы связать модель с точной версией датасета, использованной для обучения. Platform повторно использует подходящую версию, если содержимое датасета не изменилось, и создает новую версию только тогда, когда оно изменилось.
Создание и восстановление версий доступны после того, как датасет достигнет статуса ready. Версии недоступны для подключенных облачных датасетов или датасетов On Premise.
Создавай версию до и после внесения значительных изменений в свой набор данных — добавления изображений, исправления аннотаций или перебалансировки выборок. Это позволит тебе сравнивать производительность моделей для разных состояний набора данных.
Указываемый размер — это размер экспортного файла NDJSON, который содержит URL изображений и разметку, а не сами изображения. Сами данные изображений хранятся отдельно и доступны по подписанным URL. Файл снимка все равно учитывается в квоте хранилища твоего рабочего пространства, поэтому создание версии завершится ошибкой, если у тебя не осталось свободного места.
Экспортировать набор данных#
Экспортируй набор данных для использования в автономном режиме с помощью загрузки NDJSON из заголовка набора данных или вкладки «Версии».
Для экспорта:
- Нажми кнопку Download (иконка загрузки) в заголовке набора данных
- Скачивай текущий снимок NDJSON напрямую
- Используй вкладку Versions, если тебе нужен неизменяемый пронумерованный снимок, который можно скачать повторно позже
Формат NDJSON хранит один объект JSON на каждую строку. Первая строка содержит метаданные датасета, за ней следует по одной строке на каждое изображение:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}Необязательный объект metadata на уровне изображения сохраняется при импорте NDJSON-файла в Platform. Ты можешь просмотреть или отредактировать его на полноэкранной информационной панели изображения. Для программной загрузки архивов API добавления данных датасета принимает эквивалентную карту путей imageMetadata.
Датасеты поз также содержат поле kpt_shape в строке заголовка датасета, которое вычисляется из разметки, если оно еще не задано.
Экспорт глубин объявляет "task": "depth" и "depth_scale": 1000 в строке датасета. Каждая строка изображения включает depth.url для парного простого 16-битного PNG. Ultralytics загружает URL-адреса изображений и глубин одновременно и записывает обучающий файл YAML с тем же масштабом, поэтому файл NDJSON можно напрямую передать в model.train(data=...).
URL изображений в экспортированном файле NDJSON подписаны и действительны в течение 7 дней. Platform повторно использует кэшированный экспорт на срок до 6 дней, если датасет не изменился, поэтому свежая загрузка всегда имеет как минимум один день срока действия. Если тебе нужны новые URL раньше, измени датасет или создай новую версию.
Экспорт недоступен для датасетов On Premise, байты изображений которых никогда не попадают в Platform.
Полную спецификацию см. в документации по формату Ultralytics NDJSON.
Операции с изображениями#
Быстрые действия#
Нажми правой кнопкой мыши на любое изображение в режиме Grid или Compact, чтобы получить доступ к быстрым действиям:
| Действие | Описание |
|---|---|
| Move to Split (Переместить в выборку) | Переназначь изображение в выборку Train, Val или Test |
| Скачивание | Скачай исходный файл изображения |
| Delete (Удалить) | Удали изображение из набора данных |

Контекстное меню изображения работает с одним изображением. Для массовых операций с несколькими изображениями используй представление Table с выбором через флажки.
Массовое перемещение в выборку#
Переназначь выбранные изображения в другую выборку внутри того же набора данных:
- Переключись в режим Table
- Выбери изображения с помощью флажков
- Нажми правой кнопкой мыши, чтобы открыть контекстное меню
- Выбери
Move to split> Train, Validation или Test
Ты также можешь перетаскивать изображения на вкладки фильтров выборок в режиме сетки. Если перемещение изображения приведет к конфликту с идентичным изображением, уже находящимся в целевой выборке, Platform спросит, нужно ли пропустить файл, оставить оба или заменить.
Загрузи все изображения в один набор данных, а затем используй массовое перемещение в выборку для распределения подмножеств на обучающую, валидационную и тестовую выборки.
Перераспределение выборок#
Перераспредели все изображения между обучающей, валидационной и тестовой выборками, используя пользовательские коэффициенты:
- Нажми на панель выборки в панели инструментов набора данных, чтобы открыть диалоговое окно Redistribute Splits
- Настрой процентное соотношение выборок, используя любой из методов ниже
- Изучи динамический предварительный просмотр количества изображений, чтобы подтвердить распределение
- Нажми Apply, чтобы случайным образом переназначить все изображения в соответствии с твоими процентами
Диалоговое окно предоставляет три способа установки целевых пропорций сплитов:
| Метод | Описание |
|---|---|
| Drag (Перетаскивание) | Перетаскивай маркеры между цветными сегментами для визуальной настройки границ выборки |
| Type (Ввод) | Отредактируй процентное значение для любой выборки (остальные две автоматически пересчитаются пропорционально) |
| Auto (Авто) | Один клик для мгновенной установки соотношения 80/20 для обучающей/валидационной выборок при значении 0% для тестовой |
Динамический предварительный просмотр точно показывает, сколько изображений попадет в каждую выборку, прежде чем ты применишь изменения.
Нажми кнопку Auto, чтобы мгновенно установить рекомендуемое соотношение 80/20 для обучающей/валидационной выборок. Это наиболее распространенное соотношение для обучения.
Массовое удаление#
Удали несколько изображений за раз:
- Выбери изображения в режиме таблицы
- Нажми правой кнопкой мыши и выбери
Delete, либо нажмиCmd/Ctrl+Delete - Подтверди удаление
URI набора данных#
Ссылайся на датасеты Platform, используя формат URI ul:// (см. раздел Использование датасетов платформы):
ul://username/datasets/dataset-slugТы также можешь напрямую вставить веб-URL датасета или модели (например, https://platform.ultralytics.com/username/datasets/dataset-slug); он автоматически преобразуется в URI ul://. Передача списка датасетов выполняет дообучение одной базовой модели на каждом из них последовательно, например model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Используй этот URI для обучения моделей из любого места:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100URI ul:// работает из любой среды:
- Локальная машина: обучай на своем оборудовании, данные скачиваются автоматически
- Google Colab: получай доступ к своим наборам данных Platform в ноутбуках
- Удаленные серверы: обучай на облачных виртуальных машинах с полным доступом к набору данных
Доступные лицензии#
Platform поддерживает следующие лицензии для наборов данных:
| Лицензия | Тип |
|---|---|
| Нет | Лицензия не выбрана |
| CC0-1.0 | Общественное достояние |
| PDM-1.0 | Общественное достояние |
| CC-BY-2.5 | Разрешительная |
| CC-BY-4.0 | Разрешительная |
| CC-BY-NC-2.0 | Некоммерческая |
| CC-BY-SA-4.0 | Копилефт |
| CC-BY-NC-4.0 | Некоммерческая |
| CC-BY-NC-SA-3.0 | Копилефт |
| CC-BY-NC-SA-4.0 | Копилефт |
| CC-BY-ND-4.0 | Без производных работ |
| CC-BY-NC-ND-4.0 | Некоммерческая |
| Apache-2.0 | Разрешительная |
| MIT | Разрешительная |
| AGPL-3.0 | Копилефт |
| GPL-3.0 | Копилефт |
| Только для исследований | Ограниченная |
| Другое | Пользовательская |
При клонировании датасета с лицензией copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0) клон наследует эту лицензию, а селектор лицензий блокируется.
Настройки видимости#
Контролируй, кто может видеть твой набор данных:
| Настройка | Описание |
|---|---|
| Private (Частный) | Доступ есть у тебя и участников рабочего пространства с соответствующими разрешениями |
| Public (Публичный) | Просмотр доступен всем, в том числе со страницы Explore |
Видимость устанавливается при создании датасета в диалоговом окне New Dataset с помощью переключателя. Публичные датасеты видны на странице Explore.
Редактирование набора данных#
Метаданные набора данных редактируются непосредственно на странице набора данных — диалоговое окно не требуется:
- Имя: Нажми на имя датасета, чтобы отредактировать его. Изменения сохраняются автоматически при потере фокуса или нажатии
Enter. Длина имени ограничена 100 символами. - Описание: Нажми на описание (или плейсхолдер "Add a description..."), чтобы отредактировать его. Изменения сохраняются автоматически. Описание ограничено 1 000 символов.
- Task type: Нажми на значок задачи, чтобы выбрать другой тип задачи.
- License: Нажми на селектор лицензии, чтобы изменить лицензию набора данных.
- Иконка: Нажми на иконку датасета, чтобы загрузить собственное изображение, сделать одно из изображений датасета иконкой или выбрать букву и цвет.
Каждое изображение хранит разметку для всех типов задач вместе. Изменение типа задачи датасета определяет, какая разметка отображается в редакторе и включается в экспорт и обучение. Разметка для других типов задач сохраняется в базе данных и появляется снова, когда ты переключаешься обратно. Глубина — это исключение: ее эталонные данные представляют собой парный файл, а не разметку, поэтому датасет может переключаться на глубину или с нее только тогда, когда в нем нет изображений; переимпортируй его вместо этого.
Пользовательские метаданные#
Открой Ещё действия и выбери Информация, чтобы просмотреть два раздела:
- Метаданные Ultralytics: Сведения о Platform только для чтения, такие как ID датасета, владелец, задача, количество изображений и аннотаций, регион хранения и временные метки
- Пользовательские метаданные: Твой собственный JSON-объект для отслеживания происхождения, условий съёмки, ID клиентов, управления или других контекстных данных
Наблюдатели рабочей области могут просматривать метаданные, в то время как участники с правом редактирования могут заменять объект пользовательских метаданных. Сериализованный объект метаданных ограничен 500 000 символов, а каждый ключ верхнего уровня ограничен 128 символами. Сохрани пустой объект ({}), чтобы очистить пользовательские метаданные.
Клонирование набора данных#
При просмотре публичного датасета, владельцем которого ты не являешься, нажми Clone Dataset, чтобы открыть диалоговое окно клонирования. Проверь целевой воркспейсе, название, видимость и лицензию, а затем подтверди клонирование. Копия включает все изображения, аннотации и определения классов. Публичные исходные датасеты по умолчанию остаются публичными в воркспейсах, где видимость по умолчанию — публичная; клоны в корпоративных воркспейсах по умолчанию приватные. Если оригинальный датасет имеет лицензию copyleft, клон наследует её, и выбор лицензии будет заблокирован.
Целевой ярлык (slug) автоматически переименовывается, если он уже занят, а для клонирования требуется достаточно свободного дискового пространства под копию.
Датасеты, использующие облачное хранилище или локальные источники, не могут быть клонированы, поскольку Platform не хранит их бинарные изображения.
Отметить и поделиться#
- Star: Нажми кнопку со звездочкой, чтобы добавить набор данных в закладки. Количество отметок звездочкой видно всем пользователям.
- Поделиться: Для публичных датасетов нажми кнопку «Поделиться», чтобы скопировать ссылку, получить код для вставки или поделиться в соцсетях.
Удалить набор данных#
Удаление набора данных, который тебе больше не нужен:
- Открой Другие действия (кнопка
…) в заголовке датасета - Выбери Удалить датасет
- Подтверди действие в диалоговом окне: "Это переместит [name] в корзину. Ты сможешь восстановить его в течение 30 дней."
В этом же меню находится пункт Информация, открывающий диалоговое окно метаданных, описанное в разделе Пользовательские метаданные, а также пункт Обновить, который перезагружает датасет с сервера.
Удаленные датасеты перемещаются в корзину (Trash), а не удаляются навсегда. Ты можешь восстановить их в течение 30 дней из раздела Settings > Trash.
Обучение на наборе данных#
Начни обучение прямо из своего набора данных:
- Нажми
New Modelна странице датасета - Выбери проект или создай новый
- Настрой параметры обучения
- Запусти обучение
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffПодробности см. в разделе Облачное обучение.
FAQ#
Твои данные обрабатываются и хранятся в выбранном регионе (US, EU или AP). Изображения:
- Проверяются на формат и размер
- Отклоняются, если минимальный размер менее 28px
- Нормализуются, если размер превышает 4096px (с сохранением соотношения сторон; кодируются для оптимизированного хранения)
- Хранится с дедупликацией, поэтому идентичные изображения сохраняются только один раз
- Миниатюры создаются в формате WebP размером 256px для быстрого просмотра
Ultralytics Platform эффективно управляет хранилищем:
- Дедупликация: Идентичные изображения в одной области данных сохраняются один раз
- Целостность: Загружаемые файлы проверяются на целостность данных
- Эффективность: Клоны используют уже сохраненные изображения повторно вместо их копирования, при этом они по-прежнему учитываются в квоте хранилища целевого рабочего пространства
- Regional: Данные остаются в выбранном тобой регионе (US, EU или AP)
Да. Перетащи файлы в галерею датасета или нажми значок загрузки в шапке страницы, что напрямую откроет встроенный диалог выбора файлов твоего браузера. Новая статистика рассчитывается автоматически после завершения обработки.
Используй функцию массового перемещения в сплит:
- Выбери изображения в режиме таблицы
- Нажми правую кнопку мыши и выбери
Move to split - Выбери целевой сплит (Train, Validation или Test)
Ultralytics Platform поддерживает разметку YOLO, COCO JSON, Ultralytics NDJSON и загрузку сырых изображений. Разметка Pascal VOC XML обнаруживается, но не импортируется:
Один файл
.txtна каждое изображение с нормализованными координатами (диапазон 0-1):Задача Формат Пример Обнаружение class cx cy w h0 0.5 0.5 0.2 0.3Сегментация class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Поза class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9Классификация Структура каталогов train/cats/,train/dogs/Флаги видимости поз: 0=не размечено, 1=размечено, но перекрыто, 2=размечено и видно.
Да. Каждое изображение хранит разметку для всех 6 типов задач разметки (detect, segment, semantic, classify, pose, OBB) вместе. Ты можешь переключить активный тип задачи датасета в любой момент без потери существующей разметки. В редакторе и при экспорте и обучении отображается только разметка, соответствующая активному типу задачи; разметка для других задач сохраняется и появляется снова, когда ты переключаешься обратно.
Да:
Лимит Значение Классов на датасет 25,000 Аннотаций на изображение 10,000 Координат на аннотацию 10,000 Имя датасета 100 символов Описание датасета 1 000 символов Пользовательские метаданные 500 000 сериализованных символов Ключ метаданных верхнего уровня 128 символов Датасеты, считывающие данные из облачного хранилища или локальных источников, хранят пиксели вне Platform, поэтому функции, требующие владения копиями бинарных данных изображений на стороне Platform, недоступны:
Функция Облачное подключение On Premise Умная аннотация Недоступно Недоступно Кластерный анализ Недоступно Недоступно Клонирование Недоступно Недоступно Снимки версий Недоступно Недоступно Экспорт NDJSON Доступно Недоступно Просмотр, ручная аннотация, управление классами, выборки (splits), статистика и обучение работают в обычном режиме.