Датасеты#
Датасеты Ultralytics Platform обеспечивают удобное решение для управления данными для обучения. После загрузки платформа автоматически обрабатывает изображения, метки и статистику.
Датасет готов к обучению после завершения обработки, если в нём есть хотя бы одно изображение в сплите train, хотя бы одно изображение в сплите val или test, а также хотя бы одно размеченное изображение. В заголовке датасета отображается значок Ready, когда выполнены все три условия, и значок Not Ready в противном случае — нажми на значок, чтобы точно узнать, какое условие не выполнено.
Собери изображения с помощью агентов#
Используй агентов, чтобы добавлять изображения в датасет, когда детектирование модели удовлетворяет условию, например уверенности в выбранном диапазоне. Подключи условие к блоку Dataset и выбери целевой набор, который ты можешь редактировать. Изображения поступают без разметки в сплит train; существующие копии пропускаются. Проверь и разметь изображения с помощью существующего редактора разметки.
Загрузка датасета#
Ultralytics Platform поддерживает несколько форматов загрузки для большей гибкости.
Если у тебя уже есть датасеты в Roboflow, используй Integrations, чтобы импортировать их напрямую — ручной экспорт или повторная загрузка не нужны. Данные в Google Cloud Storage, Amazon S3 или Azure Blob Storage можно использовать на месте через облачное хранилище. Рабочие пространства Enterprise могут использовать On Premise, чтобы индексировать данные и обучаться на них локально, не отправляя пиксели в Platform.
Поддерживаемые форматы#
| Формат | Расширения | Примечания | Максимальный размер |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Самый распространённый, рекомендуется | 50 MB |
| PNG | .png | Поддерживает прозрачность | 50 MB |
| WebP | .webp | Современный, хорошее сжатие | 50 MB |
| BMP | .bmp | Без сжатия | 50 MB |
| TIFF | .tiff, .tif | Высокое качество | 50 MB |
| HEIC | .heic | Фотографии с iPhone | 50 MB |
| AVIF | .avif | Формат нового поколения | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Необработанные данные камеры | 50 MB |
| MPO | .mpo | Объект с несколькими изображениями | 50 MB |
Поддержка видеокодеков#
Одного расширения файла недостаточно: видео всё равно может не обработаться, если его кодек нельзя декодировать во время обработки.
Видео H.264 в контейнере MP4 поддерживается большинством декодеров и является самым безопасным выбором. Если видео не обрабатывается, перекодируй его с помощью FFmpeg:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4Подготовка датасета#
Платформа поддерживает Ultralytics YOLO, COCO, семантические PNG-маски, датасеты глубин, Ultralytics NDJSON и загрузку сырых (неразмеченных) данных:
Используй стандартную структуру каталогов YOLO с файлом data.yaml:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlФайл YAML определяет конфигурацию датасета:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogНеобработанные данные: загружай неразмеченные изображения (без меток). Это удобно, если ты планируешь размечать их непосредственно на платформе с помощью редактора аннотаций.
Можно также загружать изображения без явно заданных папок сплитов. Во время загрузки Platform учитывает активную целевую папку сплита. Если целевой сплит не задан и после загрузки val остаётся пустым — или содержит менее двух парных карт глубины — датасеты не для классификации автоматически перемещают изображения для обучения в val, чтобы датасет сразу был готов к обучению. Датасеты для классификации пропускаются, поскольку в них сплиты определяются каталогами. Позже изображения всегда можно переназначить с помощью массового перемещения в сплит или перераспределения по сплитам.
Формат определяется автоматически: датасеты с файлом data.yaml, содержащим ключи names, train или val, считаются датасетами YOLO. Датасеты с файлами JSON COCO, содержащими массивы images, annotations и categories, считаются датасетами COCO. Экспорты .ndjson импортируются как Ultralytics NDJSON. Датасеты, содержащие только изображения без аннотаций, считаются необработанными.
Если архив содержит несколько файлов YAML, Platform отдаёт предпочтение стандартным именам (data.yaml, data.yml, dataset.yaml, dataset.yml), расположенным ближе всего к корню архива. Оставляй в каждом архиве один файл YAML с понятным именем, чтобы избежать неоднозначности.
Файлы меток в формате XML Pascal VOC обнаруживаются, но их аннотации не импортируются — изображения загружаются без разметки. Перед началом загрузки Platform предупреждает тебя ("Обнаружены метки Pascal VOC"). Сначала преобразуй XML VOC в YOLO или COCO; см. инструменты преобразования форматов.
Если метки ссылаются на идентификаторы классов, но имена классов не указаны, Platform создаёт плотные имена-заполнители (class0, class1, …), которые позже можно переименовать на вкладке Classes.
Подробности о форматах для конкретных задач см. в разделах поддерживаемые задачи и Обзор датасетов.
Процесс загрузки#
Чтобы создать датасет:
- Перейди в
Annotateна боковой панели - Нажми
New Dataset - Выбери вкладку источника данных (см. раздел Источники данных ниже)
- Укажи имя — URL-слаг создаётся автоматически, и его можно отредактировать — и при необходимости добавь описание
- Выбери тип задачи (см. поддерживаемые задачи), при необходимости лицензию (см. доступные лицензии) и видимость (публичный или приватный)
- Нажми
Create & Uploadдля локальных файлов,Create & Importдля URL или подключённого источника либоCreate Dataset, чтобы начать с пустого датасета

Чтобы добавить файлы в существующий датасет, открой страницу датасета и перетаси файлы в галерею или нажми значок загрузки в шапке страницы. Значок загрузки открывает нативный выбор файлов твоего браузера напрямую, так как задача датасета уже определена.
Источники данных#
Диалог New Dataset предлагает четыре источника:
| Источник | Описание |
|---|---|
| Загрузка | Перетащи файлы или найди их на компьютере — изображения, видео, архивы или NDJSON |
| URL | Вставь прямую ссылку на файл .zip, .tar, .tar.gz, .tgz или .ndjson; Platform загрузит и обработает его на стороне сервера |
| Cloud | Используй данные на месте из Google Cloud Storage, Amazon S3 или Azure Blob Storage (Pro и Enterprise) |
| On Premise | Индексируй данные и обучайся на них, не покидая собственные машины, с помощью воркеров On Premise (Enterprise) |
Импорт по URL ограничен как лимитом твоего тарифного плана на одну загрузку (10 ГБ Free / 20 ГБ Pro / 50 ГБ Enterprise), так и оставшимся объёмом хранилища — применяется меньшее из этих значений. Ссылка должна быть общедоступной по HTTP или HTTPS и заканчиваться поддерживаемым расширением.
До начала загрузки#
Platform проверяет файлы в браузере до начала загрузки, поэтому распространённые проблемы обнаруживаются сразу, а не после длительной передачи данных. Архивы проверяются на повреждение, пустоту, защиту паролем и ошибки синтаксиса YAML, а слишком большие файлы перечисляются по именам.
Затем могут появиться два диалога:
Если в архиве указаны имена классов, а в датасете уже есть классы, в диалоге Map imported classes отображается по одной строке для каждого входящего класса. Для каждого класса выбери существующий класс, с которым его нужно объединить, создай новый класс или пропусти его. Точные совпадения имён выбираются заранее, а пропущенные классы и их аннотации не импортируются.
После загрузки платформа автоматически обрабатывает твои данные:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Проверка: проверка формата и размера
- Нормализация: большие изображения изменяются (максимум 4096px, минимальный размер — 28px), изображения в градациях серого преобразуются в RGB, прозрачность заменяется белым фоном, применяется ориентация EXIF
- Миниатюры: создаются превью WebP размером 256px
- Разбор разметки: извлекаются метки YOLO, COCO и NDJSON
- Статистика: вычисляются распределения классов и размеры изображений
Исходные изображения AVIF и WebP сохраняются побайтно, если изменение размера или цвета не требуется. Все остальные изображения кодируются заново: исходные изображения WebP остаются в формате WebP, а все остальные форматы (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) преобразуются в JPEG с качеством 92. Исходное имя файла и расширение сохраняются в метаданных.

Проверка перед загрузкой
Ты можешь проверить свой набор данных локально перед загрузкой:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")Короткая сторона изображения должна быть не меньше 28px. Изображения меньшего размера отклоняются во время обработки. Изображения, у которых длинная сторона превышает 4096px, автоматически изменяются с сохранением соотношения сторон.
Просмотр изображений#
Просматривай изображения своего набора данных в нескольких режимах отображения.
Открой панель кластеризации на панели инструментов галереи, чтобы исследовать свой набор данных в виде интерактивной двумерной диаграммы рассеяния.
| Вид | Описание |
|---|---|
| Сетка | Сетка миниатюр с наложенной разметкой (по умолчанию) |
| Компактный | Уменьшенные миниатюры для быстрого просмотра |
| Таблица | Список с миниатюрой, именем файла, размерами, размером, подмножеством, классами и количеством меток |

Сортировка и фильтрация#
Изображения можно сортировать и фильтровать для эффективного просмотра:
Каждый параметр переключается между сортировкой по возрастанию (↑) и убыванию (↓):
| Сортировка | Описание |
|---|---|
| Создано ↑/↓ | Порядок загрузки (по умолчанию ↓) |
| Имя ↑/↓ | Имя файла в алфавитном порядке |
| Высота ↑/↓ | Высота изображения в пикселях |
| Ширина ↑/↓ | Ширина изображения в пикселях |
| Размер ↑/↓ | Размер файла на диске |
| Разметка ↑/↓ | Количество объектов разметки на изображении |
Для наборов данных, содержащих более 100 000 изображений, сортировка по имени, ширине, высоте и размеру скрыта, чтобы галерея оставалась отзывчивой. Сортировка по дате создания и количеству объектов разметки остаётся доступной.
Используй фильтр Annotations, установленный в значение Unannotated, чтобы быстро находить изображения, которым всё ещё нужна разметка. Это особенно полезно для больших наборов данных, где нужно отслеживать прогресс разметки.
Поле поиска находится справа на панели инструментов галереи и фильтрует все режимы отображения — сетку, компактный режим и таблицу. Оно ищет совпадения в имени файла изображения (расширение файла можно не указывать), а также в ключах пользовательских метаданных, скалярных значениях и элементах массивов, поэтому изображение с именем img_0042, содержащее {"ship_type": "yacht"}, находится при поиске по img_0042 или yacht.
Значения, вложенные во вложенные объекты, не учитываются. Вставка 24-символьного ID изображения выполняет поиск именно этого изображения напрямую, минуя текстовый поиск.
Полноэкранный просмотрщик#
Нажми на любое изображение, чтобы открыть полноэкранный просмотрщик со следующими возможностями:
- Навигация: используй клавиши со стрелками или превью миниатюр для просмотра
- Информация об изображении: просматривай свойства, сгенерированные Platform, пользовательские метаданные и встроенные метаданные файла, например EXIF
- Пользовательские метаданные: владельцы и редакторы могут добавлять или заменять объект JSON, включая вложенные значения объёмом до 500 000 сериализованных символов и ключи верхнего уровня длиной до 128 символов
- Разметка: переключай видимость наложенной разметки
- Разбивка по классам: количество меток для каждого класса с цветовыми индикаторами
- Разметить: если у тебя есть доступ на редактирование, элементы управления разметкой становятся активными сразу после открытия полноэкранного просмотрщика на компьютере
- Скачать: скачать исходный файл изображения
- Удалить: удалить изображение из набора данных
- Масштаб: используй
Cmd/Ctrl+Scroll,Cmd/Ctrl++илиCmd/Ctrl+=для увеличения масштаба иCmd/Ctrl+-для уменьшения - Сбросить вид: используй
Cmd/Ctrl + 0или кнопку сброса, чтобы вписать изображение в просмотрщик - Панорамирование: удерживай
Spaceи перетаскивай, чтобы панорамировать холст при увеличенном масштабе - Просмотр пикселей: переключай пиксельный рендеринг для детального изучения
- Шторка глубины: в наборах данных с глубиной перетаскиваемый разделитель переключает отображение между RGB-изображением и его цветной картой глубины

Фильтрация по подмножеству#
Фильтруй изображения по подмножеству набора данных:
| Выборка | Назначение |
|---|---|
| Обучение | Используется для обучения модели |
| Val | Используется для проверки во время обучения |
| Test | Используется для итоговой оценки |
Кластеризация#
Панель Clustering проецирует твой набор данных на интерактивную двумерную диаграмму рассеяния, где визуально похожие изображения располагаются близко друг к другу. Используй её, чтобы находить кластеры, выявлять дубликаты и выбросы, а также изучать распределение подмножеств или классов в данных — не покидая галерею. Открой её с помощью значка диаграммы рассеяния на панели инструментов галереи на странице любого набора данных.

Запуск анализа#
Начни анализ:
- Открой набор данных и нажми на значок диаграммы рассеяния на панели инструментов галереи
- Нажми
Analyze Dataset - Дождись завершения индикатора выполнения — результаты появятся в той же панели
Анализ выполняется в фоновом режиме в два этапа — Computing embeddings и Clustering — и может занять несколько минут в зависимости от размера набора данных. Ты можешь закрыть панель или покинуть страницу и вернуться позже.
Для анализа набор данных должен содержать от 20 до 200 000 изображений без ошибок. Подключённые наборы данных, использующие облачное хранилище или локальное хранилище On Premise, пока не поддерживаются.
Визуализация#
После завершения анализа на панели отображается двумерная диаграмма рассеяния всех проанализированных изображений с легендой и счётчиком точек. Фильтры галереи (подмножество, класс, с разметкой или без разметки) затемняют точки, не соответствующие фильтру, чтобы ты мог сосредоточиться на нужном подмножестве, — после этого счётчик показывает visible / total points.

Цветовая группировка#
Измени способ закрашивания точек данных с помощью списка Color by на панели инструментов. Переключай режимы просмотра в любое время — график мгновенно перекрашивается, чтобы ты мог видеть распределение разбиений, классов или свойств изображений по кластерам:
| Параметр | Закрашивание |
|---|---|
| Разбиения | Train / Val / Test |
| Классы | Первый класс аннотации на каждом изображении |
| Ширина | Ширина изображения |
| Высота | Высота изображения |
| Размер | Размер файла |
| Аннотации | Количество аннотаций на изображение |

Выделение лассо#
Обведи произвольную область, чтобы выделить точки на графике. Галерея отфильтруется и покажет соответствующие изображения, чтобы ты мог просмотреть, переименовать, переместить или удалить их с помощью обычных операций с изображениями.
Над графиком отображается количество выбранных точек — нажми ×, чтобы очистить выделение лассо и вернуться к полной галерее.
Лассо обрабатывает не более 1 000 изображений. Если выделение содержит больше изображений, Platform показывает 1 000 случайно выбранных изображений и предлагает обвести меньшую область.
Панорамирование и масштабирование#
Перемещайся по большим точечным диаграммам с помощью мыши и клавиатуры или используй кнопки масштабирования в левом нижнем углу графика:
| Ввод | Действие |
|---|---|
| Прокрутка | Панорамирование графика в 2D |
| Cmd/Ctrl+Прокрутка | Увеличение или уменьшение масштаба относительно положения курсора |
| Удерживать пробел | Переключение в режим панорамирования перетаскиванием |
| Кнопка сброса | Вернуться к полному охвату графика |
Повторный анализ#
Если после анализа набор данных изменился — например, появились новые изображения или количество проанализированных изображений больше не совпадает с набором данных — в верхней части панели для владельцев и редакторов появляется кнопка Re-analyze.
Нажми Re-analyze, чтобы заново вычислить эмбеддинги и 2D-проекцию.
Поиск похожих изображений#
Те же векторные представления обеспечивают поиск сходства по общедоступным датасетам. В редактируемом датасете щелкни правой кнопкой мыши по изображению в виде Сетка (Grid) или Компактный (Compact) (или по одной выбранной строке в виде Таблица (Table)) и выбери Найти похожие изображения (Find similar images). В диалоговом окне отображается до 24 ближайших общедоступных изображений с указанием их исходного датасета, лицензии и оценки сходства, за исключением изображений, которые твой датасет уже содержит, и копий выбранного изображения в других датасетах. Выбери нужные изображения и нажмите Добавить в датасет (Add to dataset): они добавляются в сплит train в качестве неразмеченных изображений, учитываются в выделенном объеме памяти и готовы к разметке.
Изображение без векторного представления — в датасете, который еще не проанализирован или в который оно было добавлено после последнего анализа — отображает Analyze this dataset in Clustering to find similar images. Диалоговое окно недоступно для подключенных датасетов. Диагностика валидации модели для каждого изображения выполняет аналогичный поиск, начиная с изображений с худшими результатами.
Вкладки набора данных#
На каждой странице набора данных может отображаться до шести вкладок в зависимости от состояния набора данных и твоих разрешений:
Вкладка Images#
Представление по умолчанию с галереей изображений и наложениями аннотаций. Поддерживаются режимы просмотра в виде сетки, компактный и табличный. Перетащи файлы сюда, чтобы добавить изображения.
Вкладка Classes#
Эта вкладка отображается, если в наборе данных есть изображения, а задача содержит классы.
Управляй классами аннотаций своего набора данных:
- Гистограмма классов: Столбчатая диаграмма с количеством аннотаций для каждого класса, отсортированная по частоте, с переключателем линейной/логарифмической шкалы
- Таблица классов: Сортируемая таблица с поиском, содержащая индекс, название, количество аннотаций и количество изображений
- Изменение названий классов: Нажми на название любого класса, чтобы переименовать его прямо в таблице
- Изменение цветов классов: Нажми на образец цвета, чтобы изменить цвет класса
- Добавление нового класса: Используй поле ввода внизу, чтобы добавить классы
- Объединение классов: Выбери две или более строки и нажми
Merge into one - Удаление классов: Выбери одну или несколько строк и нажми
Delete

Если в твоём наборе данных наблюдается дисбаланс классов (например, 10 000 аннотаций «person» и всего 50 аннотаций «bicycle»), используй переключатель Log Scale на гистограмме классов, чтобы наглядно отобразить все классы.
Объединение классов#
Объединение консолидирует дублирующиеся или пересекающиеся метки — например, объединяет car, automobile и vehicle в один класс:
- Выбери два или более класса с помощью флажков в строках
- Нажми
Merge into oneв заголовке таблицы или щёлкни правой кнопкой мыши по выделению - Выбери, какой из выбранных классов будет целевым, в который будут объединены остальные
- Подтверди действие
Каждая аннотация, принадлежащая исходным классам, переназначается целевому классу, а исходные классы удаляются. Аннотации не удаляются, поэтому общее количество аннотаций в наборе данных не изменяется.
Удаление классов#
- Выбери один или несколько классов с помощью флажков в строках
- Нажми
Deleteв заголовке таблицы или щёлкни правой кнопкой мыши по выделению - Подтверди действие
Удаление класса удаляет сам класс и все его аннотации. В наборах данных для классификации метки удаляются, но изображения сохраняются и становятся неаннотированными.
Идентификаторы классов определяются их позицией. При объединении или удалении класса индекс каждого последующего класса уменьшается на единицу, чтобы закрыть пробел, поэтому экспорты и файлы меток, созданные до изменения, больше не соответствуют новым индексам. Сначала создай версию, если тебе нужна прежняя нумерация.
Количество классов вычисляется не более чем для 100 000 изображений. В больших наборах данных над гистограммой отображается примечание: «На основе поднабора этого набора данных, содержащего 100 000 изображений».
Вкладка Charts#
Эта вкладка отображается, если в наборе данных есть изображения.
Автоматически вычисляемая статистика набора данных:
Диаграммы отображаются в этом порядке, а каждая диаграмма пропускается, если для неё нет данных — в наборе данных с исходными изображениями не отображаются диаграммы аннотаций, а Points per Instance появляется только для данных сегментации и поз:
| График | Описание |
|---|---|
| Распределение по разбиениям | Кольцевая диаграмма с количеством изображений в train/val/test и долей размеченных изображений |
| Основные классы | Кольцевая диаграмма 10 наиболее часто встречающихся классов аннотаций, остальные объединены в категорию «Другие» |
| Размеры изображений | Гистограмма распределения ширины и высоты изображений (наложенные распределения) со средним значением |
| Размер файлов изображений | Гистограмма распределения размеров файлов изображений |
| Размеры изображений в 2D | Тепловая карта ширины и высоты в 2D с направляющими линиями соотношения сторон |
| Расположение аннотаций | Тепловая карта центров ограничивающих рамок в 2D |
| Форматы изображений | Распределение форматов исходных изображений (JPG, PNG и т. д.) |
| Размеры ограничивающих рамок | Гистограмма ширины и высоты ограничивающих рамок (наложенные распределения) |
| Объекты на изображение | Гистограмма количества аннотаций на изображение |
| Точек на экземпляр | Количество вершин полигона или ключевых точек для каждой аннотации (сегментация/поза) |

Platform кэширует вычисленную статистику и аннулирует кэш при изменении изображений, аннотаций, классов или разбиений. В наборах данных размером более 100 000 изображений диаграммы вычисляются по поднабору из 100 000 изображений, что отмечается над сеткой.
Нажми кнопку разворачивания на любой тепловой карте, чтобы открыть её в полноэкранном режиме. Это обеспечивает более крупное и подробное представление, полезное для понимания пространственных закономерностей в больших наборах данных.
Вкладка Models#
Просматривай все модели, обученные на этом датасете, в таблице с поиском:
| Столбец | Описание |
|---|---|
| Название | Название модели со ссылкой |
| Проект | Родительский проект со значком |
| Версия | Неизменяемая версия датасета, использованная для обучения, если есть |
| Статус | Бейдж статуса обучения |
| Задача | Тип задачи YOLO |
| Эпохи | Лучшая эпоха / общее число эпох |
| mAP50-95 | Средняя точность |
| mAP50 | mAP при IoU 0.50 |
| Создано | Дата создания |

Вкладка ошибок#
Эта вкладка появляется только при ошибке обработки одного или нескольких файлов.
Здесь перечислены изображения, обработка которых завершилась ошибкой, с указанием:
- Баннер ошибки: общее количество изображений с ошибками и рекомендации
- Таблица ошибок: имя файла, понятное описание ошибки, рекомендации по исправлению и миниатюра для предварительного просмотра
- К распространённым ошибкам относятся повреждённые файлы, неподдерживаемые форматы, слишком маленькие изображения (минимум 28px) и неподдерживаемые цветовые режимы

Распространённые ошибки обработки
| Ошибка | Причина | Исправление |
|---|---|---|
| Не удалось прочитать файл изображения | Повреждённый или неподдерживаемый формат | Повторно экспортируй изображение из редактора |
| Неполный или повреждённый файл | Файл был обрезан во время передачи | Скачай исходный файл заново |
| Неподдерживаемый формат изображения | Формат, который Platform не может декодировать | Преобразуй в JPG, PNG или WebP |
| Ошибка разрешений файла | Файл заблокирован или защищён от чтения | Разблокируй файл и загрузи его повторно |
| Изображение слишком маленькое | Минимальный размер меньше 28px | Используй исходные изображения с более высоким разрешением |
| Неподдерживаемый цветовой режим | Цветовой режим CMYK или индексированный | Преобразуй в режим RGB |
Вкладка версий#
Создавай неизменяемые снимки датасета в формате NDJSON для воспроизводимого обучения. Каждая версия сохраняет количество изображений, классов и аннотаций, а также размер файлов на момент создания.
| Столбец | Описание |
|---|---|
| Версия | Номер версии (v1, v2, ...) |
| Описание | Описание, указанное пользователем (можно изменить) |
| Изображения | Количество изображений на момент создания снимка |
| Классы | Количество классов на момент создания снимка |
| Аннотации | Количество аннотаций на момент создания снимка |
| Размер | Размер экспортируемого файла NDJSON |
| Создано | Дата создания версии |
| Действия | Скачать или восстановить |
Чтобы создать версию:
- Открой вкладку Versions
- При желании введи описание (например, "Добавлено 500 обучающих изображений" или "Исправлены неправильно размеченные классы")
- Нажми New Version
- Новая версия появится в таблице
Каждая версия получает последовательный номер (v1, v2, v3...) и является неизменяемой — версии нельзя редактировать или удалять, можно изменить только их описания. В любое время используй действия в строке, чтобы скачать или восстановить любую версию.
Восстановление заменяет текущие изображения, разбиения, классы и аннотации датасета выбранным снимком. Отменить это действие нельзя, если заранее не сохранить текущее состояние как другую версию. Во время перестроения датасет заблокирован в статусе processing. При восстановлении ничего не загружается повторно, поэтому даже для больших датасетов эта операция обычно выполняется быстро.
Включи Save Dataset Version в диалоговом окне облачного обучения, чтобы связать модель с точной версией датасета, использованной для обучения. Platform повторно использует соответствующую версию, если содержимое датасета не изменилось, и создаёт новую версию только при наличии изменений.
Создание и восстановление версий доступны после того, как датасет получает статус ready. Версии недоступны для подключённых облачных датасетов и датасетов On Premise.
Создавай версию до и после существенных изменений в датасете — добавления изображений, исправления аннотаций или перебалансировки разбиений. Так ты сможешь сравнивать производительность модели на разных состояниях датасета.
Указанный размер — это размер экспортируемого файла NDJSON, содержащего URL изображений и аннотации, а не сами изображения. Фактические данные изображений хранятся отдельно и доступны через подписанные URL. Файл снимка всё равно учитывается в квоте хранилища рабочего пространства, поэтому создание версии завершается ошибкой, если свободного места не осталось.
Экспорт датасета#
Экспортируй датасет для автономного использования, скачав файл NDJSON из заголовка датасета или вкладки версий.
Чтобы экспортировать:
- Нажми кнопку Download (значок скачивания) в заголовке датасета
- Скачай текущий снимок NDJSON напрямую
- Используй вкладку Versions, если нужен неизменяемый снимок с номером, который можно повторно скачать позже

Формат NDJSON хранит один объект JSON на строку. Первая строка содержит метаданные датасета, за которыми следует по одной строке на изображение:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}Необязательный объект уровня изображения metadata сохраняется при импорте файла NDJSON в Platform. Просмотреть или изменить его можно на полноэкранной панели информации об изображении. Для программной загрузки архивов API приёма данных датасета принимает эквивалентную карту путей imageMetadata.
Датасеты для задач позы также содержат поле kpt_shape в строке заголовка датасета, если оно ещё не задано, его значение определяется по аннотациям.
Экспорты глубины содержат "task": "depth" и "depth_scale": 1000 в строке датасета. Каждая строка изображения включает
depth.url для соответствующего обычного PNG uint16. Ultralytics параллельно скачивает URL изображения и карты глубины и записывает
обучающий YAML с тем же масштабом, поэтому файл NDJSON можно напрямую передать в model.train(data=...).
URL изображений в экспортированном NDJSON подписаны и действительны в течение 7 дней. Если датасет не изменился, Platform использует кэшированный экспорт до 6 дней, поэтому после нового скачивания всегда остаётся как минимум день действия URL. Если новые URL нужны раньше, измени датасет или создай новую версию.
Экспорт недоступен для датасетов On Premise, поскольку байты их изображений никогда не поступают в Platform.
Полную спецификацию см. в документации по формату NDJSON Ultralytics.
Операции с изображениями#
Быстрые действия#
Щёлкни правой кнопкой мыши по любому изображению в представлении Grid или Compact, чтобы открыть быстрые действия:
| Действие | Описание |
|---|---|
| Переместить в разбиение | Назначить изображение в разбиение Train, Val или Test |
| Найти похожие изображения | Поиск похожих изображений в общедоступных датасетах и их добавление (см. Найти похожие изображения) |
| Сгенерировать похожие изображения | Создай до 16 созданных искусственным интеллектом вариантов изображения (по умолчанию четыре) и добавь те, которые ты оставляешь, в качестве неразмеченных изображений |
| Скачать | Скачать исходный файл изображения |
| Удалить | Удалить изображение из датасета |

Контекстное меню изображения применяется к одному изображению. Для пакетных операций с несколькими изображениями используй представление Table с выбором с помощью флажков.
Пакетное перемещение в разбиение#
Переназначь выбранные изображения в другой сплит того же датасета:
- Переключись в режим Таблица
- Выбери изображения с помощью флажков
- Щёлкни правой кнопкой мыши, чтобы открыть контекстное меню
- Выбери
Move to split> Обучение, Валидация или Тест
Также можно перетаскивать изображения на вкладки фильтра сплитов в режиме сетки. Если при перемещении изображения возникнет конфликт с идентичным изображением, уже находящимся в целевом сплите, Platform предложит пропустить его, оставить оба или заменить существующее.
Загрузи все изображения в один датасет, а затем используй массовое перемещение в сплит, чтобы распределить подмножества по сплитам обучения, валидации и тестирования.
Перераспределение сплитов#
Распредели все изображения по сплитам обучения, валидации и тестирования с помощью пользовательских соотношений:
- Нажми на панель сплитов на панели инструментов датасета, чтобы открыть диалоговое окно Перераспределение сплитов
- Настрой проценты сплитов любым из способов ниже
- Проверь динамический предварительный просмотр количества изображений, чтобы подтвердить распределение
- Нажми Применить, чтобы случайным образом переназначить все изображения согласно заданным процентам

Диалоговое окно предоставляет три способа настройки целевых коэффициентов разделения:
| Метод | Описание |
|---|---|
| Перетаскивание | Перетаскивай маркеры между цветными сегментами, чтобы визуально настроить границы сплитов |
| Ввод | Измени процентное значение для любого сплита (два других сплита автоматически пропорционально перебалансируются) |
| Автоматически | Одним нажатием мгновенно задай соотношение обучения и валидации 80/20, установив для тестового сплита значение 0% |
Динамический предварительный просмотр показывает точное количество изображений, которое попадёт в каждый сплит, до применения изменений.
Нажми кнопку Автоматически, чтобы мгновенно задать рекомендуемое соотношение обучения и валидации 80/20. Это наиболее распространённое соотношение для обучения.
Массовое удаление#
Удаляй несколько изображений одновременно:
- Выбери изображения в режиме таблицы
- Щёлкни правой кнопкой мыши и выбери
Deleteили нажмиCmd/Ctrl+Delete - Подтверди удаление
URI датасета#
Обращайся к датасетам Platform, используя формат URI ul:// (см. Использование датасетов Platform):
ul://username/datasets/dataset-slugТакже можно напрямую вставить веб-URL датасета или модели (например, https://platform.ultralytics.com/username/datasets/dataset-slug); он автоматически преобразуется в URI ul://. Передача списка датасетов последовательно дообучает одну базовую модель на каждом из них, например model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Используй этот URI для обучения моделей из любой среды:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100URI ul:// работает из любой среды:
- Локальный компьютер: обучай модель на своём оборудовании, данные загружаются автоматически
- Google Colab: получай доступ к своим датасетам Platform в ноутбуках
- Удалённые серверы: обучай модели на облачных виртуальных машинах с полным доступом к датасету
Доступные лицензии#
Platform поддерживает следующие лицензии для датасетов:
| Лицензия | Тип |
|---|---|
| Нет | Лицензия не выбрана |
| CC0-1.0 | Общественное достояние |
| PDM-1.0 | Общественное достояние |
| CC-BY-2.5 | Разрешительная |
| CC-BY-3.0 | Разрешительная |
| CC-BY-4.0 | Разрешительная |
| CC-BY-NC-2.0 | Для некоммерческого использования |
| CC-BY-NC-3.0 | Для некоммерческого использования |
| CC-BY-NC-4.0 | Для некоммерческого использования |
| CC-BY-SA-3.0 | Копилефт |
| CC-BY-SA-4.0 | Копилефт |
| CC-BY-NC-SA-3.0 | Копилефт |
| CC-BY-NC-SA-4.0 | Копилефт |
| CC-BY-ND-4.0 | Без производных произведений |
| CC-BY-NC-ND-2.0 | Для некоммерческого использования |
| CC-BY-NC-ND-4.0 | Для некоммерческого использования |
| Apache-2.0 | Разрешительная |
| MIT | Разрешительная |
| BSD-3-Clause | Разрешительная |
| AGPL-3.0 | Копилефт |
| GPL-2.0 | Копилефт |
| GPL-3.0 | Копилефт |
| LGPL-3.0 | Копилефт |
| ODbL-1.0 | Копилефт |
| DbCL-1.0 | Требуется ODbL |
| Только для исследований | Ограниченная |
| Другая | Пользовательская |
При клонировании набора данных с лицензией copyleft (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0) клон наследует лицензию, а выбор лицензии блокируется.
Настройки видимости#
Управляй тем, кто может видеть твой датасет:
| Настройка | Описание |
|---|---|
| Приватный | Ты и пользователи рабочего пространства с соответствующими разрешениями можете получить доступ |
| Публичный | Просматривать может любой пользователь, в том числе со страницы Explore |
Видимость задаётся при создании датасета в диалоговом окне New Dataset с помощью переключателя. Публичные датасеты отображаются на странице Explore.
Редактирование датасета#
Метаданные датасета редактируются непосредственно на странице датасета — отдельное диалоговое окно не требуется:
- Название: Нажми на название датасета, чтобы изменить его. Изменения автоматически сохраняются при потере фокуса или нажатии
Enter. Название может содержать не более 100 символов. - Описание: Нажми на описание (или на заполнитель «Добавить описание...»), чтобы изменить его. Изменения сохраняются автоматически. Описание может содержать не более 1 000 символов.
- Тип задачи: Нажми на значок задачи, чтобы выбрать другой тип задачи.
- Лицензия: Нажми на селектор лицензии, чтобы изменить лицензию датасета.
- Значок: Нажми на значок датасета, чтобы загрузить собственное изображение, назначить одно из изображений датасета значком или выбрать букву и цвет.
Каждое изображение хранит аннотации для всех типов задач. Изменение типа задачи датасета определяет, какие аннотации отображаются в редакторе и включаются в экспорт и обучение. Аннотации для других типов задач сохраняются в базе данных и снова появляются при обратном переключении. Depth — исключение: ground truth хранится в парном файле, а не в виде аннотации, поэтому датасет можно переключить на или с depth только если он не содержит изображений — вместо этого импортируй его заново.
Пользовательские метаданные#
Открой Дополнительные действия и выбери Информация, чтобы просмотреть два раздела:
- Метаданные Ultralytics: доступные только для чтения сведения Platform, такие как идентификатор датасета, владелец, задача, количество изображений и аннотаций, регион хранения и временные метки
- Пользовательские метаданные: собственный объект JSON для указания происхождения данных, условий съёмки, идентификаторов клиентов, управления данными или другой контекстной информации
Пользователи рабочего пространства с правом просмотра могут изучать метаданные, а участники с правом редактирования — заменять объект пользовательских метаданных. Сериализованный объект метаданных может содержать не более 500 000 символов, а длина каждого ключа верхнего уровня ограничена 128 символами. Сохрани пустой объект ({}), чтобы очистить пользовательские метаданные.
Клонирование датасета#
Просматривая публичный датасет, которым ты не владеешь, нажми Clone Dataset, чтобы открыть диалоговое окно клонирования. Проверь целевое рабочее пространство, название, видимость и лицензию, затем подтверди клонирование. Копия включает все изображения, аннотации и определения классов. Публичные исходные датасеты по умолчанию остаются публичными в рабочих пространствах с публичной видимостью по умолчанию; клоны в рабочих пространствах Enterprise по умолчанию являются приватными. Если у исходного датасета лицензия с копилефтом, клон наследует её, а выбор лицензии блокируется.
Слаг назначения автоматически переименовывается, если он уже занят, а для клонирования требуется достаточный оставшийся объём квоты хранилища для размещения копии.
Датасеты, размещённые в облачном хранилище или подключённые через On Premise, нельзя клонировать, поскольку Platform не хранит байты их изображений.
Добавление в избранное и отправка#
- Добавить в избранное: Нажми кнопку со звездой, чтобы добавить датасет в закладки. Количество добавлений в избранное видно всем пользователям.
- Поделиться: Для публичных датасетов нажми кнопку «Поделиться», чтобы скопировать ссылку, получить фрагмент для встраивания или поделиться в социальных сетях.
Удаление датасета#
Удали датасет, который тебе больше не нужен:
- Открой Дополнительные действия (кнопка
…) в заголовке датасета - Выбери Delete Dataset
- Подтверди в диалоговом окне: «Объект [name] будет перемещён в корзину. Ты сможешь восстановить его в течение 30 дней.»
В этом же меню есть пункт Information, который открывает диалоговое окно с метаданными, описанное в разделе Custom Metadata, и пункт Refresh, который заново считывает набор данных с сервера.
Удалённые наборы данных перемещаются в корзину, а не удаляются навсегда. Ты можешь восстановить их в течение 30 дней из Settings > Trash.
Обучение на наборе данных#
Запусти обучение непосредственно из набора данных:
- Нажми
New Modelна странице набора данных - Выбери проект или создай новый
- Настрой параметры обучения
- Запусти обучение
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffПодробнее см. в разделе Cloud Training.
Часто задаваемые вопросы#
Твои данные обрабатываются и хранятся в выбранном регионе (US, EU или AP). Изображения:
- Проверяются на соответствие требованиям к формату и размеру
- Отклоняются, если минимальный размер меньше 28px
- Нормализуются, если размер превышает 4096px (с сохранением соотношения сторон; кодируются для оптимизированного хранения)
- Хранятся с дедупликацией, поэтому идентичные изображения сохраняются только один раз
- Для быстрого просмотра создаются миниатюры размером 256px в формате WebP
Ultralytics Platform эффективно управляет хранилищем:
- Дедупликация: идентичные изображения в одном регионе данных хранятся один раз
- Целостность: загружаемые файлы проверяются на целостность данных
- Эффективность: клоны повторно используют сохранённые изображения вместо их копирования, при этом они учитываются в квоте хранилища целевого рабочего пространства
- Региональность: данные остаются в выбранном тобой регионе (US, EU или AP)
Да. Перетащи файлы в галерею набора данных или нажми значок загрузки в заголовке страницы — прямо откроется стандартное средство выбора файлов браузера. После обработки новые статистические данные вычисляются автоматически.
Используй функцию массового перемещения в поднабор:
- Выбери изображения в режиме таблицы
- Щёлкни правой кнопкой мыши и выбери
Move to split - Выбери целевой поднабор (Train, Validation или Test)
Ultralytics Platform поддерживает разметку YOLO, COCO JSON, Ultralytics NDJSON и загрузку исходных изображений. Файлы разметки Pascal VOC XML обнаруживаются, но не импортируются:
Один файл
.txtна каждое изображение с нормализованными координатами (диапазон 0–1):Задача Формат Пример Detect class cx cy w h0 0.5 0.5 0.2 0.3Segment class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Семантическая сегментация class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Позы class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9Классификация Структура каталогов train/cats/,train/dogs/Флаги видимости поз: 0 = не размечено, 1 = размечено, но заслонено, 2 = размечено и видно. Семантические датасеты также принимают PNG-маски вместо файлов полигонов (см. Семантические маски).
Да. Для каждого изображения вместе хранятся аннотации всех 6 типов задач разметки (detect, segment, semantic, classify, pose, OBB). Ты можешь в любой момент изменить активный тип задачи набора данных, не теряя существующие аннотации. В редакторе отображаются и в экспорт и обучение включаются только аннотации, соответствующие активному типу задачи; аннотации для других задач сохраняются и снова появляются при обратном переключении.
Да:
Ограничение Значение Классов на набор данных 25,000 Аннотаций на изображение 10,000 Координат на аннотацию 10,000 Название набора данных 100 символов Описание набора данных 1 000 символов Пользовательские метаданные 500 000 сериализованных символов Ключ верхнего уровня метаданных 128 символов Наборы данных, считывающие данные из источников облачного хранилища или On Premise, хранят пиксельные данные за пределами Platform, поэтому недоступны функции, которым нужны принадлежащие Platform копии байтов изображений:
Характеристика Подключённое облачное хранилище On Premise Умная и пакетная разметка Недоступно Недоступно Кластерный анализ Недоступно Недоступно Клонирование Недоступно Недоступно Снимки версий Недоступно Недоступно Экспорт NDJSON Доступно Недоступно Импорт семантических PNG-масок Недоступно Доступно Просмотр, ручная разметка, управление классами, поднаборами, статистикой и обучение работают в обычном режиме.