Наборы данных#
Датасеты Ultralytics Platform предоставляют удобное решение для управления обучающими данными. После загрузки платформа автоматически обрабатывает изображения, разметку и статистику. Датасет готов к обучению, как только обработка завершена и в нем есть хотя бы одно изображение в сплите train, хотя бы одно изображение в сплите val или test, хотя бы одно изображение с разметкой и всего не менее двух изображений.
Загрузить датасет#
Ultralytics Platform принимает данные в различных форматах для обеспечения гибкости работы.
Если у тебя уже есть датасеты в Roboflow, используй Integrations для их импорта напрямую — ручной экспорт или повторная загрузка не требуются. Данные из Google Cloud Storage, Amazon S3 или Azure Blob Storage можно использовать напрямую с помощью параметра Cloud storage. Корпоративные воркспейсы могут использовать On Premise для индексации локальных данных и обучения на них без отправки пикселей на Platform.
Поддерживаемые форматы#
| Формат | Расширения | Примечания | Макс. размер |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Самые популярные, рекомендуемые | 50 MB |
| PNG | .png | Поддерживает прозрачность | 50 MB |
| WebP | .webp | Современный формат, хорошая степень сжатия | 50 MB |
| BMP | .bmp | Без сжатия | 50 MB |
| TIFF | .tiff, .tif | Высокое качество | 50 MB |
| HEIC | .heic | Фото с iPhone | 50 MB |
| AVIF | .avif | Формат нового поколения | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Raw (необработанные) с камер | 50 MB |
| MPO | .mpo | Multi-picture object (объект с несколькими изображениями) | 50 MB |
Поддержка видеокодеков#
Само по себе расширение файла не гарантирует успех: видео может завершиться ошибкой, если его кодек не может быть декодирован воркером приема Platform.
Видео H.264 в контейнере MP4 имеет наибольшую поддержку в основных браузерах и является самым надежным выбором. Если видео не загружается, перекодируй его с помощью FFmpeg:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4Подготовка датасета#
Platform поддерживает Ultralytics YOLO, COCO, Ultralytics NDJSON и исходные (неразмеченные) загрузки:
Используй стандартную структуру каталогов YOLO с файлом data.yaml:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlYAML-файл определяет конфигурацию твоего датасета:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogRaw: Загрузка неразмеченных изображений (без меток). Полезно, когда ты планируешь размечать данные прямо на платформе с помощью редактора разметки.
Ты также можешь загружать изображения без явных папок для разделения на обучающую/валидационную выборки. Платформа учитывает активную цель разбивки при загрузке, а для датасетов не связанных с классификацией, может автоматически создать валидационную выборку из части обучающего набора, если информация о разбиении не была предоставлена. Ты всегда сможешь переназначить изображения позже с помощью массового перемещения по выборкам или перераспределения выборок.
Формат определяется автоматически: датасеты с файлом data.yaml, содержащим ключи names, train или val, обрабатываются как YOLO. Датасеты с файлами JSON в формате COCO (содержащие массивы images, annotations и categories) обрабатываются как COCO. Экспорты .ndjson импортируются как Ultralytics NDJSON. Датасеты, содержащие только изображения и не имеющие аннотаций, обрабатываются как raw.
Подробности о форматах для конкретных задач см. в разделах поддерживаемые задачи и Обзор датасетов.
Процесс загрузки#
Чтобы создать датасет:
- Перейди в
Annotateна боковой панели - Нажми
New Dataset - Выбери тип задачи (см. поддерживаемые задачи)
- Добавь название и опциональное описание
- Установи видимость (публичная или приватная) и при необходимости лицензию (см. доступные лицензии)
- Добавь файлы и нажми
Create & Uploadлибо нажмиCreate Dataset, чтобы начать с пустого датасета
Чтобы добавить файлы в существующий датасет, открой его страницу и либо перетащи файлы в галерею, либо нажми значок загрузки в шапке страницы. Значок загрузки открывает нативный выбор файлов твоего браузера напрямую, так как задача датасета уже определена.
После загрузки платформа обрабатывает твои данные через многоэтапный конвейер:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Валидация: Проверка формата и размера
- Нормализация: Большие изображения меняют размер (макс. 4096px, мин. сторона 28px)
- Миниатюры: Создаются превью в формате WebP размером 256px
- Парсинг разметки: извлечены метки в формате YOLO и COCO
- Статистика: Вычисляются распределения классов и размеры изображений

Валидация перед загрузкой
Ты можешь проверить свой датасет локально перед загрузкой:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")Изображения должны быть не менее 28px по своей короткой стороне. Изображения меньшего размера отклоняются при обработке. Изображения, превышающие 4096px по своей длинной стороне, автоматически масштабируются с сохранением соотношения сторон.
Обзор изображений#
Просматривай изображения своего датасета в различных макетах.
Открой панель Clustering на панели инструментов галереи, чтобы изучить свой датасет в виде интерактивной двумерной диаграммы рассеяния.
| Вид | Описание |
|---|---|
| Сетка | Сетка миниатюр с наложенной разметкой (по умолчанию) |
| Compact | Уменьшенные миниатюры для быстрого просмотра |
| Table | Список с миниатюрой, именем файла, размерами, размером в байтах, выборкой, классами и количеством меток |

Сортировка и фильтрация#
Изображения можно сортировать и фильтровать для эффективного просмотра:
| Сортировать | Описание |
|---|---|
| Новые / Старые | Порядок загрузки / создания |
| Имя А-Я / Я-А | Имя файла по алфавиту |
| Высота ↑/↓ | Высота изображения в пикселях |
| Ширина ↑/↓ | Ширина изображения в пикселях |
| Размер ↑/↓ | Размер файла на диске |
| Аннотации ↑/↓ | Количество аннотаций на изображение |
Для наборов данных, содержащих более 100 000 изображений, сортировка по имени / размеру / ширине / высоте отключена для поддержания быстродействия галереи. Сортировка по дате добавления (самые новые, самые старые) и по количеству аннотаций по-прежнему доступна.
Используй фильтр Annotations, установленный в значение Unannotated, чтобы быстро находить изображения, которые еще нуждаются в разметке. Это особенно полезно для больших датасетов, когда нужно отслеживать прогресс разметки.
Поле поиска находится справа на панели инструментов галереи и фильтрует все режимы отображения: карточки, компактный и таблицу. Оно сопоставляет имя файла изображения (расширение файла необязательно), а также ключи пользовательских метаданных, скалярные значения и элементы массивов, поэтому изображение с именем img_0042, содержащее {"ship_type": "yacht"}, находится поиском по запросу img_0042 или yacht.
Значения, вложенные внутрь подуровней объектов, не сопоставляются. Вставка 32-символьной шестнадцатеричной строки выполняет поиск именно этого хэша содержимого изображения.
Полноэкранный просмотрщик#
Нажми на любое изображение, чтобы открыть полноэкранный просмотрщик с помощью:
- Навигация: клавиши со стрелками или миниатюры для просмотра
- Информация об изображении: просмотр сгенерированных Platform свойств, пользовательских метаданных и встроенных метаданных файла, таких как EXIF
- Пользовательские метаданные: Владельцы и редакторы могут добавлять или заменять JSON-объект, включая вложенные значения размером до 500 000 сериализованных символов и ключи верхнего уровня длиной до 128 символов
- Аннотации: переключение видимости слоя аннотаций
- Распределение классов: количество разметок по классам с цветовыми индикаторами
- Annotate: Когда у тебя есть права на редактирование, элементы управления разметкой активируются сразу после открытия средства просмотра на полный экран на десктопе
- Загрузка: скачивание исходного файла изображения
- Удаление: удаление изображения из набора данных
- Масштабирование:
Cmd/Ctrl+Scroll,Cmd/Ctrl++илиCmd/Ctrl+=для приближения иCmd/Ctrl+-для отдаления - Сброс вида:
Cmd/Ctrl + 0или кнопка сброса, чтобы подогнать изображение под размер окна просмотра - Панорамирование: удерживай
Spaceи перетаскивай мышью для перемещения холста при масштабировании - Пиксельный вид: включение пиксельного рендеринга для детального изучения

Фильтр по сплиту#
Фильтрация изображений по их сплиту в наборе данных:
| Split | Цель |
|---|---|
| Обучение | Используется для обучения модели |
| Val | Используется для валидации во время обучения |
| Test | Используется для финальной оценки |
Кластеризация#
Панель Clustering проецирует твой датасет на интерактивную двумерную диаграмму рассеяния, где визуально похожие изображения располагаются близко друг к другу. Используй её для выявления кластеров, поиска дубликатов и выбросов, а также для проверки распределения сплитов и классов по твоим данным — не покидая галерею. Открой её с помощью значка графика рассеяния на панели инструментов галереи на любой странице датасета.

Запуск анализа#
Запуск анализа:
- Открой набор данных и нажми на значок диаграммы рассеяния на панели инструментов галереи
- Нажми
Analyze Dataset - Дождись завершения работы индикатора выполнения — результаты появятся на той же панели
Анализ выполняется в фоновом режиме и может занять несколько минут в зависимости от размера твоего набора данных. Ты можешь закрыть панель или покинуть страницу и вернуться позже.
Визуализация#
После завершения анализа на панели появится 2D-диаграмма всех проанализированных изображений. Фильтры галереи (сплит, класс, размеченные/неразмеченные) делают неактивные точки полупрозрачными, чтобы ты мог сосредоточиться на нужном подмножестве.

Раскраска по#
Измени способ раскраски точек данных с помощью выпадающего списка Color by на панели инструментов. Переключай режимы отображения в любой момент — график мгновенно меняет цвета, позволяя увидеть, как сплиты, классы или свойства изображений распределены по твоим кластерам:
| Опция | Затенение |
|---|---|
| Splits | Train / Val / Test |
| Classes | Первый класс аннотации на каждом изображении |
| Width | Ширина изображения |
| Height | Высота изображения |
| Size | Размер файла |
| Аннотации | Количество аннотаций на изображение |

Выделение лассо#
Нарисуй произвольную область выделения вокруг региона, чтобы подсветить точки на графике. Галерея отфильтрует подходящие изображения, и ты сможешь просмотреть их, переразметить, переместить или удалить, используя привычные операции с изображениями.
Чип над графиком показывает количество выбранных точек — нажми ×, чтобы сбросить лассо и вернуться к просмотру всей галереи.
Панорамирование и масштабирование#
Навигация по большим диаграммам рассеяния прямо с помощью мыши и клавиатуры:
| Ввод | Действие |
|---|---|
| Scroll (колесико мыши) | Панорамирование диаграммы в 2D |
| Cmd/Ctrl+Scroll | Приближение или отдаление относительно курсора |
| Удерживание Space | Переключение в режим перетаскивания (панорамирования) |
Повторный анализ#
Если твой датасет изменился после анализа, в верхней части панели для владельцев и редакторов появляется кнопка Re-analyze.
Нажми Re-analyze, чтобы пересчитать векторные представления (эмбеддинги) и 2D-проекцию с нуля.
Вкладки набора данных#
Каждая страница набора данных может отображать до шести вкладок в зависимости от состояния набора данных и твоих прав доступа:
Вкладка Images#
Вид по умолчанию, показывающий галерею изображений с наложенными аннотациями. Поддерживаются режимы сетки, компактный и табличный. Перетаскивай файлы сюда, чтобы добавить больше изображений.
Вкладка Classes#
Эта вкладка появляется, когда в наборе данных есть изображения.
Управляй классами аннотаций для своего набора данных:
- Гистограмма классов: гистограмма, показывающая количество аннотаций по каждому классу с переключателем линейной/логарифмической шкалы
- Таблица классов: сортируемая таблица с возможностью поиска, содержащая названия классов, количество меток и количество изображений.
- Редактирование названий классов: нажми на любое название класса, чтобы изменить его прямо в таблице.
- Редактирование цветов классов: нажми на образец цвета, чтобы изменить цвет класса.
- Добавление нового класса: используй поле ввода в нижней части, чтобы добавить классы.

Если в твоем датасете наблюдается дисбаланс классов (например, 10 000 аннотаций класса "person" и всего 50 класса "bicycle"), используй переключатель Log Scale на гистограмме классов, чтобы четко визуализировать все классы.
Вкладка «Графики»#
Эта вкладка появляется, когда в наборе данных есть изображения.
Автоматическая статистика, рассчитанная для твоего набора данных:
| График | Описание |
|---|---|
| Распределение по выборкам | Кольцевая диаграмма количества изображений и процентов размеченных данных для выборок train/val/test. |
| Популярные классы | Кольцевая диаграмма 10 наиболее частых классов аннотаций. |
| Размеры изображений | Гистограмма распределения ширины и высоты изображений (наложенные друг на друга) со средним значением. |
| Точек на экземпляр | Количество вершин полигона или ключевых точек на одну аннотацию (сегментация/поза). |
| Расположение аннотаций | 2D-теплокарта центральных позиций ограничивающих прямоугольников (bbox). |
| Размер файлов изображений | Гистограмма распределения размеров файлов изображений. |
| Форматы изображений | Распределение исходных форматов изображений (JPG, PNG и т.д.). |
| Размеры ограничивающих прямоугольников | Гистограмма ширины и высоты ограничивающих прямоугольников (наложенные друг на друга). |
| Объектов на изображение | Гистограмма количества аннотаций на одно изображение. |
| Размеры изображений 2D | 2D-теплокарта ширины и высоты с направляющими линиями соотношения сторон. |

Platform кэширует вычисленные статистические данные и аннулирует их при изменении изображений, разметки, классов или разбиений.
Нажми кнопку развертывания на любой теплокарте, чтобы просмотреть ее в полноэкранном режиме. Это обеспечивает более крупный и детализированный вид — полезно для понимания пространственных закономерностей в больших наборах данных.
Вкладка «Модели»#
Просматривай все модели, обученные на этом наборе данных, в таблице с возможностью поиска:
| Столбец | Описание |
|---|---|
| Имя | Название модели со ссылкой |
| Проект | Родительский проект с иконкой |
| Версия | Неизменяемая версия датасета, используемая для обучения, если таковая имеется |
| Статус | Бейдж статуса обучения |
| Задача | Тип задачи YOLO |
| Эпохи | Лучшая эпоха / общее количество эпох |
| mAP50-95 | Средняя точность (Mean average precision) |
| mAP50 | mAP при IoU 0.50 |
| Создано | Дата создания |

Вкладка «Ошибки»#
Эта вкладка появляется только в том случае, если один или несколько файлов не прошли обработку.
Изображения, которые не прошли обработку, перечислены здесь с:
- Баннер ошибки: общее количество изображений с ошибками и рекомендации
- Таблица ошибок: имя файла, понятное описание ошибки, советы по исправлению и миниатюра для предпросмотра
- Распространенные ошибки включают поврежденные файлы, неподдерживаемые форматы, слишком маленькие изображения (минимум 28px) и неподдерживаемые цветовые режимы

Распространенные ошибки обработки
| Ошибка | Причина | Исправление |
|---|---|---|
| Невозможно прочитать файл изображения | Поврежденный или неподдерживаемый формат | Экспортируй повторно из графического редактора |
| Неполный или поврежденный файл | Файл был усечен во время передачи | Скачай исходный файл повторно |
| Изображение слишком маленькое | Минимальный размер стороны меньше 28px | Используй исходные изображения более высокого разрешения |
| Неподдерживаемый цветовой режим | Цветовой режим CMYK или индексированные цвета | Конвертируй в режим RGB |
Вкладка «Версии»#
Создавай неизменяемые NDJSON-снимки твоего набора данных для воспроизводимого обучения. Каждая версия фиксирует количество изображений, количество классов, количество аннотаций и размер файла на момент создания.
| Столбец | Описание |
|---|---|
| Версия | Номер версии (v1, v2, ...) |
| Описание | Описание, предоставленное пользователем (редактируемое) |
| Изображения | Количество изображений на момент создания снимка |
| Классы | Количество классов на момент создания снимка |
| Аннотации | Количество аннотаций на момент создания снимка |
| Размер | Размер файла экспорта NDJSON |
| Создано | Время создания версии |
| Действия | Скачать, восстановить или удалить |
Чтобы создать версию:
- Открой вкладку Версии
- При необходимости введи описание (например, «Добавлено 500 изображений для обучения» или «Исправлены ошибки в разметке классов»)
- Нажми + New Version
- Новая версия появится в таблице
- Используй действия в строке, чтобы скачать, восстановить или удалить версию
Каждая версия нумеруется последовательно (v1, v2, v3...). Ты можешь скачать сохраненную версию, пока она остается в таблице версий.
Восстановление навсегда заменяет текущие изображения, разбиения, классы и разметку датасета выбранным снимком. Пересборка может занять несколько минут и её нельзя отменить, если предварительно не сохранить текущее состояние как другую версию.
Включи опцию Save Dataset Version в диалоговом окне облачного обучения, чтобы связать модель с точной версией датасета, использованной для обучения. Platform повторно использует подходящую версию, если содержимое датасета не изменилось, и создает новую версию только тогда, когда оно изменилось.
Создание версии становится доступным после того, как датасет достигнет статуса ready.
Создавай версию до и после внесения значительных изменений в свой набор данных — добавления изображений, исправления аннотаций или перебалансировки выборок. Это позволит тебе сравнивать производительность моделей для разных состояний набора данных.
Указан размер файла экспорта NDJSON, который содержит URL-адреса изображений и аннотации, а не сами изображения. Фактические данные изображений хранятся отдельно и доступны через подписанные URL.
Экспортировать набор данных#
Экспортируй набор данных для использования в автономном режиме с помощью загрузки NDJSON из заголовка набора данных или вкладки «Версии».
Для экспорта:
- Нажми кнопку Download (иконка загрузки) в заголовке набора данных
- Скачивай текущий снимок NDJSON напрямую
- Используй вкладку Versions, если тебе нужен неизменяемый пронумерованный снимок, который можно скачать повторно позже
Формат NDJSON хранит один объект JSON на каждую строку. Первая строка содержит метаданные датасета, за ней следует по одной строке на каждое изображение:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}Необязательный объект metadata на уровне изображения сохраняется при импорте файла NDJSON в Platform. Ты можешь просмотреть или отредактировать его на полноэкранной информационной панели изображения. Для программной загрузки архивов Dataset Ingest API принимает эквивалентную карту путей imageMetadata.
URL-адреса изображений в экспортированном файле NDJSON являются подписанными и действительны в течение 7 дней. Если тебе нужны свежие URL-адреса, повторно экспортируй набор данных или создай новую версию.
Полную спецификацию см. в документации по формату Ultralytics NDJSON.
Операции с изображениями#
Быстрые действия#
Нажми правой кнопкой мыши на любое изображение в режиме Grid или Compact, чтобы получить доступ к быстрым действиям:
| Действие | Описание |
|---|---|
| Move to Split (Переместить в выборку) | Переназначь изображение в выборку Train, Val или Test |
| Скачивание | Скачай исходный файл изображения |
| Delete (Удалить) | Удали изображение из набора данных |

Контекстное меню изображения работает с одним изображением. Для массовых операций с несколькими изображениями используй представление Table с выбором через флажки.
Массовое перемещение в выборку#
Переназначь выбранные изображения в другую выборку внутри того же набора данных:
- Переключись в режим Table
- Выбери изображения с помощью флажков
- Нажми правой кнопкой мыши, чтобы открыть контекстное меню
- Выбери
Move to split> Train, Validation или Test
Ты также можешь перетаскивать изображения на вкладки фильтра выборки в режиме сетки.
Загрузи все изображения в один набор данных, а затем используй массовое перемещение в выборку для распределения подмножеств на обучающую, валидационную и тестовую выборки.
Перераспределение выборок#
Перераспредели все изображения между обучающей, валидационной и тестовой выборками, используя пользовательские коэффициенты:
- Нажми на панель выборки в панели инструментов набора данных, чтобы открыть диалоговое окно Redistribute Splits
- Настрой процентное соотношение выборок, используя любой из методов ниже
- Изучи динамический предварительный просмотр количества изображений, чтобы подтвердить распределение
- Нажми Apply, чтобы случайным образом переназначить все изображения в соответствии с твоими процентами
Диалоговое окно предоставляет три способа установки целевых пропорций сплитов:
| Метод | Описание |
|---|---|
| Drag (Перетаскивание) | Перетаскивай маркеры между цветными сегментами для визуальной настройки границ выборки |
| Type (Ввод) | Отредактируй процентное значение для любой выборки (остальные две автоматически пересчитаются пропорционально) |
| Auto (Авто) | Один клик для мгновенной установки соотношения 80/20 для обучающей/валидационной выборок при значении 0% для тестовой |
Динамический предварительный просмотр точно показывает, сколько изображений попадет в каждую выборку, прежде чем ты применишь изменения.
Нажми кнопку Auto, чтобы мгновенно установить рекомендуемое соотношение 80/20 для обучающей/валидационной выборок. Это наиболее распространенное соотношение для обучения.
Массовое удаление#
Удали несколько изображений за раз:
- Выбери изображения в режиме таблицы
- Нажми правую кнопку мыши и выбери
Delete - Подтверди удаление
URI набора данных#
Ссылайся на датасеты Platform, используя формат URI ul:// (см. раздел Использование датасетов платформы):
ul://username/datasets/dataset-slugТы также можешь напрямую вставить веб-URL датасета или модели (например, https://platform.ultralytics.com/username/datasets/dataset-slug); он автоматически преобразуется в URI ul://. Передача списка датасетов выполняет дообучение одной базовой модели на каждом из них последовательно, например model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Используй этот URI для обучения моделей из любого места:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100URI ul:// работает из любой среды:
- Локальная машина: обучай на своем оборудовании, данные скачиваются автоматически
- Google Colab: получай доступ к своим наборам данных Platform в ноутбуках
- Удаленные серверы: обучай на облачных виртуальных машинах с полным доступом к набору данных
Доступные лицензии#
Platform поддерживает следующие лицензии для наборов данных:
| Лицензия | Тип |
|---|---|
| Нет | Лицензия не выбрана |
| CC0-1.0 | Общественное достояние |
| CC-BY-2.5 | Разрешительная |
| CC-BY-4.0 | Разрешительная |
| CC-BY-SA-4.0 | Копилефт |
| CC-BY-NC-4.0 | Некоммерческая |
| CC-BY-NC-SA-4.0 | Копилефт |
| CC-BY-ND-4.0 | Без производных работ |
| CC-BY-NC-ND-4.0 | Некоммерческая |
| Apache-2.0 | Разрешительная |
| MIT | Разрешительная |
| AGPL-3.0 | Копилефт |
| GPL-3.0 | Копилефт |
| Только для исследований | Ограниченная |
| Другое | Пользовательская |
При клонировании набора данных с лицензией copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-4.0) клон наследует эту лицензию, а переключатель лицензий блокируется.
Настройки видимости#
Контролируй, кто может видеть твой набор данных:
| Настройка | Описание |
|---|---|
| Private (Частный) | Доступ есть у тебя и участников рабочего пространства с соответствующими разрешениями |
| Public (Публичный) | Просмотр доступен всем, в том числе со страницы Explore |
Видимость устанавливается при создании датасета в диалоговом окне New Dataset с помощью переключателя. Публичные датасеты видны на странице Explore.
Редактирование набора данных#
Метаданные набора данных редактируются непосредственно на странице набора данных — диалоговое окно не требуется:
- Название: нажми на название датасета, чтобы отредактировать его. Изменения сохраняются автоматически при потере фокуса или по нажатию
Enter. - Description: Нажми на описание (или заполнитель "Add a description..."), чтобы отредактировать его. Изменения сохраняются автоматически.
- Task type: Нажми на значок задачи, чтобы выбрать другой тип задачи.
- License: Нажми на селектор лицензии, чтобы изменить лицензию набора данных.
Каждое изображение хранит аннотации для всех типов задач вместе. Изменение типа задачи набора данных контролирует, какие аннотации видны в редакторе и включены в экспорт и обучение. Аннотации для других типов задач сохраняются в базе данных и появляются снова, когда ты переключаешься обратно.
Пользовательские метаданные#
Открой Ещё действия и выбери Информация, чтобы просмотреть два раздела:
- Метаданные Ultralytics: Сведения о Platform только для чтения, такие как ID датасета, владелец, задача, количество изображений и аннотаций, регион хранения и временные метки
- Пользовательские метаданные: Твой собственный JSON-объект для отслеживания происхождения, условий съёмки, ID клиентов, управления или других контекстных данных
Наблюдатели рабочей области могут просматривать метаданные, в то время как участники с правом редактирования могут заменять объект пользовательских метаданных. Сериализованный объект метаданных ограничен 500 000 символов, а каждый ключ верхнего уровня ограничен 128 символами. Сохрани пустой объект ({}), чтобы очистить пользовательские метаданные.
Клонирование набора данных#
При просмотре публичного датасета, владельцем которого ты не являешься, нажми Clone Dataset, чтобы открыть диалоговое окно клонирования. Проверь целевой воркспейсе, название, видимость и лицензию, а затем подтверди клонирование. Копия включает все изображения, аннотации и определения классов. Публичные исходные датасеты по умолчанию остаются публичными в воркспейсах, где видимость по умолчанию — публичная; клоны в корпоративных воркспейсах по умолчанию приватные. Если оригинальный датасет имеет лицензию copyleft, клон наследует её, и выбор лицензии будет заблокирован.
Отметить и поделиться#
- Star: Нажми кнопку со звездочкой, чтобы добавить набор данных в закладки. Количество отметок звездочкой видно всем пользователям.
- Share: Для публичных наборов данных нажми кнопку «поделиться», чтобы скопировать ссылку или отправить её в социальные сети.
Удалить набор данных#
Удаление набора данных, который тебе больше не нужен:
- Нажми значок корзины Delete dataset в заголовке датасета
- Подтверди действие в диалоговом окне: "Это переместит [name] в корзину. Ты сможешь восстановить его в течение 30 дней."
Удаленные датасеты перемещаются в корзину (Trash), а не удаляются навсегда. Ты можешь восстановить их в течение 30 дней из раздела Settings > Trash.
Обучение на наборе данных#
Начни обучение прямо из своего набора данных:
- Нажми
New Modelна странице датасета - Выбери проект или создай новый
- Настрой параметры обучения
- Запусти обучение
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffПодробности см. в разделе Облачное обучение.
FAQ#
Что происходит с моими данными после загрузки?#
Твои данные обрабатываются и хранятся в выбранном регионе (US, EU или AP). Изображения:
- Проверяются на формат и размер
- Отклоняются, если минимальный размер менее 28px
- Нормализуются, если размер превышает 4096px (с сохранением соотношения сторон; кодируются для оптимизированного хранения)
- Хранятся с использованием контентно-адресуемого хранилища (CAS) с хешированием XXH3-128
- Миниатюры создаются в формате WebP размером 256px для быстрого просмотра
Как работает хранилище?#
Ultralytics Platform использует Content-Addressable Storage (CAS) для эффективного хранения:
- Deduplication: Идентичные байты изображений в одной области данных используют один и тот же базовый объект
- Integrity: Хеширование XXH3-128 обеспечивает целостность данных
- Efficiency: Клоны используют объекты CAS вместо копирования байтов изображений, при этом они по-прежнему учитываются в квоте хранилища целевого рабочего пространства
- Regional: Данные остаются в выбранном тобой регионе (US, EU или AP)
Можно ли добавить изображения в существующий набор данных?#
Да. Перетащи файлы в галерею датасета или нажми значок загрузки в шапке страницы, что напрямую откроет встроенный диалог выбора файлов твоего браузера. Новая статистика рассчитывается автоматически после завершения обработки.
Как перемещать изображения между сплитами?#
Используй функцию массового перемещения в сплит:
- Выбери изображения в режиме таблицы
- Нажми правую кнопку мыши и выбери
Move to split - Выбери целевой сплит (Train, Validation или Test)
Какие форматы меток поддерживаются?#
Ultralytics Platform поддерживает метки YOLO, COCO JSON, Ultralytics NDJSON и загрузку необработанных изображений:
Один файл .txt на каждое изображение с нормализованными координатами (диапазон 0-1):
| Задача | Формат | Пример |
|---|---|---|
| Обнаружение | class cx cy w h | 0 0.5 0.5 0.2 0.3 |
| Сегментация | class x1 y1 x2 y2 ... | 0 0.1 0.1 0.9 0.1 0.9 0.9 |
| Поза | class cx cy w h kx1 ky1 v1 ... | 0 0.5 0.5 0.2 0.3 0.6 0.7 2 |
| OBB | class x1 y1 x2 y2 x3 y3 x4 y4 | 0 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9 |
| Классификация | Структура каталогов | train/cats/, train/dogs/ |
Флаги видимости поз: 0=не размечено, 1=размечено, но перекрыто, 2=размечено и видно.
Могу ли я аннотировать один и тот же набор данных для нескольких типов задач?#
Да. Каждое изображение хранит аннотации для всех 6 типов задач (detect, segment, semantic, classify, pose, OBB) вместе. Ты можешь переключить активный тип задачи датасета в любой момент без потери существующих аннотаций. В редакторе отображаются и включаются в экспорты и обучение только аннотации, соответствующие активному типу задачи — аннотации для других задач сохраняются и появляются снова, когда ты переключаешься обратно.