YOLO Vision 2026:

Наборы данных#

Датасеты Ultralytics Platform предоставляют удобное решение для управления обучающими данными. После загрузки платформа автоматически обрабатывает изображения, разметку и статистику. Датасет готов к обучению, как только обработка завершена и в нем есть хотя бы одно изображение в сплите train, хотя бы одно изображение в сплите val или test, хотя бы одно изображение с разметкой и всего не менее двух изображений.

Загрузить датасет#

Ultralytics Platform принимает данные в различных форматах для обеспечения гибкости работы.

У тебя уже есть данные в другом месте?

Если у тебя уже есть датасеты в Roboflow, используй Integrations для их импорта напрямую — ручной экспорт или повторная загрузка не требуются. Данные из Google Cloud Storage, Amazon S3 или Azure Blob Storage можно использовать напрямую с помощью параметра Cloud storage. Корпоративные воркспейсы могут использовать On Premise для индексации локальных данных и обучения на них без отправки пикселей на Platform.

Поддерживаемые форматы#

ФорматРасширенияПримечанияМакс. размер
JPEG.jpg, .jpegСамые популярные, рекомендуемые50 MB
PNG.pngПоддерживает прозрачность50 MB
WebP.webpСовременный формат, хорошая степень сжатия50 MB
BMP.bmpБез сжатия50 MB
TIFF.tiff, .tifВысокое качество50 MB
HEIC.heicФото с iPhone50 MB
AVIF.avifФормат нового поколения50 MB
JP2.jp2JPEG 200050 MB
DNG.dngRaw (необработанные) с камер50 MB
MPO.mpoMulti-picture object (объект с несколькими изображениями)50 MB

Поддержка видеокодеков#

Само по себе расширение файла не гарантирует успех: видео может завершиться ошибкой, если его кодек не может быть декодирован воркером приема Platform.

Используй H.264 MP4

Видео H.264 в контейнере MP4 имеет наибольшую поддержку в основных браузерах и является самым надежным выбором. Если видео не загружается, перекодируй его с помощью FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Подготовка датасета#

Platform поддерживает Ultralytics YOLO, COCO, Ultralytics NDJSON и исходные (неразмеченные) загрузки:

Используй стандартную структуру каталогов YOLO с файлом data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

YAML-файл определяет конфигурацию твоего датасета:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Загрузка необработанных данных

Raw: Загрузка неразмеченных изображений (без меток). Полезно, когда ты планируешь размечать данные прямо на платформе с помощью редактора разметки.

Плоская структура папок

Ты также можешь загружать изображения без явных папок для разделения на обучающую/валидационную выборки. Платформа учитывает активную цель разбивки при загрузке, а для датасетов не связанных с классификацией, может автоматически создать валидационную выборку из части обучающего набора, если информация о разбиении не была предоставлена. Ты всегда сможешь переназначить изображения позже с помощью массового перемещения по выборкам или перераспределения выборок.

Автоматическое определение формата

Формат определяется автоматически: датасеты с файлом data.yaml, содержащим ключи names, train или val, обрабатываются как YOLO. Датасеты с файлами JSON в формате COCO (содержащие массивы images, annotations и categories) обрабатываются как COCO. Экспорты .ndjson импортируются как Ultralytics NDJSON. Датасеты, содержащие только изображения и не имеющие аннотаций, обрабатываются как raw.

Подробности о форматах для конкретных задач см. в разделах поддерживаемые задачи и Обзор датасетов.

Процесс загрузки#

Чтобы создать датасет:

  1. Перейди в Annotate на боковой панели
  2. Нажми New Dataset
  3. Выбери тип задачи (см. поддерживаемые задачи)
  4. Добавь название и опциональное описание
  5. Установи видимость (публичная или приватная) и при необходимости лицензию (см. доступные лицензии)
  6. Добавь файлы и нажми Create & Upload либо нажми Create Dataset, чтобы начать с пустого датасета

Ultralytics Platform Datasets Upload Dialog Task Selector Чтобы добавить файлы в существующий датасет, открой его страницу и либо перетащи файлы в галерею, либо нажми значок загрузки в шапке страницы. Значок загрузки открывает нативный выбор файлов твоего браузера напрямую, так как задача датасета уже определена.

После загрузки платформа обрабатывает твои данные через многоэтапный конвейер:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Валидация: Проверка формата и размера
  2. Нормализация: Большие изображения меняют размер (макс. 4096px, мин. сторона 28px)
  3. Миниатюры: Создаются превью в формате WebP размером 256px
  4. Парсинг разметки: извлечены метки в формате YOLO и COCO
  5. Статистика: Вычисляются распределения классов и размеры изображений

Ultralytics Platform Datasets Upload Progress Bar

Валидация перед загрузкой

Ты можешь проверить свой датасет локально перед загрузкой:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Требования к размеру изображений

Изображения должны быть не менее 28px по своей короткой стороне. Изображения меньшего размера отклоняются при обработке. Изображения, превышающие 4096px по своей длинной стороне, автоматически масштабируются с сохранением соотношения сторон.

Обзор изображений#

Просматривай изображения своего датасета в различных макетах.

Открой панель Clustering на панели инструментов галереи, чтобы изучить свой датасет в виде интерактивной двумерной диаграммы рассеяния.

ВидОписание
СеткаСетка миниатюр с наложенной разметкой (по умолчанию)
CompactУменьшенные миниатюры для быстрого просмотра
TableСписок с миниатюрой, именем файла, размерами, размером в байтах, выборкой, классами и количеством меток

Ultralytics Platform Datasets Gallery Grid View With Annotations

Сортировка и фильтрация#

Изображения можно сортировать и фильтровать для эффективного просмотра:

СортироватьОписание
Новые / СтарыеПорядок загрузки / создания
Имя А-Я / Я-АИмя файла по алфавиту
Высота ↑/↓Высота изображения в пикселях
Ширина ↑/↓Ширина изображения в пикселях
Размер ↑/↓Размер файла на диске
Аннотации ↑/↓Количество аннотаций на изображение
Большие наборы данных

Для наборов данных, содержащих более 100 000 изображений, сортировка по имени / размеру / ширине / высоте отключена для поддержания быстродействия галереи. Сортировка по дате добавления (самые новые, самые старые) и по количеству аннотаций по-прежнему доступна.

Поиск неразмеченных изображений

Используй фильтр Annotations, установленный в значение Unannotated, чтобы быстро находить изображения, которые еще нуждаются в разметке. Это особенно полезно для больших датасетов, когда нужно отслеживать прогресс разметки.

Поиск по пользовательским метаданным

Поле поиска находится справа на панели инструментов галереи и фильтрует все режимы отображения: карточки, компактный и таблицу. Оно сопоставляет имя файла изображения (расширение файла необязательно), а также ключи пользовательских метаданных, скалярные значения и элементы массивов, поэтому изображение с именем img_0042, содержащее {"ship_type": "yacht"}, находится поиском по запросу img_0042 или yacht.

Значения, вложенные внутрь подуровней объектов, не сопоставляются. Вставка 32-символьной шестнадцатеричной строки выполняет поиск именно этого хэша содержимого изображения.

Полноэкранный просмотрщик#

Нажми на любое изображение, чтобы открыть полноэкранный просмотрщик с помощью:

  • Навигация: клавиши со стрелками или миниатюры для просмотра
  • Информация об изображении: просмотр сгенерированных Platform свойств, пользовательских метаданных и встроенных метаданных файла, таких как EXIF
  • Пользовательские метаданные: Владельцы и редакторы могут добавлять или заменять JSON-объект, включая вложенные значения размером до 500 000 сериализованных символов и ключи верхнего уровня длиной до 128 символов
  • Аннотации: переключение видимости слоя аннотаций
  • Распределение классов: количество разметок по классам с цветовыми индикаторами
  • Annotate: Когда у тебя есть права на редактирование, элементы управления разметкой активируются сразу после открытия средства просмотра на полный экран на десктопе
  • Загрузка: скачивание исходного файла изображения
  • Удаление: удаление изображения из набора данных
  • Масштабирование: Cmd/Ctrl+Scroll, Cmd/Ctrl++ или Cmd/Ctrl+= для приближения и Cmd/Ctrl+- для отдаления
  • Сброс вида: Cmd/Ctrl + 0 или кнопка сброса, чтобы подогнать изображение под размер окна просмотра
  • Панорамирование: удерживай Space и перетаскивай мышью для перемещения холста при масштабировании
  • Пиксельный вид: включение пиксельного рендеринга для детального изучения

Ultralytics Platform Datasets Fullscreen Viewer With Metadata Panel

Фильтр по сплиту#

Фильтрация изображений по их сплиту в наборе данных:

SplitЦель
ОбучениеИспользуется для обучения модели
ValИспользуется для валидации во время обучения
TestИспользуется для финальной оценки

Кластеризация#

Панель Clustering проецирует твой датасет на интерактивную двумерную диаграмму рассеяния, где визуально похожие изображения располагаются близко друг к другу. Используй её для выявления кластеров, поиска дубликатов и выбросов, а также для проверки распределения сплитов и классов по твоим данным — не покидая галерею. Открой её с помощью значка графика рассеяния на панели инструментов галереи на любой странице датасета.

Ultralytics Platform Datasets Clustering Empty State

Запуск анализа#

Запуск анализа:

  1. Открой набор данных и нажми на значок диаграммы рассеяния на панели инструментов галереи
  2. Нажми Analyze Dataset
  3. Дождись завершения работы индикатора выполнения — результаты появятся на той же панели

Анализ выполняется в фоновом режиме и может занять несколько минут в зависимости от размера твоего набора данных. Ты можешь закрыть панель или покинуть страницу и вернуться позже.

Визуализация#

После завершения анализа на панели появится 2D-диаграмма всех проанализированных изображений. Фильтры галереи (сплит, класс, размеченные/неразмеченные) делают неактивные точки полупрозрачными, чтобы ты мог сосредоточиться на нужном подмножестве.

Ultralytics Platform Datasets Clustering Scatter Plot

Раскраска по#

Измени способ раскраски точек данных с помощью выпадающего списка Color by на панели инструментов. Переключай режимы отображения в любой момент — график мгновенно меняет цвета, позволяя увидеть, как сплиты, классы или свойства изображений распределены по твоим кластерам:

ОпцияЗатенение
SplitsTrain / Val / Test
ClassesПервый класс аннотации на каждом изображении
WidthШирина изображения
HeightВысота изображения
SizeРазмер файла
АннотацииКоличество аннотаций на изображение

Ultralytics Platform Datasets Clustering Color Modes

Выделение лассо#

Нарисуй произвольную область выделения вокруг региона, чтобы подсветить точки на графике. Галерея отфильтрует подходящие изображения, и ты сможешь просмотреть их, переразметить, переместить или удалить, используя привычные операции с изображениями.

Очистить выделение

Чип над графиком показывает количество выбранных точек — нажми ×, чтобы сбросить лассо и вернуться к просмотру всей галереи.

Панорамирование и масштабирование#

Навигация по большим диаграммам рассеяния прямо с помощью мыши и клавиатуры:

ВводДействие
Scroll (колесико мыши)Панорамирование диаграммы в 2D
Cmd/Ctrl+ScrollПриближение или отдаление относительно курсора
Удерживание SpaceПереключение в режим перетаскивания (панорамирования)

Повторный анализ#

Если твой датасет изменился после анализа, в верхней части панели для владельцев и редакторов появляется кнопка Re-analyze.

Нажми Re-analyze, чтобы пересчитать векторные представления (эмбеддинги) и 2D-проекцию с нуля.

Вкладки набора данных#

Каждая страница набора данных может отображать до шести вкладок в зависимости от состояния набора данных и твоих прав доступа:

Вкладка Images#

Вид по умолчанию, показывающий галерею изображений с наложенными аннотациями. Поддерживаются режимы сетки, компактный и табличный. Перетаскивай файлы сюда, чтобы добавить больше изображений.

Вкладка Classes#

Эта вкладка появляется, когда в наборе данных есть изображения.

Управляй классами аннотаций для своего набора данных:

  • Гистограмма классов: гистограмма, показывающая количество аннотаций по каждому классу с переключателем линейной/логарифмической шкалы
  • Таблица классов: сортируемая таблица с возможностью поиска, содержащая названия классов, количество меток и количество изображений.
  • Редактирование названий классов: нажми на любое название класса, чтобы изменить его прямо в таблице.
  • Редактирование цветов классов: нажми на образец цвета, чтобы изменить цвет класса.
  • Добавление нового класса: используй поле ввода в нижней части, чтобы добавить классы.

Ultralytics Platform Datasets Classes Tab Histogram And Table

Логарифмическая шкала для несбалансированных наборов данных

Если в твоем датасете наблюдается дисбаланс классов (например, 10 000 аннотаций класса "person" и всего 50 класса "bicycle"), используй переключатель Log Scale на гистограмме классов, чтобы четко визуализировать все классы.

Вкладка «Графики»#

Эта вкладка появляется, когда в наборе данных есть изображения.

Автоматическая статистика, рассчитанная для твоего набора данных:

ГрафикОписание
Распределение по выборкамКольцевая диаграмма количества изображений и процентов размеченных данных для выборок train/val/test.
Популярные классыКольцевая диаграмма 10 наиболее частых классов аннотаций.
Размеры изображенийГистограмма распределения ширины и высоты изображений (наложенные друг на друга) со средним значением.
Точек на экземплярКоличество вершин полигона или ключевых точек на одну аннотацию (сегментация/поза).
Расположение аннотаций2D-теплокарта центральных позиций ограничивающих прямоугольников (bbox).
Размер файлов изображенийГистограмма распределения размеров файлов изображений.
Форматы изображенийРаспределение исходных форматов изображений (JPG, PNG и т.д.).
Размеры ограничивающих прямоугольниковГистограмма ширины и высоты ограничивающих прямоугольников (наложенные друг на друга).
Объектов на изображениеГистограмма количества аннотаций на одно изображение.
Размеры изображений 2D2D-теплокарта ширины и высоты с направляющими линиями соотношения сторон.

Ultralytics Platform Datasets Charts Tab Statistics Grid

Кэширование статистики

Platform кэширует вычисленные статистические данные и аннулирует их при изменении изображений, разметки, классов или разбиений.

Полноэкранные теплокарты

Нажми кнопку развертывания на любой теплокарте, чтобы просмотреть ее в полноэкранном режиме. Это обеспечивает более крупный и детализированный вид — полезно для понимания пространственных закономерностей в больших наборах данных.

Вкладка «Модели»#

Просматривай все модели, обученные на этом наборе данных, в таблице с возможностью поиска:

СтолбецОписание
ИмяНазвание модели со ссылкой
ПроектРодительский проект с иконкой
ВерсияНеизменяемая версия датасета, используемая для обучения, если таковая имеется
СтатусБейдж статуса обучения
ЗадачаТип задачи YOLO
ЭпохиЛучшая эпоха / общее количество эпох
mAP50-95Средняя точность (Mean average precision)
mAP50mAP при IoU 0.50
СозданоДата создания

Ultralytics Platform Datasets Models Tab Trained Models Table

Вкладка «Ошибки»#

Эта вкладка появляется только в том случае, если один или несколько файлов не прошли обработку.

Изображения, которые не прошли обработку, перечислены здесь с:

  • Баннер ошибки: общее количество изображений с ошибками и рекомендации
  • Таблица ошибок: имя файла, понятное описание ошибки, советы по исправлению и миниатюра для предпросмотра
  • Распространенные ошибки включают поврежденные файлы, неподдерживаемые форматы, слишком маленькие изображения (минимум 28px) и неподдерживаемые цветовые режимы

Ultralytics Platform Datasets Errors Tab Processing Failures

Распространенные ошибки обработки
ОшибкаПричинаИсправление
Невозможно прочитать файл изображенияПоврежденный или неподдерживаемый форматЭкспортируй повторно из графического редактора
Неполный или поврежденный файлФайл был усечен во время передачиСкачай исходный файл повторно
Изображение слишком маленькоеМинимальный размер стороны меньше 28pxИспользуй исходные изображения более высокого разрешения
Неподдерживаемый цветовой режимЦветовой режим CMYK или индексированные цветаКонвертируй в режим RGB

Вкладка «Версии»#

Создавай неизменяемые NDJSON-снимки твоего набора данных для воспроизводимого обучения. Каждая версия фиксирует количество изображений, количество классов, количество аннотаций и размер файла на момент создания.

СтолбецОписание
ВерсияНомер версии (v1, v2, ...)
ОписаниеОписание, предоставленное пользователем (редактируемое)
ИзображенияКоличество изображений на момент создания снимка
КлассыКоличество классов на момент создания снимка
АннотацииКоличество аннотаций на момент создания снимка
РазмерРазмер файла экспорта NDJSON
СозданоВремя создания версии
ДействияСкачать, восстановить или удалить

Чтобы создать версию:

  1. Открой вкладку Версии
  2. При необходимости введи описание (например, «Добавлено 500 изображений для обучения» или «Исправлены ошибки в разметке классов»)
  3. Нажми + New Version
  4. Новая версия появится в таблице
  5. Используй действия в строке, чтобы скачать, восстановить или удалить версию

Каждая версия нумеруется последовательно (v1, v2, v3...). Ты можешь скачать сохраненную версию, пока она остается в таблице версий.

Восстановление версии

Восстановление навсегда заменяет текущие изображения, разбиения, классы и разметку датасета выбранным снимком. Пересборка может занять несколько минут и её нельзя отменить, если предварительно не сохранить текущее состояние как другую версию.

Сохранение версии во время обучения

Включи опцию Save Dataset Version в диалоговом окне облачного обучения, чтобы связать модель с точной версией датасета, использованной для обучения. Platform повторно использует подходящую версию, если содержимое датасета не изменилось, и создает новую версию только тогда, когда оно изменилось.

Только готовые наборы данных

Создание версии становится доступным после того, как датасет достигнет статуса ready.

Когда создавать версии

Создавай версию до и после внесения значительных изменений в свой набор данных — добавления изображений, исправления аннотаций или перебалансировки выборок. Это позволит тебе сравнивать производительность моделей для разных состояний набора данных.

Размер файла NDJSON

Указан размер файла экспорта NDJSON, который содержит URL-адреса изображений и аннотации, а не сами изображения. Фактические данные изображений хранятся отдельно и доступны через подписанные URL.

Экспортировать набор данных#

Экспортируй набор данных для использования в автономном режиме с помощью загрузки NDJSON из заголовка набора данных или вкладки «Версии».

Для экспорта:

  1. Нажми кнопку Download (иконка загрузки) в заголовке набора данных
  2. Скачивай текущий снимок NDJSON напрямую
  3. Используй вкладку Versions, если тебе нужен неизменяемый пронумерованный снимок, который можно скачать повторно позже

Ultralytics Platform Datasets Export Ndjson Download Формат NDJSON хранит один объект JSON на каждую строку. Первая строка содержит метаданные датасета, за ней следует по одной строке на каждое изображение:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

Необязательный объект metadata на уровне изображения сохраняется при импорте файла NDJSON в Platform. Ты можешь просмотреть или отредактировать его на полноэкранной информационной панели изображения. Для программной загрузки архивов Dataset Ingest API принимает эквивалентную карту путей imageMetadata.

Подписанные URL

URL-адреса изображений в экспортированном файле NDJSON являются подписанными и действительны в течение 7 дней. Если тебе нужны свежие URL-адреса, повторно экспортируй набор данных или создай новую версию.

Полную спецификацию см. в документации по формату Ultralytics NDJSON.

Операции с изображениями#

Быстрые действия#

Нажми правой кнопкой мыши на любое изображение в режиме Grid или Compact, чтобы получить доступ к быстрым действиям:

ДействиеОписание
Move to Split (Переместить в выборку)Переназначь изображение в выборку Train, Val или Test
СкачиваниеСкачай исходный файл изображения
Delete (Удалить)Удали изображение из набора данных

Ultralytics Platform Datasets Image Card Context Menu

Одиночные и массовые операции

Контекстное меню изображения работает с одним изображением. Для массовых операций с несколькими изображениями используй представление Table с выбором через флажки.

Массовое перемещение в выборку#

Переназначь выбранные изображения в другую выборку внутри того же набора данных:

  1. Переключись в режим Table
  2. Выбери изображения с помощью флажков
  3. Нажми правой кнопкой мыши, чтобы открыть контекстное меню
  4. Выбери Move to split > Train, Validation или Test

Ты также можешь перетаскивать изображения на вкладки фильтра выборки в режиме сетки.

Организация выборок Train/Val

Загрузи все изображения в один набор данных, а затем используй массовое перемещение в выборку для распределения подмножеств на обучающую, валидационную и тестовую выборки.

Перераспределение выборок#

Перераспредели все изображения между обучающей, валидационной и тестовой выборками, используя пользовательские коэффициенты:

  1. Нажми на панель выборки в панели инструментов набора данных, чтобы открыть диалоговое окно Redistribute Splits
  2. Настрой процентное соотношение выборок, используя любой из методов ниже
  3. Изучи динамический предварительный просмотр количества изображений, чтобы подтвердить распределение
  4. Нажми Apply, чтобы случайным образом переназначить все изображения в соответствии с твоими процентами

Ultralytics Platform Datasets Split Redistribution Dialog Диалоговое окно предоставляет три способа установки целевых пропорций сплитов:

МетодОписание
Drag (Перетаскивание)Перетаскивай маркеры между цветными сегментами для визуальной настройки границ выборки
Type (Ввод)Отредактируй процентное значение для любой выборки (остальные две автоматически пересчитаются пропорционально)
Auto (Авто)Один клик для мгновенной установки соотношения 80/20 для обучающей/валидационной выборок при значении 0% для тестовой

Динамический предварительный просмотр точно показывает, сколько изображений попадет в каждую выборку, прежде чем ты применишь изменения.

Быстрая выборка 80/20

Нажми кнопку Auto, чтобы мгновенно установить рекомендуемое соотношение 80/20 для обучающей/валидационной выборок. Это наиболее распространенное соотношение для обучения.

Массовое удаление#

Удали несколько изображений за раз:

  1. Выбери изображения в режиме таблицы
  2. Нажми правую кнопку мыши и выбери Delete
  3. Подтверди удаление

URI набора данных#

Ссылайся на датасеты Platform, используя формат URI ul:// (см. раздел Использование датасетов платформы):

ul://username/datasets/dataset-slug

Ты также можешь напрямую вставить веб-URL датасета или модели (например, https://platform.ultralytics.com/username/datasets/dataset-slug); он автоматически преобразуется в URI ul://. Передача списка датасетов выполняет дообучение одной базовой модели на каждом из них последовательно, например model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Используй этот URI для обучения моделей из любого места:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Обучай где угодно с данными Platform

URI ul:// работает из любой среды:

  • Локальная машина: обучай на своем оборудовании, данные скачиваются автоматически
  • Google Colab: получай доступ к своим наборам данных Platform в ноутбуках
  • Удаленные серверы: обучай на облачных виртуальных машинах с полным доступом к набору данных

Доступные лицензии#

Platform поддерживает следующие лицензии для наборов данных:

ЛицензияТип
НетЛицензия не выбрана
CC0-1.0Общественное достояние
CC-BY-2.5Разрешительная
CC-BY-4.0Разрешительная
CC-BY-SA-4.0Копилефт
CC-BY-NC-4.0Некоммерческая
CC-BY-NC-SA-4.0Копилефт
CC-BY-ND-4.0Без производных работ
CC-BY-NC-ND-4.0Некоммерческая
Apache-2.0Разрешительная
MITРазрешительная
AGPL-3.0Копилефт
GPL-3.0Копилефт
Только для исследованийОграниченная
ДругоеПользовательская
Лицензии Copyleft

При клонировании набора данных с лицензией copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-4.0) клон наследует эту лицензию, а переключатель лицензий блокируется.

Настройки видимости#

Контролируй, кто может видеть твой набор данных:

НастройкаОписание
Private (Частный)Доступ есть у тебя и участников рабочего пространства с соответствующими разрешениями
Public (Публичный)Просмотр доступен всем, в том числе со страницы Explore

Видимость устанавливается при создании датасета в диалоговом окне New Dataset с помощью переключателя. Публичные датасеты видны на странице Explore.

Редактирование набора данных#

Метаданные набора данных редактируются непосредственно на странице набора данных — диалоговое окно не требуется:

  • Название: нажми на название датасета, чтобы отредактировать его. Изменения сохраняются автоматически при потере фокуса или по нажатию Enter.
  • Description: Нажми на описание (или заполнитель "Add a description..."), чтобы отредактировать его. Изменения сохраняются автоматически.
  • Task type: Нажми на значок задачи, чтобы выбрать другой тип задачи.
  • License: Нажми на селектор лицензии, чтобы изменить лицензию набора данных.
Изменение типа задачи

Каждое изображение хранит аннотации для всех типов задач вместе. Изменение типа задачи набора данных контролирует, какие аннотации видны в редакторе и включены в экспорт и обучение. Аннотации для других типов задач сохраняются в базе данных и появляются снова, когда ты переключаешься обратно.

Пользовательские метаданные#

Открой Ещё действия и выбери Информация, чтобы просмотреть два раздела:

  • Метаданные Ultralytics: Сведения о Platform только для чтения, такие как ID датасета, владелец, задача, количество изображений и аннотаций, регион хранения и временные метки
  • Пользовательские метаданные: Твой собственный JSON-объект для отслеживания происхождения, условий съёмки, ID клиентов, управления или других контекстных данных

Наблюдатели рабочей области могут просматривать метаданные, в то время как участники с правом редактирования могут заменять объект пользовательских метаданных. Сериализованный объект метаданных ограничен 500 000 символов, а каждый ключ верхнего уровня ограничен 128 символами. Сохрани пустой объект ({}), чтобы очистить пользовательские метаданные.

Клонирование набора данных#

При просмотре публичного датасета, владельцем которого ты не являешься, нажми Clone Dataset, чтобы открыть диалоговое окно клонирования. Проверь целевой воркспейсе, название, видимость и лицензию, а затем подтверди клонирование. Копия включает все изображения, аннотации и определения классов. Публичные исходные датасеты по умолчанию остаются публичными в воркспейсах, где видимость по умолчанию — публичная; клоны в корпоративных воркспейсах по умолчанию приватные. Если оригинальный датасет имеет лицензию copyleft, клон наследует её, и выбор лицензии будет заблокирован.

Отметить и поделиться#

  • Star: Нажми кнопку со звездочкой, чтобы добавить набор данных в закладки. Количество отметок звездочкой видно всем пользователям.
  • Share: Для публичных наборов данных нажми кнопку «поделиться», чтобы скопировать ссылку или отправить её в социальные сети.

Удалить набор данных#

Удаление набора данных, который тебе больше не нужен:

  1. Нажми значок корзины Delete dataset в заголовке датасета
  2. Подтверди действие в диалоговом окне: "Это переместит [name] в корзину. Ты сможешь восстановить его в течение 30 дней."
Корзина и восстановление

Удаленные датасеты перемещаются в корзину (Trash), а не удаляются навсегда. Ты можешь восстановить их в течение 30 дней из раздела Settings > Trash.

Обучение на наборе данных#

Начни обучение прямо из своего набора данных:

  1. Нажми New Model на странице датасета
  2. Выбери проект или создай новый
  3. Настрой параметры обучения
  4. Запусти обучение
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Подробности см. в разделе Облачное обучение.

FAQ#

Что происходит с моими данными после загрузки?#

Твои данные обрабатываются и хранятся в выбранном регионе (US, EU или AP). Изображения:

  1. Проверяются на формат и размер
  2. Отклоняются, если минимальный размер менее 28px
  3. Нормализуются, если размер превышает 4096px (с сохранением соотношения сторон; кодируются для оптимизированного хранения)
  4. Хранятся с использованием контентно-адресуемого хранилища (CAS) с хешированием XXH3-128
  5. Миниатюры создаются в формате WebP размером 256px для быстрого просмотра

Как работает хранилище?#

Ultralytics Platform использует Content-Addressable Storage (CAS) для эффективного хранения:

  • Deduplication: Идентичные байты изображений в одной области данных используют один и тот же базовый объект
  • Integrity: Хеширование XXH3-128 обеспечивает целостность данных
  • Efficiency: Клоны используют объекты CAS вместо копирования байтов изображений, при этом они по-прежнему учитываются в квоте хранилища целевого рабочего пространства
  • Regional: Данные остаются в выбранном тобой регионе (US, EU или AP)

Можно ли добавить изображения в существующий набор данных?#

Да. Перетащи файлы в галерею датасета или нажми значок загрузки в шапке страницы, что напрямую откроет встроенный диалог выбора файлов твоего браузера. Новая статистика рассчитывается автоматически после завершения обработки.

Как перемещать изображения между сплитами?#

Используй функцию массового перемещения в сплит:

  1. Выбери изображения в режиме таблицы
  2. Нажми правую кнопку мыши и выбери Move to split
  3. Выбери целевой сплит (Train, Validation или Test)

Какие форматы меток поддерживаются?#

Ultralytics Platform поддерживает метки YOLO, COCO JSON, Ultralytics NDJSON и загрузку необработанных изображений:

Один файл .txt на каждое изображение с нормализованными координатами (диапазон 0-1):

ЗадачаФорматПример
Обнаружениеclass cx cy w h0 0.5 0.5 0.2 0.3
Сегментацияclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
Позаclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
КлассификацияСтруктура каталоговtrain/cats/, train/dogs/

Флаги видимости поз: 0=не размечено, 1=размечено, но перекрыто, 2=размечено и видно.

Могу ли я аннотировать один и тот же набор данных для нескольких типов задач?#

Да. Каждое изображение хранит аннотации для всех 6 типов задач (detect, segment, semantic, classify, pose, OBB) вместе. Ты можешь переключить активный тип задачи датасета в любой момент без потери существующих аннотаций. В редакторе отображаются и включаются в экспорты и обучение только аннотации, соответствующие активному типу задачи — аннотации для других задач сохраняются и появляются снова, когда ты переключаешься обратно.

Комментарии