Ultralytics YOLO27:

Датасеты#

Датасеты Ultralytics Platform обеспечивают удобное решение для управления данными для обучения. После загрузки платформа автоматически обрабатывает изображения, метки и статистику.

Датасет готов к обучению после завершения обработки, если в нём есть хотя бы одно изображение в сплите train, хотя бы одно изображение в сплите val или test, а также хотя бы одно размеченное изображение. В заголовке датасета отображается значок Ready, когда выполнены все три условия, и значок Not Ready в противном случае — нажми на значок, чтобы точно узнать, какое условие не выполнено.

Собери изображения с помощью агентов#

Используй агентов, чтобы добавлять изображения в датасет, когда детектирование модели удовлетворяет условию, например уверенности в выбранном диапазоне. Подключи условие к блоку Dataset и выбери целевой набор, который ты можешь редактировать. Изображения поступают без разметки в сплит train; существующие копии пропускаются. Проверь и разметь изображения с помощью существующего редактора разметки.

Загрузка датасета#

Ultralytics Platform поддерживает несколько форматов загрузки для большей гибкости.

Данные уже хранятся в другом месте?

Если у тебя уже есть датасеты в Roboflow, используй Integrations, чтобы импортировать их напрямую — ручной экспорт или повторная загрузка не нужны. Данные в Google Cloud Storage, Amazon S3 или Azure Blob Storage можно использовать на месте через облачное хранилище. Рабочие пространства Enterprise могут использовать On Premise, чтобы индексировать данные и обучаться на них локально, не отправляя пиксели в Platform.

Поддерживаемые форматы#

ФорматРасширенияПримечанияМаксимальный размер
JPEG.jpg, .jpegСамый распространённый, рекомендуется50 MB
PNG.pngПоддерживает прозрачность50 MB
WebP.webpСовременный, хорошее сжатие50 MB
BMP.bmpБез сжатия50 MB
TIFF.tiff, .tifВысокое качество50 MB
HEIC.heicФотографии с iPhone50 MB
AVIF.avifФормат нового поколения50 MB
JP2.jp2JPEG 200050 MB
DNG.dngНеобработанные данные камеры50 MB
MPO.mpoОбъект с несколькими изображениями50 MB

Поддержка видеокодеков#

Одного расширения файла недостаточно: видео всё равно может не обработаться, если его кодек нельзя декодировать во время обработки.

Используй H.264 MP4

Видео H.264 в контейнере MP4 поддерживается большинством декодеров и является самым безопасным выбором. Если видео не обрабатывается, перекодируй его с помощью FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Подготовка датасета#

Платформа поддерживает Ultralytics YOLO, COCO, семантические PNG-маски, датасеты глубин, Ultralytics NDJSON и загрузку сырых (неразмеченных) данных:

Используй стандартную структуру каталогов YOLO с файлом data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

Файл YAML определяет конфигурацию датасета:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Необработанные данные

Необработанные данные: загружай неразмеченные изображения (без меток). Это удобно, если ты планируешь размечать их непосредственно на платформе с помощью редактора аннотаций.

Плоская структура каталогов

Можно также загружать изображения без явно заданных папок сплитов. Во время загрузки Platform учитывает активную целевую папку сплита. Если целевой сплит не задан и после загрузки val остаётся пустым — или содержит менее двух парных карт глубины — датасеты не для классификации автоматически перемещают изображения для обучения в val, чтобы датасет сразу был готов к обучению. Датасеты для классификации пропускаются, поскольку в них сплиты определяются каталогами. Позже изображения всегда можно переназначить с помощью массового перемещения в сплит или перераспределения по сплитам.

Автоматическое определение формата

Формат определяется автоматически: датасеты с файлом data.yaml, содержащим ключи names, train или val, считаются датасетами YOLO. Датасеты с файлами JSON COCO, содержащими массивы images, annotations и categories, считаются датасетами COCO. Экспорты .ndjson импортируются как Ultralytics NDJSON. Датасеты, содержащие только изображения без аннотаций, считаются необработанными.

Если архив содержит несколько файлов YAML, Platform отдаёт предпочтение стандартным именам (data.yaml, data.yml, dataset.yaml, dataset.yml), расположенным ближе всего к корню архива. Оставляй в каждом архиве один файл YAML с понятным именем, чтобы избежать неоднозначности.

XML Pascal VOC не импортируется

Файлы меток в формате XML Pascal VOC обнаруживаются, но их аннотации не импортируются — изображения загружаются без разметки. Перед началом загрузки Platform предупреждает тебя ("Обнаружены метки Pascal VOC"). Сначала преобразуй XML VOC в YOLO или COCO; см. инструменты преобразования форматов.

Если метки ссылаются на идентификаторы классов, но имена классов не указаны, Platform создаёт плотные имена-заполнители (class0, class1, …), которые позже можно переименовать на вкладке Classes.

Подробности о форматах для конкретных задач см. в разделах поддерживаемые задачи и Обзор датасетов.

Процесс загрузки#

Чтобы создать датасет:

  1. Перейди в Annotate на боковой панели
  2. Нажми New Dataset
  3. Выбери вкладку источника данных (см. раздел Источники данных ниже)
  4. Укажи имя — URL-слаг создаётся автоматически, и его можно отредактировать — и при необходимости добавь описание
  5. Выбери тип задачи (см. поддерживаемые задачи), при необходимости лицензию (см. доступные лицензии) и видимость (публичный или приватный)
  6. Нажми Create & Upload для локальных файлов, Create & Import для URL или подключённого источника либо Create Dataset, чтобы начать с пустого датасета

Ultralytics Platform Datasets Upload Dialog Task Selector

Чтобы добавить файлы в существующий датасет, открой страницу датасета и перетаси файлы в галерею или нажми значок загрузки в шапке страницы. Значок загрузки открывает нативный выбор файлов твоего браузера напрямую, так как задача датасета уже определена.

Источники данных#

Диалог New Dataset предлагает четыре источника:

ИсточникОписание
ЗагрузкаПеретащи файлы или найди их на компьютере — изображения, видео, архивы или NDJSON
URLВставь прямую ссылку на файл .zip, .tar, .tar.gz, .tgz или .ndjson; Platform загрузит и обработает его на стороне сервера
CloudИспользуй данные на месте из Google Cloud Storage, Amazon S3 или Azure Blob Storage (Pro и Enterprise)
On PremiseИндексируй данные и обучайся на них, не покидая собственные машины, с помощью воркеров On Premise (Enterprise)
Ограничения импорта по URL

Импорт по URL ограничен как лимитом твоего тарифного плана на одну загрузку (10 ГБ Free / 20 ГБ Pro / 50 ГБ Enterprise), так и оставшимся объёмом хранилища — применяется меньшее из этих значений. Ссылка должна быть общедоступной по HTTP или HTTPS и заканчиваться поддерживаемым расширением.

До начала загрузки#

Platform проверяет файлы в браузере до начала загрузки, поэтому распространённые проблемы обнаруживаются сразу, а не после длительной передачи данных. Архивы проверяются на повреждение, пустоту, защиту паролем и ошибки синтаксиса YAML, а слишком большие файлы перечисляются по именам.

Затем могут появиться два диалога:

Если в архиве указаны имена классов, а в датасете уже есть классы, в диалоге Map imported classes отображается по одной строке для каждого входящего класса. Для каждого класса выбери существующий класс, с которым его нужно объединить, создай новый класс или пропусти его. Точные совпадения имён выбираются заранее, а пропущенные классы и их аннотации не импортируются.

После загрузки платформа автоматически обрабатывает твои данные:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Проверка: проверка формата и размера
  2. Нормализация: большие изображения изменяются (максимум 4096px, минимальный размер — 28px), изображения в градациях серого преобразуются в RGB, прозрачность заменяется белым фоном, применяется ориентация EXIF
  3. Миниатюры: создаются превью WebP размером 256px
  4. Разбор разметки: извлекаются метки YOLO, COCO и NDJSON
  5. Статистика: вычисляются распределения классов и размеры изображений
Кодирование сохранённых изображений

Исходные изображения AVIF и WebP сохраняются побайтно, если изменение размера или цвета не требуется. Все остальные изображения кодируются заново: исходные изображения WebP остаются в формате WebP, а все остальные форматы (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) преобразуются в JPEG с качеством 92. Исходное имя файла и расширение сохраняются в метаданных.

Индикатор выполнения загрузки наборов данных в Ultralytics Platform

Проверка перед загрузкой

Ты можешь проверить свой набор данных локально перед загрузкой:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Требования к размеру изображений

Короткая сторона изображения должна быть не меньше 28px. Изображения меньшего размера отклоняются во время обработки. Изображения, у которых длинная сторона превышает 4096px, автоматически изменяются с сохранением соотношения сторон.

Просмотр изображений#

Просматривай изображения своего набора данных в нескольких режимах отображения.

Открой панель кластеризации на панели инструментов галереи, чтобы исследовать свой набор данных в виде интерактивной двумерной диаграммы рассеяния.

ВидОписание
СеткаСетка миниатюр с наложенной разметкой (по умолчанию)
КомпактныйУменьшенные миниатюры для быстрого просмотра
ТаблицаСписок с миниатюрой, именем файла, размерами, размером, подмножеством, классами и количеством меток

Представление галереи наборов данных Ultralytics Platform в виде сетки с разметкой

Сортировка и фильтрация#

Изображения можно сортировать и фильтровать для эффективного просмотра:

Каждый параметр переключается между сортировкой по возрастанию (↑) и убыванию (↓):

СортировкаОписание
Создано ↑/↓Порядок загрузки (по умолчанию ↓)
Имя ↑/↓Имя файла в алфавитном порядке
Высота ↑/↓Высота изображения в пикселях
Ширина ↑/↓Ширина изображения в пикселях
Размер ↑/↓Размер файла на диске
Разметка ↑/↓Количество объектов разметки на изображении
Большие наборы данных

Для наборов данных, содержащих более 100 000 изображений, сортировка по имени, ширине, высоте и размеру скрыта, чтобы галерея оставалась отзывчивой. Сортировка по дате создания и количеству объектов разметки остаётся доступной.

Поиск изображений без разметки

Используй фильтр Annotations, установленный в значение Unannotated, чтобы быстро находить изображения, которым всё ещё нужна разметка. Это особенно полезно для больших наборов данных, где нужно отслеживать прогресс разметки.

Поиск пользовательских метаданных

Поле поиска находится справа на панели инструментов галереи и фильтрует все режимы отображения — сетку, компактный режим и таблицу. Оно ищет совпадения в имени файла изображения (расширение файла можно не указывать), а также в ключах пользовательских метаданных, скалярных значениях и элементах массивов, поэтому изображение с именем img_0042, содержащее {"ship_type": "yacht"}, находится при поиске по img_0042 или yacht.

Значения, вложенные во вложенные объекты, не учитываются. Вставка 24-символьного ID изображения выполняет поиск именно этого изображения напрямую, минуя текстовый поиск.

Полноэкранный просмотрщик#

Нажми на любое изображение, чтобы открыть полноэкранный просмотрщик со следующими возможностями:

  • Навигация: используй клавиши со стрелками или превью миниатюр для просмотра
  • Информация об изображении: просматривай свойства, сгенерированные Platform, пользовательские метаданные и встроенные метаданные файла, например EXIF
  • Пользовательские метаданные: владельцы и редакторы могут добавлять или заменять объект JSON, включая вложенные значения объёмом до 500 000 сериализованных символов и ключи верхнего уровня длиной до 128 символов
  • Разметка: переключай видимость наложенной разметки
  • Разбивка по классам: количество меток для каждого класса с цветовыми индикаторами
  • Разметить: если у тебя есть доступ на редактирование, элементы управления разметкой становятся активными сразу после открытия полноэкранного просмотрщика на компьютере
  • Скачать: скачать исходный файл изображения
  • Удалить: удалить изображение из набора данных
  • Масштаб: используй Cmd/Ctrl+Scroll, Cmd/Ctrl++ или Cmd/Ctrl+= для увеличения масштаба и Cmd/Ctrl+- для уменьшения
  • Сбросить вид: используй Cmd/Ctrl + 0 или кнопку сброса, чтобы вписать изображение в просмотрщик
  • Панорамирование: удерживай Space и перетаскивай, чтобы панорамировать холст при увеличенном масштабе
  • Просмотр пикселей: переключай пиксельный рендеринг для детального изучения
  • Шторка глубины: в наборах данных с глубиной перетаскиваемый разделитель переключает отображение между RGB-изображением и его цветной картой глубины

Полноэкранный просмотрщик наборов данных Ultralytics Platform с панелью метаданных

Фильтрация по подмножеству#

Фильтруй изображения по подмножеству набора данных:

ВыборкаНазначение
ОбучениеИспользуется для обучения модели
ValИспользуется для проверки во время обучения
TestИспользуется для итоговой оценки

Кластеризация#

Панель Clustering проецирует твой набор данных на интерактивную двумерную диаграмму рассеяния, где визуально похожие изображения располагаются близко друг к другу. Используй её, чтобы находить кластеры, выявлять дубликаты и выбросы, а также изучать распределение подмножеств или классов в данных — не покидая галерею. Открой её с помощью значка диаграммы рассеяния на панели инструментов галереи на странице любого набора данных.

Пустое состояние панели кластеризации наборов данных Ultralytics Platform

Запуск анализа#

Начни анализ:

  1. Открой набор данных и нажми на значок диаграммы рассеяния на панели инструментов галереи
  2. Нажми Analyze Dataset
  3. Дождись завершения индикатора выполнения — результаты появятся в той же панели

Анализ выполняется в фоновом режиме в два этапа — Computing embeddings и Clustering — и может занять несколько минут в зависимости от размера набора данных. Ты можешь закрыть панель или покинуть страницу и вернуться позже.

Требования для анализа

Для анализа набор данных должен содержать от 20 до 200 000 изображений без ошибок. Подключённые наборы данных, использующие облачное хранилище или локальное хранилище On Premise, пока не поддерживаются.

Визуализация#

После завершения анализа на панели отображается двумерная диаграмма рассеяния всех проанализированных изображений с легендой и счётчиком точек. Фильтры галереи (подмножество, класс, с разметкой или без разметки) затемняют точки, не соответствующие фильтру, чтобы ты мог сосредоточиться на нужном подмножестве, — после этого счётчик показывает visible / total points.

Точечная диаграмма кластеризации наборов данных Ultralytics Platform

Цветовая группировка#

Измени способ закрашивания точек данных с помощью списка Color by на панели инструментов. Переключай режимы просмотра в любое время — график мгновенно перекрашивается, чтобы ты мог видеть распределение разбиений, классов или свойств изображений по кластерам:

ПараметрЗакрашивание
РазбиенияTrain / Val / Test
КлассыПервый класс аннотации на каждом изображении
ШиринаШирина изображения
ВысотаВысота изображения
РазмерРазмер файла
АннотацииКоличество аннотаций на изображение

Режимы цветовой группировки кластеризации наборов данных Ultralytics Platform

Выделение лассо#

Обведи произвольную область, чтобы выделить точки на графике. Галерея отфильтруется и покажет соответствующие изображения, чтобы ты мог просмотреть, переименовать, переместить или удалить их с помощью обычных операций с изображениями.

Очистить выделение

Над графиком отображается количество выбранных точек — нажми ×, чтобы очистить выделение лассо и вернуться к полной галерее.

Размер выделения

Лассо обрабатывает не более 1 000 изображений. Если выделение содержит больше изображений, Platform показывает 1 000 случайно выбранных изображений и предлагает обвести меньшую область.

Панорамирование и масштабирование#

Перемещайся по большим точечным диаграммам с помощью мыши и клавиатуры или используй кнопки масштабирования в левом нижнем углу графика:

ВводДействие
ПрокруткаПанорамирование графика в 2D
Cmd/Ctrl+ПрокруткаУвеличение или уменьшение масштаба относительно положения курсора
Удерживать пробелПереключение в режим панорамирования перетаскиванием
Кнопка сбросаВернуться к полному охвату графика

Повторный анализ#

Если после анализа набор данных изменился — например, появились новые изображения или количество проанализированных изображений больше не совпадает с набором данных — в верхней части панели для владельцев и редакторов появляется кнопка Re-analyze.

Нажми Re-analyze, чтобы заново вычислить эмбеддинги и 2D-проекцию.

Поиск похожих изображений#

Те же векторные представления обеспечивают поиск сходства по общедоступным датасетам. В редактируемом датасете щелкни правой кнопкой мыши по изображению в виде Сетка (Grid) или Компактный (Compact) (или по одной выбранной строке в виде Таблица (Table)) и выбери Найти похожие изображения (Find similar images). В диалоговом окне отображается до 24 ближайших общедоступных изображений с указанием их исходного датасета, лицензии и оценки сходства, за исключением изображений, которые твой датасет уже содержит, и копий выбранного изображения в других датасетах. Выбери нужные изображения и нажмите Добавить в датасет (Add to dataset): они добавляются в сплит train в качестве неразмеченных изображений, учитываются в выделенном объеме памяти и готовы к разметке.

Изображение без векторного представления — в датасете, который еще не проанализирован или в который оно было добавлено после последнего анализа — отображает Analyze this dataset in Clustering to find similar images. Диалоговое окно недоступно для подключенных датасетов. Диагностика валидации модели для каждого изображения выполняет аналогичный поиск, начиная с изображений с худшими результатами.

Вкладки набора данных#

На каждой странице набора данных может отображаться до шести вкладок в зависимости от состояния набора данных и твоих разрешений:

Вкладка Images#

Представление по умолчанию с галереей изображений и наложениями аннотаций. Поддерживаются режимы просмотра в виде сетки, компактный и табличный. Перетащи файлы сюда, чтобы добавить изображения.

Вкладка Classes#

Эта вкладка отображается, если в наборе данных есть изображения, а задача содержит классы.

Управляй классами аннотаций своего набора данных:

  • Гистограмма классов: Столбчатая диаграмма с количеством аннотаций для каждого класса, отсортированная по частоте, с переключателем линейной/логарифмической шкалы
  • Таблица классов: Сортируемая таблица с поиском, содержащая индекс, название, количество аннотаций и количество изображений
  • Изменение названий классов: Нажми на название любого класса, чтобы переименовать его прямо в таблице
  • Изменение цветов классов: Нажми на образец цвета, чтобы изменить цвет класса
  • Добавление нового класса: Используй поле ввода внизу, чтобы добавить классы
  • Объединение классов: Выбери две или более строки и нажми Merge into one
  • Удаление классов: Выбери одну или несколько строк и нажми Delete

Гистограмма и таблица вкладки Classes наборов данных Ultralytics Platform

Логарифмическая шкала для несбалансированных наборов данных

Если в твоём наборе данных наблюдается дисбаланс классов (например, 10 000 аннотаций «person» и всего 50 аннотаций «bicycle»), используй переключатель Log Scale на гистограмме классов, чтобы наглядно отобразить все классы.

Объединение классов#

Объединение консолидирует дублирующиеся или пересекающиеся метки — например, объединяет car, automobile и vehicle в один класс:

  1. Выбери два или более класса с помощью флажков в строках
  2. Нажми Merge into one в заголовке таблицы или щёлкни правой кнопкой мыши по выделению
  3. Выбери, какой из выбранных классов будет целевым, в который будут объединены остальные
  4. Подтверди действие

Каждая аннотация, принадлежащая исходным классам, переназначается целевому классу, а исходные классы удаляются. Аннотации не удаляются, поэтому общее количество аннотаций в наборе данных не изменяется.

Удаление классов#

  1. Выбери один или несколько классов с помощью флажков в строках
  2. Нажми Delete в заголовке таблицы или щёлкни правой кнопкой мыши по выделению
  3. Подтверди действие

Удаление класса удаляет сам класс и все его аннотации. В наборах данных для классификации метки удаляются, но изображения сохраняются и становятся неаннотированными.

Смещение индексов классов

Идентификаторы классов определяются их позицией. При объединении или удалении класса индекс каждого последующего класса уменьшается на единицу, чтобы закрыть пробел, поэтому экспорты и файлы меток, созданные до изменения, больше не соответствуют новым индексам. Сначала создай версию, если тебе нужна прежняя нумерация.

Выборка для статистики

Количество классов вычисляется не более чем для 100 000 изображений. В больших наборах данных над гистограммой отображается примечание: «На основе поднабора этого набора данных, содержащего 100 000 изображений».

Вкладка Charts#

Эта вкладка отображается, если в наборе данных есть изображения.

Автоматически вычисляемая статистика набора данных:

Диаграммы отображаются в этом порядке, а каждая диаграмма пропускается, если для неё нет данных — в наборе данных с исходными изображениями не отображаются диаграммы аннотаций, а Points per Instance появляется только для данных сегментации и поз:

ГрафикОписание
Распределение по разбиениямКольцевая диаграмма с количеством изображений в train/val/test и долей размеченных изображений
Основные классыКольцевая диаграмма 10 наиболее часто встречающихся классов аннотаций, остальные объединены в категорию «Другие»
Размеры изображенийГистограмма распределения ширины и высоты изображений (наложенные распределения) со средним значением
Размер файлов изображенийГистограмма распределения размеров файлов изображений
Размеры изображений в 2DТепловая карта ширины и высоты в 2D с направляющими линиями соотношения сторон
Расположение аннотацийТепловая карта центров ограничивающих рамок в 2D
Форматы изображенийРаспределение форматов исходных изображений (JPG, PNG и т. д.)
Размеры ограничивающих рамокГистограмма ширины и высоты ограничивающих рамок (наложенные распределения)
Объекты на изображениеГистограмма количества аннотаций на изображение
Точек на экземплярКоличество вершин полигона или ключевых точек для каждой аннотации (сегментация/поза)

Сетка статистики вкладки Charts наборов данных Ultralytics Platform

Кэширование статистики

Platform кэширует вычисленную статистику и аннулирует кэш при изменении изображений, аннотаций, классов или разбиений. В наборах данных размером более 100 000 изображений диаграммы вычисляются по поднабору из 100 000 изображений, что отмечается над сеткой.

Полноэкранные тепловые карты

Нажми кнопку разворачивания на любой тепловой карте, чтобы открыть её в полноэкранном режиме. Это обеспечивает более крупное и подробное представление, полезное для понимания пространственных закономерностей в больших наборах данных.

Вкладка Models#

Просматривай все модели, обученные на этом датасете, в таблице с поиском:

СтолбецОписание
НазваниеНазвание модели со ссылкой
ПроектРодительский проект со значком
ВерсияНеизменяемая версия датасета, использованная для обучения, если есть
СтатусБейдж статуса обучения
ЗадачаТип задачи YOLO
ЭпохиЛучшая эпоха / общее число эпох
mAP50-95Средняя точность
mAP50mAP при IoU 0.50
СозданоДата создания

Вкладка моделей датасетов Ultralytics Platform, таблица обученных моделей

Вкладка ошибок#

Эта вкладка появляется только при ошибке обработки одного или нескольких файлов.

Здесь перечислены изображения, обработка которых завершилась ошибкой, с указанием:

  • Баннер ошибки: общее количество изображений с ошибками и рекомендации
  • Таблица ошибок: имя файла, понятное описание ошибки, рекомендации по исправлению и миниатюра для предварительного просмотра
  • К распространённым ошибкам относятся повреждённые файлы, неподдерживаемые форматы, слишком маленькие изображения (минимум 28px) и неподдерживаемые цветовые режимы

Вкладка ошибок датасетов Ultralytics Platform, сбои обработки

Распространённые ошибки обработки
ОшибкаПричинаИсправление
Не удалось прочитать файл изображенияПовреждённый или неподдерживаемый форматПовторно экспортируй изображение из редактора
Неполный или повреждённый файлФайл был обрезан во время передачиСкачай исходный файл заново
Неподдерживаемый формат изображенияФормат, который Platform не может декодироватьПреобразуй в JPG, PNG или WebP
Ошибка разрешений файлаФайл заблокирован или защищён от чтенияРазблокируй файл и загрузи его повторно
Изображение слишком маленькоеМинимальный размер меньше 28pxИспользуй исходные изображения с более высоким разрешением
Неподдерживаемый цветовой режимЦветовой режим CMYK или индексированныйПреобразуй в режим RGB

Вкладка версий#

Создавай неизменяемые снимки датасета в формате NDJSON для воспроизводимого обучения. Каждая версия сохраняет количество изображений, классов и аннотаций, а также размер файлов на момент создания.

СтолбецОписание
ВерсияНомер версии (v1, v2, ...)
ОписаниеОписание, указанное пользователем (можно изменить)
ИзображенияКоличество изображений на момент создания снимка
КлассыКоличество классов на момент создания снимка
АннотацииКоличество аннотаций на момент создания снимка
РазмерРазмер экспортируемого файла NDJSON
СозданоДата создания версии
ДействияСкачать или восстановить

Чтобы создать версию:

  1. Открой вкладку Versions
  2. При желании введи описание (например, "Добавлено 500 обучающих изображений" или "Исправлены неправильно размеченные классы")
  3. Нажми New Version
  4. Новая версия появится в таблице

Каждая версия получает последовательный номер (v1, v2, v3...) и является неизменяемой — версии нельзя редактировать или удалять, можно изменить только их описания. В любое время используй действия в строке, чтобы скачать или восстановить любую версию.

Восстановление версии

Восстановление заменяет текущие изображения, разбиения, классы и аннотации датасета выбранным снимком. Отменить это действие нельзя, если заранее не сохранить текущее состояние как другую версию. Во время перестроения датасет заблокирован в статусе processing. При восстановлении ничего не загружается повторно, поэтому даже для больших датасетов эта операция обычно выполняется быстро.

Сохранение версии во время обучения

Включи Save Dataset Version в диалоговом окне облачного обучения, чтобы связать модель с точной версией датасета, использованной для обучения. Platform повторно использует соответствующую версию, если содержимое датасета не изменилось, и создаёт новую версию только при наличии изменений.

Только готовые датасеты

Создание и восстановление версий доступны после того, как датасет получает статус ready. Версии недоступны для подключённых облачных датасетов и датасетов On Premise.

Когда создавать версии

Создавай версию до и после существенных изменений в датасете — добавления изображений, исправления аннотаций или перебалансировки разбиений. Так ты сможешь сравнивать производительность модели на разных состояниях датасета.

Размер файла NDJSON

Указанный размер — это размер экспортируемого файла NDJSON, содержащего URL изображений и аннотации, а не сами изображения. Фактические данные изображений хранятся отдельно и доступны через подписанные URL. Файл снимка всё равно учитывается в квоте хранилища рабочего пространства, поэтому создание версии завершается ошибкой, если свободного места не осталось.

Экспорт датасета#

Экспортируй датасет для автономного использования, скачав файл NDJSON из заголовка датасета или вкладки версий.

Чтобы экспортировать:

  1. Нажми кнопку Download (значок скачивания) в заголовке датасета
  2. Скачай текущий снимок NDJSON напрямую
  3. Используй вкладку Versions, если нужен неизменяемый снимок с номером, который можно повторно скачать позже

Ultralytics Platform Datasets Export Ndjson Download

Формат NDJSON хранит один объект JSON на строку. Первая строка содержит метаданные датасета, за которыми следует по одной строке на изображение:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

Необязательный объект уровня изображения metadata сохраняется при импорте файла NDJSON в Platform. Просмотреть или изменить его можно на полноэкранной панели информации об изображении. Для программной загрузки архивов API приёма данных датасета принимает эквивалентную карту путей imageMetadata.

Датасеты для задач позы также содержат поле kpt_shape в строке заголовка датасета, если оно ещё не задано, его значение определяется по аннотациям.

Экспорты глубины содержат "task": "depth" и "depth_scale": 1000 в строке датасета. Каждая строка изображения включает depth.url для соответствующего обычного PNG uint16. Ultralytics параллельно скачивает URL изображения и карты глубины и записывает обучающий YAML с тем же масштабом, поэтому файл NDJSON можно напрямую передать в model.train(data=...).

Подписанные URL

URL изображений в экспортированном NDJSON подписаны и действительны в течение 7 дней. Если датасет не изменился, Platform использует кэшированный экспорт до 6 дней, поэтому после нового скачивания всегда остаётся как минимум день действия URL. Если новые URL нужны раньше, измени датасет или создай новую версию.

Датасеты On Premise

Экспорт недоступен для датасетов On Premise, поскольку байты их изображений никогда не поступают в Platform.

Полную спецификацию см. в документации по формату NDJSON Ultralytics.

Операции с изображениями#

Быстрые действия#

Щёлкни правой кнопкой мыши по любому изображению в представлении Grid или Compact, чтобы открыть быстрые действия:

ДействиеОписание
Переместить в разбиениеНазначить изображение в разбиение Train, Val или Test
Найти похожие изображенияПоиск похожих изображений в общедоступных датасетах и их добавление (см. Найти похожие изображения)
Сгенерировать похожие изображенияСоздай до 16 созданных искусственным интеллектом вариантов изображения (по умолчанию четыре) и добавь те, которые ты оставляешь, в качестве неразмеченных изображений
СкачатьСкачать исходный файл изображения
УдалитьУдалить изображение из датасета

Контекстное меню карточки изображения датасетов Ultralytics Platform

Одно изображение или пакетная операция

Контекстное меню изображения применяется к одному изображению. Для пакетных операций с несколькими изображениями используй представление Table с выбором с помощью флажков.

Пакетное перемещение в разбиение#

Переназначь выбранные изображения в другой сплит того же датасета:

  1. Переключись в режим Таблица
  2. Выбери изображения с помощью флажков
  3. Щёлкни правой кнопкой мыши, чтобы открыть контекстное меню
  4. Выбери Move to split > Обучение, Валидация или Тест

Также можно перетаскивать изображения на вкладки фильтра сплитов в режиме сетки. Если при перемещении изображения возникнет конфликт с идентичным изображением, уже находящимся в целевом сплите, Platform предложит пропустить его, оставить оба или заменить существующее.

Организация сплитов обучения и валидации

Загрузи все изображения в один датасет, а затем используй массовое перемещение в сплит, чтобы распределить подмножества по сплитам обучения, валидации и тестирования.

Перераспределение сплитов#

Распредели все изображения по сплитам обучения, валидации и тестирования с помощью пользовательских соотношений:

  1. Нажми на панель сплитов на панели инструментов датасета, чтобы открыть диалоговое окно Перераспределение сплитов
  2. Настрой проценты сплитов любым из способов ниже
  3. Проверь динамический предварительный просмотр количества изображений, чтобы подтвердить распределение
  4. Нажми Применить, чтобы случайным образом переназначить все изображения согласно заданным процентам

Ultralytics Platform Datasets Split Redistribution Dialog

Диалоговое окно предоставляет три способа настройки целевых коэффициентов разделения:

МетодОписание
ПеретаскиваниеПеретаскивай маркеры между цветными сегментами, чтобы визуально настроить границы сплитов
ВводИзмени процентное значение для любого сплита (два других сплита автоматически пропорционально перебалансируются)
АвтоматическиОдним нажатием мгновенно задай соотношение обучения и валидации 80/20, установив для тестового сплита значение 0%

Динамический предварительный просмотр показывает точное количество изображений, которое попадёт в каждый сплит, до применения изменений.

Быстрое разделение 80/20

Нажми кнопку Автоматически, чтобы мгновенно задать рекомендуемое соотношение обучения и валидации 80/20. Это наиболее распространённое соотношение для обучения.

Массовое удаление#

Удаляй несколько изображений одновременно:

  1. Выбери изображения в режиме таблицы
  2. Щёлкни правой кнопкой мыши и выбери Delete или нажми Cmd/Ctrl+Delete
  3. Подтверди удаление

URI датасета#

Обращайся к датасетам Platform, используя формат URI ul:// (см. Использование датасетов Platform):

ul://username/datasets/dataset-slug

Также можно напрямую вставить веб-URL датасета или модели (например, https://platform.ultralytics.com/username/datasets/dataset-slug); он автоматически преобразуется в URI ul://. Передача списка датасетов последовательно дообучает одну базовую модель на каждом из них, например model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Используй этот URI для обучения моделей из любой среды:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Обучение в любом месте с данными Platform

URI ul:// работает из любой среды:

  • Локальный компьютер: обучай модель на своём оборудовании, данные загружаются автоматически
  • Google Colab: получай доступ к своим датасетам Platform в ноутбуках
  • Удалённые серверы: обучай модели на облачных виртуальных машинах с полным доступом к датасету

Доступные лицензии#

Platform поддерживает следующие лицензии для датасетов:

ЛицензияТип
НетЛицензия не выбрана
CC0-1.0Общественное достояние
PDM-1.0Общественное достояние
CC-BY-2.5Разрешительная
CC-BY-3.0Разрешительная
CC-BY-4.0Разрешительная
CC-BY-NC-2.0Для некоммерческого использования
CC-BY-NC-3.0Для некоммерческого использования
CC-BY-NC-4.0Для некоммерческого использования
CC-BY-SA-3.0Копилефт
CC-BY-SA-4.0Копилефт
CC-BY-NC-SA-3.0Копилефт
CC-BY-NC-SA-4.0Копилефт
CC-BY-ND-4.0Без производных произведений
CC-BY-NC-ND-2.0Для некоммерческого использования
CC-BY-NC-ND-4.0Для некоммерческого использования
Apache-2.0Разрешительная
MITРазрешительная
BSD-3-ClauseРазрешительная
AGPL-3.0Копилефт
GPL-2.0Копилефт
GPL-3.0Копилефт
LGPL-3.0Копилефт
ODbL-1.0Копилефт
DbCL-1.0Требуется ODbL
Только для исследованийОграниченная
ДругаяПользовательская
Лицензии с копилефтом

При клонировании набора данных с лицензией copyleft (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0) клон наследует лицензию, а выбор лицензии блокируется.

Настройки видимости#

Управляй тем, кто может видеть твой датасет:

НастройкаОписание
ПриватныйТы и пользователи рабочего пространства с соответствующими разрешениями можете получить доступ
ПубличныйПросматривать может любой пользователь, в том числе со страницы Explore

Видимость задаётся при создании датасета в диалоговом окне New Dataset с помощью переключателя. Публичные датасеты отображаются на странице Explore.

Редактирование датасета#

Метаданные датасета редактируются непосредственно на странице датасета — отдельное диалоговое окно не требуется:

  • Название: Нажми на название датасета, чтобы изменить его. Изменения автоматически сохраняются при потере фокуса или нажатии Enter. Название может содержать не более 100 символов.
  • Описание: Нажми на описание (или на заполнитель «Добавить описание...»), чтобы изменить его. Изменения сохраняются автоматически. Описание может содержать не более 1 000 символов.
  • Тип задачи: Нажми на значок задачи, чтобы выбрать другой тип задачи.
  • Лицензия: Нажми на селектор лицензии, чтобы изменить лицензию датасета.
  • Значок: Нажми на значок датасета, чтобы загрузить собственное изображение, назначить одно из изображений датасета значком или выбрать букву и цвет.
Изменение типа задачи

Каждое изображение хранит аннотации для всех типов задач. Изменение типа задачи датасета определяет, какие аннотации отображаются в редакторе и включаются в экспорт и обучение. Аннотации для других типов задач сохраняются в базе данных и снова появляются при обратном переключении. Depth — исключение: ground truth хранится в парном файле, а не в виде аннотации, поэтому датасет можно переключить на или с depth только если он не содержит изображений — вместо этого импортируй его заново.

Пользовательские метаданные#

Открой Дополнительные действия и выбери Информация, чтобы просмотреть два раздела:

  • Метаданные Ultralytics: доступные только для чтения сведения Platform, такие как идентификатор датасета, владелец, задача, количество изображений и аннотаций, регион хранения и временные метки
  • Пользовательские метаданные: собственный объект JSON для указания происхождения данных, условий съёмки, идентификаторов клиентов, управления данными или другой контекстной информации

Пользователи рабочего пространства с правом просмотра могут изучать метаданные, а участники с правом редактирования — заменять объект пользовательских метаданных. Сериализованный объект метаданных может содержать не более 500 000 символов, а длина каждого ключа верхнего уровня ограничена 128 символами. Сохрани пустой объект ({}), чтобы очистить пользовательские метаданные.

Клонирование датасета#

Просматривая публичный датасет, которым ты не владеешь, нажми Clone Dataset, чтобы открыть диалоговое окно клонирования. Проверь целевое рабочее пространство, название, видимость и лицензию, затем подтверди клонирование. Копия включает все изображения, аннотации и определения классов. Публичные исходные датасеты по умолчанию остаются публичными в рабочих пространствах с публичной видимостью по умолчанию; клоны в рабочих пространствах Enterprise по умолчанию являются приватными. Если у исходного датасета лицензия с копилефтом, клон наследует её, а выбор лицензии блокируется.

Слаг назначения автоматически переименовывается, если он уже занят, а для клонирования требуется достаточный оставшийся объём квоты хранилища для размещения копии.

Подключённые датасеты

Датасеты, размещённые в облачном хранилище или подключённые через On Premise, нельзя клонировать, поскольку Platform не хранит байты их изображений.

Добавление в избранное и отправка#

  • Добавить в избранное: Нажми кнопку со звездой, чтобы добавить датасет в закладки. Количество добавлений в избранное видно всем пользователям.
  • Поделиться: Для публичных датасетов нажми кнопку «Поделиться», чтобы скопировать ссылку, получить фрагмент для встраивания или поделиться в социальных сетях.

Удаление датасета#

Удали датасет, который тебе больше не нужен:

  1. Открой Дополнительные действия (кнопка ) в заголовке датасета
  2. Выбери Delete Dataset
  3. Подтверди в диалоговом окне: «Объект [name] будет перемещён в корзину. Ты сможешь восстановить его в течение 30 дней.»

В этом же меню есть пункт Information, который открывает диалоговое окно с метаданными, описанное в разделе Custom Metadata, и пункт Refresh, который заново считывает набор данных с сервера.

Корзина и восстановление

Удалённые наборы данных перемещаются в корзину, а не удаляются навсегда. Ты можешь восстановить их в течение 30 дней из Settings > Trash.

Обучение на наборе данных#

Запусти обучение непосредственно из набора данных:

  1. Нажми New Model на странице набора данных
  2. Выбери проект или создай новый
  3. Настрой параметры обучения
  4. Запусти обучение
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Подробнее см. в разделе Cloud Training.

Часто задаваемые вопросы#

  • Твои данные обрабатываются и хранятся в выбранном регионе (US, EU или AP). Изображения:

    1. Проверяются на соответствие требованиям к формату и размеру
    2. Отклоняются, если минимальный размер меньше 28px
    3. Нормализуются, если размер превышает 4096px (с сохранением соотношения сторон; кодируются для оптимизированного хранения)
    4. Хранятся с дедупликацией, поэтому идентичные изображения сохраняются только один раз
    5. Для быстрого просмотра создаются миниатюры размером 256px в формате WebP
  • Ultralytics Platform эффективно управляет хранилищем:

    • Дедупликация: идентичные изображения в одном регионе данных хранятся один раз
    • Целостность: загружаемые файлы проверяются на целостность данных
    • Эффективность: клоны повторно используют сохранённые изображения вместо их копирования, при этом они учитываются в квоте хранилища целевого рабочего пространства
    • Региональность: данные остаются в выбранном тобой регионе (US, EU или AP)
  • Да. Перетащи файлы в галерею набора данных или нажми значок загрузки в заголовке страницы — прямо откроется стандартное средство выбора файлов браузера. После обработки новые статистические данные вычисляются автоматически.

  • Используй функцию массового перемещения в поднабор:

    1. Выбери изображения в режиме таблицы
    2. Щёлкни правой кнопкой мыши и выбери Move to split
    3. Выбери целевой поднабор (Train, Validation или Test)
  • Ultralytics Platform поддерживает разметку YOLO, COCO JSON, Ultralytics NDJSON и загрузку исходных изображений. Файлы разметки Pascal VOC XML обнаруживаются, но не импортируются:

    Один файл .txt на каждое изображение с нормализованными координатами (диапазон 0–1):

    ЗадачаФорматПример
    Detectclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Семантическая сегментацияclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Позыclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    КлассификацияСтруктура каталоговtrain/cats/, train/dogs/

    Флаги видимости поз: 0 = не размечено, 1 = размечено, но заслонено, 2 = размечено и видно. Семантические датасеты также принимают PNG-маски вместо файлов полигонов (см. Семантические маски).

  • Да. Для каждого изображения вместе хранятся аннотации всех 6 типов задач разметки (detect, segment, semantic, classify, pose, OBB). Ты можешь в любой момент изменить активный тип задачи набора данных, не теряя существующие аннотации. В редакторе отображаются и в экспорт и обучение включаются только аннотации, соответствующие активному типу задачи; аннотации для других задач сохраняются и снова появляются при обратном переключении.

  • Да:

    ОграничениеЗначение
    Классов на набор данных25,000
    Аннотаций на изображение10,000
    Координат на аннотацию10,000
    Название набора данных100 символов
    Описание набора данных1 000 символов
    Пользовательские метаданные500 000 сериализованных символов
    Ключ верхнего уровня метаданных128 символов
  • Наборы данных, считывающие данные из источников облачного хранилища или On Premise, хранят пиксельные данные за пределами Platform, поэтому недоступны функции, которым нужны принадлежащие Platform копии байтов изображений:

    ХарактеристикаПодключённое облачное хранилищеOn Premise
    Умная и пакетная разметкаНедоступноНедоступно
    Кластерный анализНедоступноНедоступно
    КлонированиеНедоступноНедоступно
    Снимки версийНедоступноНедоступно
    Экспорт NDJSONДоступноНедоступно
    Импорт семантических PNG-масокНедоступноДоступно

    Просмотр, ручная разметка, управление классами, поднаборами, статистикой и обучение работают в обычном режиме.

Комментарии