Подготовка данных#
Подготовка данных — основа успешных моделей компьютерного зрения. Ultralytics Platform предоставляет комплексные инструменты для управления обучающими данными: от загрузки и аннотирования до анализа.
Watch: Get Started with Ultralytics Platform - Data
Обзор#
Раздел Data в Ultralytics Platform помогает тебе:
- Загружать изображения, видео и файлы датасетов (ZIP, TAR, включая
.tar.gz/.tgz, NDJSON) - Импортировать по URL, вставив прямую ссылку на архив или экспорт NDJSON, либо импортировать данные из Roboflow
- Подключать Google Cloud Storage, Amazon S3 или Azure Blob Storage и использовать данные на месте без загрузки копии
- Хранить пиксели локально с помощью CPU/GPU-воркеров Enterprise On Premise
- Размечай вручную с помощью инструментов рисования и умной разметки на базе SAM — выбирай SAM 2.1, SAM 3 или стандартный SAM 3.1
- Управлять классами: переименовывать, менять цвет, объединять и удалять их во всём датасете
- Анализировать данные с помощью статистики, визуализаций и кластеризации на основе эмбеддингов
- Экспортировать данные в формате NDJSON для локального обучения

Рабочий процесс#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Этап | Описание |
|---|---|
| Загрузка | Импортируй изображения, видео или архивы с автоматической обработкой |
| Разметка | Размечай данные вручную или используй аннотирование SAM для детекции, сегментации, семантической сегментации и OBB |
| Анализируй | Просматривай распределение классов, пространственные тепловые карты, статистику размеров и кластеры эмбеддингов |
| Экспорт | Скачивай данные в формате NDJSON для использования офлайн |
Поддерживаемые задачи#
Датасеты Ultralytics Platform поддерживают все 7 типов задач YOLO:
| Задача | Описание | Инструмент аннотирования |
|---|---|---|
| Детекция | Детекция объектов с ограничивающими рамками | Инструмент прямоугольника |
| Сегментация | Сегментация экземпляров с пиксельными масками | Инструмент многоугольника |
| Семантическая сегментация | Семантическая сегментация с пиксельными областями для каждого класса | Инструмент многоугольника |
| Глубина | Метрические карты глубины для каждого пикселя | Импортированные цели |
| Классификация | Классификация на уровне изображения | Выбор класса |
| Поза | Оценка ключевых точек со встроенными и пользовательскими шаблонами скелетов | Инструмент ключевых точек |
| OBB | Ориентированные ограничивающие рамки для повернутых объектов | Инструмент ориентированной рамки |
Тип задачи задаётся при создании датасета и определяет доступные инструменты аннотирования. Позже его можно изменить с помощью селектора задач в заголовке датасета, но несовместимые аннотации не будут отображаться после переключения. Переключение на глубину или с неё разрешено только для пустого датасета — см. Редактирование датасета.
Ключевые особенности#
Интеллектуальное хранилище#
Ultralytics Platform эффективно управляет хранилищем:
- Дедупликация: идентичные изображения в одном регионе данных хранятся один раз
- Целостность: загружаемые файлы проверяются на целостность данных
- Эффективность: оптимизированное хранение и быстрая обработка
URI датасетов#
Ссылайся на датасеты с помощью формата URI ul:// (см. Использование датасетов Platform):
yolo train data=ul://username/datasets/my-datasetЭто позволяет обучаться на датасетах Platform с любого компьютера, на котором настроен твой ключ API.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)Версионирование датасетов#
Создавай неизменяемые снимки датасета в формате NDJSON для воспроизводимого обучения. Каждая версия сохраняет количество изображений, классов и аннотаций на момент создания. Подробнее см. на вкладке Версии.
Вкладки набора данных#
На страницах датасетов может отображаться до шести вкладок — в зависимости от состояния датасета и твоих разрешений:
| Вкладка | Описание |
|---|---|
| Изображения | Просматривай изображения в виде сетки, компактного представления или таблицы с наложенными аннотациями |
| Классы | Просматривай, переименовывай, меняй цвет, объединяй и удаляй классы с указанием количества меток для каждого класса |
| Charts | Автоматическая статистика: распределение по выборкам, количество классов, тепловые карты |
| Модели | Модели, обученные на этом датасете, с метриками и статусом |
| Версии | Создавай, скачивай и восстанавливай неизменяемые снимки NDJSON для воспроизводимости |
| Ошибки | Изображения, обработка которых завершилась ошибкой, с подробностями и рекомендациями по исправлению |
Classes отображается, если в датасете есть изображения и для его задачи заданы классы, а Charts отображается при наличии изображений. Errors отображается только при наличии ошибок обработки. Versions отображается, если у тебя есть доступ на редактирование, или в режиме только для чтения, если версии уже существуют.
Кластеризация#
Исследуй свой датасет в виде интерактивной двумерной точечной диаграммы, где визуально похожие изображения находятся близко друг к другу — это полезно для выявления кластеров, дубликатов и выбросов, а также для проверки распределения разбиений или классов по твоим данным. Выдели область диаграммы лассо, чтобы отфильтровать галерею до этих изображений. Для анализа требуется от 20 до 200 000 изображений без ошибок. Те же вложения позволяют найти похожие изображения в публичных датасетах и добавить их в свой датасет. Подробности см. в разделе Кластеризация.
Статистика и визуализация#
Вкладка Charts предоставляет автоматический анализ, включая:
- Распределение по выборкам: кольцевая диаграмма с количеством изображений в train/val/test
- Основные классы: кольцевая диаграмма 10 наиболее часто встречающихся классов аннотаций
- Размеры изображений: гистограмма распределения ширины и высоты изображений (в пикселях)
- Размеры изображений 2D: двумерная тепловая карта ширины относительно высоты с направляющими линиями соотношения сторон
- Расположение аннотаций: двумерная тепловая карта положения центров ограничивающих рамок
- Точек на экземпляр: распределение количества вершин многоугольников или ключевых точек (для датасетов сегментации/позы)
Полный список см. на вкладке «Графики».
Быстрые ссылки#
- Датасеты: загружай, управляй и экспортируй обучающие данные
- Аннотирование: размечай данные вручную и с помощью инструментов на базе ИИ
- Облачное обучение: обучай модели на своих аннотированных датасетах
- URI датасета: используй URI
ul://для обучения из любого места
Часто задаваемые вопросы#
Ultralytics Platform поддерживает:
Изображения: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (не более 50 МБ каждое)
Видео: MP4, WebM, MOV, MKV, M4V (не более 1 ГБ, кадры извлекаются с частотой 1 FPS, не более 100 кадров)
Файлы датасета: архивы ZIP или TAR, включающие
.tar.gzи.tgz(максимум 10 ГБ на Free, 20 ГБ на Pro, 50 ГБ на Enterprise), содержащие изображения с опциональными метками в формате YOLO или в формате COCO JSON, либо семантические PNG-маски, а также экспорты NDJSON.Любой из этих архивов или форматов NDJSON также можно импортировать, вставив прямую ссылку HTTP(S) на вкладке
URLдиалогового окнаNew Dataset. Метки Pascal VOC XML обнаруживаются, но не импортируются.Ограничения хранилища зависят от твоего тарифа:
Тариф Лимит хранилища Free 100 GB Pro 500 GB Enterprise Без ограничений Ограничения для отдельных файлов: изображения — 50 МБ, видео — 1 ГБ, датасеты — 10 ГБ на Free / 20 ГБ на Pro / 50 ГБ на Enterprise
Да! Используй формат URI датасета для локального обучения:
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100Или экспортируй свой датасет в формате NDJSON, чтобы перенести его метаданные, разбиения, аннотации и подписанные URL-адреса изображений.