Подготовка данных#
Подготовка данных — основа успешных моделей компьютерного зрения. Ultralytics Platform предоставляет полный набор инструментов для управления обучающими данными: от загрузки и аннотирования до анализа.
Смотри: Начало работы с платформой Ultralytics — данные
Обзор#
Раздел Data в Ultralytics Platform помогает:
- Загружать изображения, видео и файлы датасетов (ZIP, TAR, в том числе
.tar.gz/.tgz, NDJSON) - Импортировать по URL, вставив прямую ссылку на архив или экспорт в формате NDJSON, либо импортировать данные из Roboflow
- Подключать Google Cloud Storage, Amazon S3 или Azure Blob Storage и использовать данные на месте, не загружая копию
- Хранить пиксели локально с помощью корпоративных CPU/GPU-воркеров On Premise
- Аннотировать с помощью инструментов ручной разметки и Smart annotation с SAM (SAM 2.1, SAM 3 или стандартной SAM 3.1), моделей YOLO или моделей с указанием классов — размещённых моделей с открытым исходным кодом или платных моделей провайдеров — на датасетах для обнаружения с 1–200 классами
- Управлять классами: переименовывать, менять цвета, объединять и удалять их во всём датасете
- Расширять датасеты с помощью функций Find Similar Images или Generate Similar Images, а затем аннотировать нужные изображения
- Размывать лица на существующих изображениях или в будущих загрузках
- Анализировать данные с помощью статистики, визуализаций и кластеризации на основе эмбеддингов
- Экспортировать данные в формате NDJSON для локального обучения

Рабочий процесс#
| Этап | Описание |
|---|---|
| Загрузка | Импортируй изображения, видео или архивы с автоматической обработкой |
| Аннотирование | Размечай данные вручную или используй Smart annotation с SAM (обнаружение, сегментация, семантическая сегментация и OBB), YOLO или модели с указанием классов — размещённые модели с открытым исходным кодом или платные модели провайдеров — на датасетах для обнаружения с 1–200 классами |
| Анализ | Просматривай распределение классов, пространственные тепловые карты, статистику размеров и кластеры эмбеддингов |
| Экспорт | Скачивай данные в формате NDJSON для использования без подключения к сети |
Поддерживаемые задачи#
Датасеты Ultralytics Platform поддерживают все 7 типов задач YOLO:
| Задача | Описание | Инструмент аннотации |
|---|---|---|
| Обнаружение | Обнаружение объектов с помощью ограничивающих рамок | Инструмент «Прямоугольник» |
| Сегментация | Сегментация экземпляров с помощью попиксельных масок | Инструмент «Полигон» |
| Семантическая сегментация | Семантическая сегментация с попиксельными областями для каждого класса | Инструмент «Полигон» |
| Глубина | Карты метрической глубины для каждого пикселя | Импортированные объекты |
| Классификация | Классификация на уровне изображения | Выбор класса |
| Поза | Оценка положения ключевых точек с помощью встроенных и пользовательских шаблонов скелета | Инструмент «Ключевые точки» |
| OBB | Ориентированные ограничивающие рамки для повёрнутых объектов | Инструмент «Ориентированная рамка» |
Тип задачи задаётся при создании датасета и определяет доступные инструменты аннотации. Позже его можно изменить с помощью селектора типа задачи в заголовке датасета, но после переключения несовместимые аннотации не будут отображаться. Переключиться на глубину или с неё можно, только если датасет пуст — см. Edit Dataset.
Основные особенности#
Эффективное хранение#
Ultralytics Platform эффективно управляет хранилищем:
- Удаление дубликатов: одинаковые изображения в одном регионе хранения сохраняются только один раз
- Целостность: для загруженных данных проверяется их целостность
- Эффективность: оптимизированное хранение и быстрая обработка
URI датасетов#
Указывай датасеты в формате URI ul:// (см. Using Platform Datasets):
yolo train model=yolo26n.pt data=ul://username/datasets/my-datasetЭто позволяет обучаться на датасетах платформы с любого компьютера, если настроен ключ API.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)Версионирование датасетов#
Создавай неизменяемые снимки датасета в формате NDJSON для воспроизводимого обучения. Каждая версия сохраняет количество изображений, классов и аннотаций на момент создания. Подробнее см. на вкладке Versions.
Вкладки датасета#
На страницах датасетов может отображаться до шести вкладок — в зависимости от состояния датасета и твоих прав доступа:
| Вкладка | Описание |
|---|---|
| Изображения | Просмотр изображений в виде сетки, компактного списка или таблицы с наложением аннотаций |
| Классы | Просмотр и переименование классов, изменение их цветов, объединение и удаление; для каждого класса показывается количество меток |
| Графики | Автоматическая статистика: распределение по сплитам, количество классов, тепловые карты |
| Модели | Модели, обученные на этом датасете, с метриками и статусом |
| Версии | Создание, сравнение, скачивание и восстановление неизменяемых снимков NDJSON |
| Ошибки | Изображения, обработка которых завершилась с ошибкой, сведения об ошибках и рекомендации по их устранению |
Classes отображается, если в датасете есть изображения и для его задачи заданы классы, а Charts — если в датасете есть изображения. Errors отображается, только если при обработке возникли ошибки. Versions отображается, если у тебя есть права на редактирование, либо в режиме только для чтения, когда уже существуют версии.
Кластеризация#
Исследуй датасет на интерактивной двумерной диаграмме рассеяния: визуально похожие изображения располагаются близко друг к другу. Это помогает находить кластеры, дубликаты и выбросы, а также изучать распределение данных по сплитам и классам. Выдели область лассо или нажми на точку, чтобы отфильтровать галерею и просмотреть соответствующие изображения. Для анализа требуется от 20 до 200 000 изображений без ошибок. Те же эмбеддинги позволяют находить похожие изображения в общедоступных, собственных и командных датасетах и добавлять найденные изображения в свой датасет. Подробнее см. в разделе Clustering.
Статистика и визуализация#
На вкладке Charts автоматически выполняется анализ, в том числе:
- Распределение по сплитам: кольцевая диаграмма с количеством изображений для train/val/test
- Популярные классы: кольцевая диаграмма для 10 наиболее часто встречающихся классов аннотаций
- Размеры изображений: гистограмма распределения ширины и высоты изображений (в пикселях)
- Размеры изображений, 2D: двумерная тепловая карта ширины и высоты с направляющими линиями соотношения сторон
- Расположение аннотаций: двумерная тепловая карта расположения центров ограничивающих рамок
- Точек на экземпляр: распределение количества вершин полигона или ключевых точек (для наборов данных сегментации/поз)
Полный список смотри на вкладке «Диаграммы».
Полезные ссылки#
- Наборы данных: загружай, управляй и экспортируй данные для обучения
- Аннотация: размечай данные с помощью ручных инструментов и инструментов с поддержкой ИИ
- Обучение в облаке: обучай модели на размеченных наборах данных
- URI набора данных: используй URI
ul://для обучения из любого места
Часто задаваемые вопросы#
Ultralytics Platform поддерживает:
Изображения: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (максимум 50 МБ каждый файл)
Видео: MP4, WebM, MOV, MKV, M4V (максимум 1 ГБ; извлечение кадров с частотой 1 FPS, максимум 100 кадров)
Файлы наборов данных: архивы ZIP или TAR, содержащие
.tar.gzи.tgz(максимум 10 ГБ на тарифе Free, 20 ГБ на Pro, 50 ГБ на Enterprise), с изображениями и необязательными метками в формате YOLO, формате COCO JSON или формате JSON LabelMe, семантическими PNG-масками или картами глубины, а также экспортами Ultralytics NDJSON или Labelbox NDJSONЛюбой из этих архивов или файлов NDJSON также можно импортировать, вставив прямую ссылку HTTP(S) на вкладке
URLдиалогового окнаNew Dataset. Метки Pascal VOC XML обнаруживаются, но не импортируются.Ограничения на хранение зависят от твоего тарифного плана:
Тариф Лимит хранилища Free 100 GB Pro 500 GB Enterprise Без ограничений Ограничения на размер отдельных файлов: изображения — 50 МБ, видео — 1 ГБ, наборы данных — 10 ГБ на Free / 20 ГБ на Pro / 50 ГБ на Enterprise
Да! Используй формат URI набора данных для локального обучения:
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100Или экспортируй набор данных в формате NDJSON, чтобы перенести метаданные, разбиение на выборки, аннотации и подписанные URL изображений.