YOLO Vision 2026:

Подготовка данных#

Подготовка данных — это основа успешных моделей computer vision. Ultralytics Platform предоставляет комплексные инструменты для управления твоими тренировочными данными: от загрузки и разметки до анализа.



Watch: Get Started with Ultralytics Platform - Data

Обзор#

Раздел Data в Ultralytics Platform помогает тебе:

  • Загружай изображения, видео и файлы датасетов (ZIP, TAR, включая .tar.gz/.tgz, NDJSON)
  • Импортируй по URL, вставив прямую ссылку на архив или экспорт в формате NDJSON, либо из Roboflow
  • Подключай Google Cloud Storage, Amazon S3 или Azure Blob Storage и используй свои данные на месте без загрузки копии
  • Храни пиксели локально с помощью корпоративных CPU/GPU-воркеров On Premise уровня Enterprise
  • Размечай с помощью инструментов ручного рисования и умной разметки на базе SAM — выбирай между SAM 2.1 и новым SAM 3
  • Управляй классами, переименовывая, перекрашивая, объединяя и удаляя их во всем наборе данных
  • Анализируй свои данные с помощью статистики, визуализаций и кластеризации на основе вложений
  • Экспортируй в формате NDJSON для локального обучения

Ultralytics Platform Data Overview Sidebar Datasets

Рабочий процесс#

graph LR
    A[Upload]:::start --> B[Annotate]:::proc
    B --> D[Train]:::out
    B --> C[Analyze]:::proc

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
ЭтапОписание
ЗагрузкаИмпортируй изображения, видео или архивы с автоматической обработкой
РазметкаРазмечай данные с помощью ручных инструментов или используй аннотацию SAM для задач детектирования, сегментации, семантики и OBB
АнализПросматривай распределение классов, пространственные тепловые карты, статистику размерностей и кластеры вложений
ЭкспортСкачивай в формате NDJSON для использования в офлайн-режиме

Поддерживаемые задачи#

Датасеты Ultralytics Platform поддерживают все 7 типов задач YOLO:

ЗадачаОписаниеИнструмент аннотирования
DetectДетекция объектов с ограничивающими рамками (BBox)Инструмент прямоугольника
SegmentСегментация экземпляров с пиксельными маскамиИнструмент многоугольника
SemanticСемантическая сегментация с пиксельными областями по классамИнструмент многоугольника
DepthПопиксельные карты метрической глубиныИмпортированные цели
ClassifyКлассификация на уровне изображенияВыбор класса
PoseОценка ключевых точек с помощью встроенных и пользовательских шаблонов скелетаИнструмент ключевых точек
OBBОриентированные ограничивающие рамки для повернутых объектовИнструмент ориентированной рамки
Выбор типа задачи

Тип задачи задается при создании датасета и определяет доступные инструменты разметки. Ты можешь изменить его позже в селекторе задач в шапке датасета, но несовместимые аннотации не будут отображаться после переключения. Переключение на глубину (depth) или с нее разрешено только тогда, когда датасет пуст — см. Edit Dataset.

Ключевые особенности#

Умное хранилище#

Ultralytics Platform эффективно управляет хранилищем:

  • Дедупликация: Идентичные изображения в одной области данных сохраняются один раз
  • Целостность: Загружаемые файлы проверяются на целостность данных
  • Эффективность: Оптимизированное хранение и быстрая обработка

URI датасетов#

Ссылайся на датасеты, используя формат URI ul:// (см. Использование датасетов платформы):

yolo train data=ul://username/datasets/my-dataset

Это позволяет запускать обучение на датасетах платформы с любой машины, на которой настроен твой API key.

Использование данных платформы из Python
from ultralytics import YOLO

model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)

Версионирование датасетов#

Создавай неизменяемые снимки (snapshots) датасета в формате NDJSON для воспроизводимого обучения. Каждая версия фиксирует количество изображений, классов и аннотаций на момент создания. Подробности см. на вкладке Versions Tab.

Вкладки набора данных#

Страницы датасетов могут содержать до шести вкладок в зависимости от состояния датасета и твоих прав доступа:

ВкладкаОписание
ИзображенияПросматривай изображения в виде сетки, компактного списка или таблицы с наложенными аннотациями
ClassesПросматривай, переименовывай, перекрашивай, объединяй и удаляй классы с отображением количества меток для каждого класса
ГрафикиАвтоматическая статистика: распределение по выборкам (split), количество классов, тепловые карты
МоделиМодели, обученные на этом датасете, с метриками и статусом
ВерсииСоздавай, скачивай и восстанавливай неизменяемые снимки NDJSON для обеспечения воспроизводимости
ОшибкиИзображения, обработка которых не удалась, с описанием ошибок и инструкциями по их исправлению

Classes появляется, когда в датасете есть изображения и для его задачи заданы классы, в то время как Charts появляется всегда, когда в нем есть изображения. Errors появляется только при наличии сбоев обработки. Versions появляется, когда у тебя есть доступ с правами редактирования, либо в режиме только чтения, если версии уже существуют.

Кластеризация#

Изучай свой набор данных в виде интерактивной двумерной диаграммы рассеяния, где визуально похожие изображения располагаются близко друг к другу — это полезно для выявления кластеров, дубликатов и выбросов, а также для проверки распределения разбиений или классов по твоим данным. Выдели область графика лассо, чтобы отфильтровать галерею до этих изображений. Для анализа требуется от 20 до 200 000 изображений без ошибок. Подробности см. в разделе Clustering.

Статистика и визуализация#

Вкладка Charts предоставляет автоматический анализ, включая:

  • Распределение выборок (Split Distribution): Круговая диаграмма количества изображений в обучающей, валидационной и тестовой выборках
  • Основные классы: Кольцевая диаграмма 10 наиболее частых классов аннотаций
  • Размеры изображений: Гистограмма распределения ширины и высоты изображений (в пикселях)
  • Размеры изображений 2D: 2D тепловая карта ширины относительно высоты с направляющими линиями соотношения сторон
  • Расположение аннотаций: 2D тепловая карта расположения центров ограничивающих рамок
  • Точки на экземпляр: Распределение количества вершин многоугольника или ключевых точек (для датасетов сегментации или поз)

Полный список см. на вкладке Charts tab.

Быстрые ссылки#

  • Datasets: Загрузка, управление и экспорт твоих тренировочных данных
  • Annotation: Разметка данных с помощью ручных и ИИ-инструментов
  • Cloud Training: Обучение моделей на размеченных датасетах
  • Dataset URI: Использование URI ul:// для обучения откуда угодно

FAQ#

  • Ultralytics Platform поддерживает:

    Изображения: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (макс. 50 МБ каждое)

    Видео: MP4, WebM, MOV, MKV, M4V (макс. 1 ГБ, кадры извлекаются с частотой 1 FPS, максимум 100 кадров)

    Файлы набора данных: Архивы ZIP или TAR, включающие .tar.gz и .tgz (макс. 10 ГБ на тарифе Free, 20 ГБ на Pro, 50 ГБ на Enterprise), содержащие изображения с опциональными метками в формате YOLO-format или COCO JSON, а также экспорты в формате NDJSON

    Любой из этих форматов архивов или NDJSON также можно импортировать, вставив прямую ссылку HTTP(S) на вкладке URL диалогового окна New Dataset. Метки Pascal VOC XML обнаруживаются, но не импортируются.

  • Лимиты хранилища зависят от твоего тарифного плана:

    Тарифный планЛимит хранилища
    Бесплатно100 GB
    Pro500 GB
    EnterpriseБез ограничений

    Лимиты на отдельный файл: изображения 50 МБ, видео 1 ГБ, датасеты 10 ГБ на Free / 20 ГБ на Pro / 50 ГБ на Enterprise

  • Да! Используй формат URI датасета для локального обучения:

    export ULTRALYTICS_API_KEY="YOUR_API_KEY"
    yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100

    Или экспортируй свой датасет в формате NDJSON для переноса его метаданных, разбиений, аннотаций и подписанных URL изображений.

Комментарии