Ultralytics YOLO27:

Подготовка данных#

Подготовка данных — основа успешных моделей компьютерного зрения. Ultralytics Platform предоставляет комплексные инструменты для управления обучающими данными: от загрузки и аннотирования до анализа.



Watch: Get Started with Ultralytics Platform - Data

Обзор#

Раздел Data в Ultralytics Platform помогает тебе:

  • Загружать изображения, видео и файлы датасетов (ZIP, TAR, включая .tar.gz/.tgz, NDJSON)
  • Импортировать по URL, вставив прямую ссылку на архив или экспорт NDJSON, либо импортировать данные из Roboflow
  • Подключать Google Cloud Storage, Amazon S3 или Azure Blob Storage и использовать данные на месте без загрузки копии
  • Хранить пиксели локально с помощью CPU/GPU-воркеров Enterprise On Premise
  • Размечай вручную с помощью инструментов рисования и умной разметки на базе SAM — выбирай SAM 2.1, SAM 3 или стандартный SAM 3.1
  • Управлять классами: переименовывать, менять цвет, объединять и удалять их во всём датасете
  • Анализировать данные с помощью статистики, визуализаций и кластеризации на основе эмбеддингов
  • Экспортировать данные в формате NDJSON для локального обучения

Обзор данных Ultralytics Platform: боковая панель датасетов

Рабочий процесс#

graph LR
    A[Upload]:::start --> B[Annotate]:::proc
    B --> D[Train]:::out
    B --> C[Analyze]:::proc

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
ЭтапОписание
ЗагрузкаИмпортируй изображения, видео или архивы с автоматической обработкой
РазметкаРазмечай данные вручную или используй аннотирование SAM для детекции, сегментации, семантической сегментации и OBB
АнализируйПросматривай распределение классов, пространственные тепловые карты, статистику размеров и кластеры эмбеддингов
ЭкспортСкачивай данные в формате NDJSON для использования офлайн

Поддерживаемые задачи#

Датасеты Ultralytics Platform поддерживают все 7 типов задач YOLO:

ЗадачаОписаниеИнструмент аннотирования
ДетекцияДетекция объектов с ограничивающими рамкамиИнструмент прямоугольника
СегментацияСегментация экземпляров с пиксельными маскамиИнструмент многоугольника
Семантическая сегментацияСемантическая сегментация с пиксельными областями для каждого классаИнструмент многоугольника
ГлубинаМетрические карты глубины для каждого пикселяИмпортированные цели
КлассификацияКлассификация на уровне изображенияВыбор класса
ПозаОценка ключевых точек со встроенными и пользовательскими шаблонами скелетовИнструмент ключевых точек
OBBОриентированные ограничивающие рамки для повернутых объектовИнструмент ориентированной рамки
Выбор типа задачи

Тип задачи задаётся при создании датасета и определяет доступные инструменты аннотирования. Позже его можно изменить с помощью селектора задач в заголовке датасета, но несовместимые аннотации не будут отображаться после переключения. Переключение на глубину или с неё разрешено только для пустого датасета — см. Редактирование датасета.

Ключевые особенности#

Интеллектуальное хранилище#

Ultralytics Platform эффективно управляет хранилищем:

  • Дедупликация: идентичные изображения в одном регионе данных хранятся один раз
  • Целостность: загружаемые файлы проверяются на целостность данных
  • Эффективность: оптимизированное хранение и быстрая обработка

URI датасетов#

Ссылайся на датасеты с помощью формата URI ul:// (см. Использование датасетов Platform):

yolo train data=ul://username/datasets/my-dataset

Это позволяет обучаться на датасетах Platform с любого компьютера, на котором настроен твой ключ API.

Использование данных Platform из Python
from ultralytics import YOLO

model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)

Версионирование датасетов#

Создавай неизменяемые снимки датасета в формате NDJSON для воспроизводимого обучения. Каждая версия сохраняет количество изображений, классов и аннотаций на момент создания. Подробнее см. на вкладке Версии.

Вкладки набора данных#

На страницах датасетов может отображаться до шести вкладок — в зависимости от состояния датасета и твоих разрешений:

ВкладкаОписание
ИзображенияПросматривай изображения в виде сетки, компактного представления или таблицы с наложенными аннотациями
КлассыПросматривай, переименовывай, меняй цвет, объединяй и удаляй классы с указанием количества меток для каждого класса
ChartsАвтоматическая статистика: распределение по выборкам, количество классов, тепловые карты
МоделиМодели, обученные на этом датасете, с метриками и статусом
ВерсииСоздавай, скачивай и восстанавливай неизменяемые снимки NDJSON для воспроизводимости
ОшибкиИзображения, обработка которых завершилась ошибкой, с подробностями и рекомендациями по исправлению

Classes отображается, если в датасете есть изображения и для его задачи заданы классы, а Charts отображается при наличии изображений. Errors отображается только при наличии ошибок обработки. Versions отображается, если у тебя есть доступ на редактирование, или в режиме только для чтения, если версии уже существуют.

Кластеризация#

Исследуй свой датасет в виде интерактивной двумерной точечной диаграммы, где визуально похожие изображения находятся близко друг к другу — это полезно для выявления кластеров, дубликатов и выбросов, а также для проверки распределения разбиений или классов по твоим данным. Выдели область диаграммы лассо, чтобы отфильтровать галерею до этих изображений. Для анализа требуется от 20 до 200 000 изображений без ошибок. Те же вложения позволяют найти похожие изображения в публичных датасетах и добавить их в свой датасет. Подробности см. в разделе Кластеризация.

Статистика и визуализация#

Вкладка Charts предоставляет автоматический анализ, включая:

  • Распределение по выборкам: кольцевая диаграмма с количеством изображений в train/val/test
  • Основные классы: кольцевая диаграмма 10 наиболее часто встречающихся классов аннотаций
  • Размеры изображений: гистограмма распределения ширины и высоты изображений (в пикселях)
  • Размеры изображений 2D: двумерная тепловая карта ширины относительно высоты с направляющими линиями соотношения сторон
  • Расположение аннотаций: двумерная тепловая карта положения центров ограничивающих рамок
  • Точек на экземпляр: распределение количества вершин многоугольников или ключевых точек (для датасетов сегментации/позы)

Полный список см. на вкладке «Графики».

Быстрые ссылки#

  • Датасеты: загружай, управляй и экспортируй обучающие данные
  • Аннотирование: размечай данные вручную и с помощью инструментов на базе ИИ
  • Облачное обучение: обучай модели на своих аннотированных датасетах
  • URI датасета: используй URI ul:// для обучения из любого места

Часто задаваемые вопросы#

  • Ultralytics Platform поддерживает:

    Изображения: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (не более 50 МБ каждое)

    Видео: MP4, WebM, MOV, MKV, M4V (не более 1 ГБ, кадры извлекаются с частотой 1 FPS, не более 100 кадров)

    Файлы датасета: архивы ZIP или TAR, включающие .tar.gz и .tgz (максимум 10 ГБ на Free, 20 ГБ на Pro, 50 ГБ на Enterprise), содержащие изображения с опциональными метками в формате YOLO или в формате COCO JSON, либо семантические PNG-маски, а также экспорты NDJSON.

    Любой из этих архивов или форматов NDJSON также можно импортировать, вставив прямую ссылку HTTP(S) на вкладке URL диалогового окна New Dataset. Метки Pascal VOC XML обнаруживаются, но не импортируются.

  • Ограничения хранилища зависят от твоего тарифа:

    ТарифЛимит хранилища
    Free100 GB
    Pro500 GB
    EnterpriseБез ограничений

    Ограничения для отдельных файлов: изображения — 50 МБ, видео — 1 ГБ, датасеты — 10 ГБ на Free / 20 ГБ на Pro / 50 ГБ на Enterprise

  • Да! Используй формат URI датасета для локального обучения:

    export ULTRALYTICS_API_KEY="YOUR_API_KEY"
    yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100

    Или экспортируй свой датасет в формате NDJSON, чтобы перенести его метаданные, разбиения, аннотации и подписанные URL-адреса изображений.

Комментарии