YOLO Vision 2026:

Huấn luyện trên đám mây#

Ultralytics Platform Cloud Training cung cấp tính năng huấn luyện một cú nhấp chuột trên GPU đám mây, giúp việc huấn luyện model trở nên dễ tiếp cận mà không cần thiết lập phức tạp. Huấn luyện các model YOLO với luồng chỉ số thời gian thực và tự động lưu checkpoint.

graph LR
    A[Configure]:::start --> B[Start Training]:::proc
    B --> C[Provision GPU]:::proc
    C --> D[Download Dataset]:::proc
    D --> E[Train]:::proc
    E --> F[Stream Metrics]:::proc
    F --> G[Save Checkpoints]:::proc
    G --> H[Complete]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Hộp thoại Huấn luyện#

Bắt đầu huấn luyện từ giao diện UI của nền tảng bằng cách nhấp vào New Model trên bất kỳ trang dự án hoặc tập dữ liệu nào. Hộp thoại huấn luyện có hai tab: Cloud TrainingLocal Training. Khi tập dữ liệu được chọn nằm trên máy chủ On Premise, tab đầu tiên sẽ chuyển thành On Premise và tab Local Training sẽ bị ẩn — tập dữ liệu đó chỉ có thể được huấn luyện trên máy chủ của chính nó, yêu cầu gói Enterprise và một worker trực tuyến được kết nối.

Ultralytics Platform Training Dialog Cloud Tab

Bước 1: Chọn Model Cơ sở#

Chọn một model Ultralytics chính thức hoặc một trong các model đã hoàn thành của riêng bạn:

TabMô tả
Chính thứcCác model dự án YOLO26 (được khuyến nghị), YOLO11, YOLOv8 và YOLOv5
My ModelsCác mô hình đã hoàn thành hoặc đã tải lên của bạn, được nhóm theo dự án, để fine-tuning

Trong mỗi tab, các mô hình được nhóm theo tác vụ theo thứ tự chuẩn hóa và sắp xếp theo kích thước. Bộ lựa chọn sẽ lọc các mô hình chính thức theo các tác vụ tương thích với tập dữ liệu đã chọn. YOLO26 bao gồm các biến thể Detect, Segment, Semantic, Depth, Classify, Pose, và OBB với các kích thước từ nano đến xlarge.

Depth Training

Các tập dữ liệu depth có thể được tải lên với các target float NPY tính bằng mét hoặc target uint16 PNG bằng cách sử dụng depth_scale của tập dữ liệu. Xem định dạng tập dữ liệu depth.

Bước 2: Chọn Tập dữ liệu#

Chọn dataset để huấn luyện (xem phần Datasets):

Tùy chọnMô tả
Chính thứcCác tập dữ liệu được tuyển chọn từ Ultralytics
Tập dữ liệu của bạnCác tập dữ liệu bạn đã tải lên
Yêu cầu về tập dữ liệu

Datasets must be in ready status with at least 1 image in the train split, 1 image in the validation or test split, at least 1 labeled image, and at least one class name. Classification datasets additionally require the train-split image to be labeled, and pose datasets must define a keypoint shape. Depth datasets instead require one paired map in train and two in val; unpaired images are excluded.

Không khớp tác vụ

Cảnh báo không tương thích tác vụ sẽ xuất hiện khi model được chọn không thể huấn luyện tác vụ dataset đó, và Start Training vẫn bị vô hiệu hóa cho đến khi bạn chọn một model tương thích. Dataset segment chấp nhận các model segment hoặc semantic; các tác vụ dataset khác yêu cầu model có tác vụ tương ứng. Xem hướng dẫn tác vụ.

Bước 3: Cấu hình Tham số#

Thiết lập các tham số huấn luyện cốt lõi:

Tham sốMô tảMặc định
EpochsSố vòng lặp huấn luyện (1-10000)100
Batch SizeSố mẫu trên mỗi vòng lặp (-1 tự động khớp với VRAM khả dụng, hoặc 1-512)-1 (tự động)
Kích thước Hình ảnhThanh trượt độ phân giải đầu vào, 32-1280 với bước nhảy là 32640
TênTên tùy chọn cho lần huấn luyệntự động

Các giá trị được nhập ngoài phạm vi của tham số sẽ được giới hạn khi trường nhập liệu mất tiêu điểm (focus).

Kích thước ảnh lớn hơn 1280

Thanh trượt dừng ở 1280, nhưng trình soạn thảo YAML chấp nhận kích thước lên tới 4096. Một cảnh báo sẽ xuất hiện trên 1280 vì độ phân giải lớn hơn làm tăng đáng kể mức sử dụng bộ nhớ GPU, thời gian huấn luyện và chi phí.

Bước 4: Cài đặt Nâng cao (Tùy chọn)#

Mở rộng Advanced Settings để truy cập trình soạn thảo tham số dựa trên YAML đầy đủ với hơn 50 tham số huấn luyện được tổ chức theo nhóm (xem configuration reference):

NhómTham số
Learning Ratelr0, lrf, momentum, weight_decay, warmup_epochs, warmup_momentum, warmup_bias_lr
Optimizerauto (mặc định), SGD, MuSGD, Adam, AdamW, NAdam, RAdam, RMSProp, Adamax
Trọng số Lossbox, cls, dfl, pose, kobj, label_smoothing
Tăng cường Màu sắchsv_h, hsv_s, hsv_v
Geometric Augmentationdegrees, translate, scale, shear, perspective
Flip & Mix Augmentationflipud, fliplr, mosaic, mixup, copy_paste
Kiểm soát Huấn luyệnepochs, batch, imgsz, pretrained, patience, time, seed, deterministic, amp, cos_lr, compile, close_mosaic, save_period
Tập dữ liệufraction, freeze, single_cls, rect, multi_scale, val, resume
Device & Inferencedevice, cache, workers, dropout, iou, max_det

Các tham số có tính nhận thức tác vụ (ví dụ: copy_paste chỉ hiển thị cho các tác vụ segment, pose/kobj chỉ cho pose, dropout chỉ cho classify). Huy hiệu Modified xuất hiện khi các giá trị khác với mặc định và bạn có thể đặt lại tất cả về mặc định bằng nút reset. Chỉ các giá trị nâng cao khác mặc định mới được gửi đến tác vụ huấn luyện (các tham số cơ bản epochs, batch và kích thước ảnh luôn được bao gồm), do đó lệnh kết quả vẫn dễ đọc.

Ví dụ: Tinh chỉnh Tăng cường cho các tập dữ liệu nhỏ

Đối với các tập dữ liệu nhỏ (<1000 ảnh), hãy tăng cường độ tăng cường để giảm overfitting:

mosaic: 1.0       # Keep mosaic on
mixup: 0.3        # Add mixup blending
copy_paste: 0.3   # Add copy-paste (segment only)
fliplr: 0.5       # Horizontal flip
degrees: 10.0     # Slight rotation
scale: 0.9        # Aggressive scaling

Lưu Phiên bản Tập dữ liệu (Tùy chọn)#

Bật Save Dataset Version để liên kết model với một phiên bản bất biến của tập dữ liệu được lưu trữ trên Platform. Platform sẽ kiểm tra xem nội dung tập dữ liệu có thay đổi hay không, tái sử dụng phiên bản khớp nếu không có thay đổi và chỉ tạo phiên bản được đánh số mới khi cần thiết. Quá trình huấn luyện sau đó sẽ sử dụng snapshot NDJSON chính xác đó và ghi lại số phiên bản cũng như mã băm nội dung trên model.

Việc này giúp bảo toàn dữ liệu đã sử dụng cho lần chạy đó ngay cả khi bạn thêm hoặc xóa hình ảnh, chỉnh sửa chú thích hoặc thay đổi các phân đoạn tập dữ liệu sau này. Bạn có thể tìm thấy phiên bản đã liên kết trong các tab ModelsVersions của tập dữ liệu.

Chỉ dành cho các Tập dữ liệu được lưu trữ trên Platform

Save Dataset Version không khả dụng cho bộ nhớ đám mây được kết nối và các dataset On Premise. Bạn cũng có thể tạo snapshot thủ công từ tab Versions.

Bước 5: Chọn GPU (Tab Đám mây)#

Chọn GPU của bạn từ Ultralytics Cloud:

Ultralytics Platform Training Dialog Gpu Selector And Cost

GPUThế hệVRAMChi phí/GiờPhù hợp nhất cho
RTX 2000 AdaAda16 GB$0.24Tập dữ liệu nhỏ, kiểm thử
RTX A4500Ampere20 GB$0.25Tập dữ liệu nhỏ-trung bình
RTX 4000 AdaAda20 GB$0.26Tập dữ liệu trung bình
RTX A5000Ampere24 GB$0.27Tập dữ liệu trung bình
L4Ada24 GB$0.39Tối ưu hóa cho suy luận
A40Ampere48 GB$0.44Kích thước batch lớn hơn
RTX 3090Ampere24 GB$0.46Huấn luyện tổng quát
RTX A6000Ampere48 GB$0.49Các mô hình lớn
RTX PRO 4000Blackwell24 GB$0.57Budget Blackwell
RTX PRO 4500Blackwell32 GB$0.64Giá/hiệu năng tuyệt vời
RTX 4090Ada24 GB$0.69Giá/hiệu năng tốt nhất
RTX 6000 AdaAda48 GB$0.77Huấn luyện batch lớn
L40SAda48 GB$0.86Huấn luyện batch lớn
RTX PRO 5000Blackwell48 GB$0.96Huấn luyện batch lớn
RTX 5090Blackwell32 GB$0.99Thế hệ người dùng mới nhất
L40Ada48 GB$0.99Các mô hình lớn
A100 PCIeAmpere80 GB$1.39Huấn luyện sản xuất
A100 SXMAmpere80 GB$1.49Huấn luyện sản xuất
RTX PRO 6000Blackwell96 GB$2.09Mặc định khuyến nghị
H100 PCIeHopper80 GB$2.89Huấn luyện hiệu năng cao
H100 NVLHopper94 GB$3.19Hiệu suất tối đa
H100 SXMHopper80 GB$3.29Huấn luyện nhanh nhất
H200 NVLHopper143 GB$3.39Bộ nhớ tối đa
H200 SXMHopper141 GB$4.39Hiệu suất tối đa
B200Blackwell180 GB$5.89Các model lớn (Pro+)
B300Blackwell288 GB$7.39Các model lớn nhất (Pro+)
Chọn GPU
  • RTX PRO 6000: 96 GB Blackwell, mặc định được khuyến nghị cho hầu hết các công việc
  • A100 SXM: 80 GB HBM2e — lựa chọn mạnh mẽ cho các batch size lớn hoặc các model lớn hơn
  • H100 PCIe / H100 SXM / H100 NVL: 80–94 GB Hopper cho huấn luyện nhạy cảm về thời gian (có sẵn trên mọi gói)
  • H200 NVL / H200 SXM: 141–143 GB Hopper cho các khối lượng công việc yêu cầu bộ nhớ cao (có sẵn trên mọi gói)
  • B200 / B300: 180–288 GB NVIDIA Blackwell cho các workload tiên tiến — yêu cầu gói Pro hoặc Enterprise

Hộp thoại hiển thị số balance hiện tại của bạn và nút Top Up. Thẻ chi phí ước tính tổng thời gian và giá cho cấu hình của bạn (kích thước mô hình, ảnh tập dữ liệu, epochs, kích thước ảnh, kích thước batch, bộ tối ưu hóa và tốc độ GPU), đồng thời báo cáo số giây ước tính cho mỗi epoch và số lượng ảnh trong tập dữ liệu.

Dung lượng trực tiếp và tính năng tự động chuyển đổi dự phòng (Automatic Failover)

Trình chọn GPU phản ánh dung lượng đám mây trực tiếp, vì vậy các tùy chọn hết dung lượng sẽ được đánh dấu. Nếu một tác vụ vẫn không thể được đặt trên GPU bạn đã chọn, Platform sẽ báo cáo sự thiếu hụt và chuyển lựa chọn của bạn sang GPU khả dụng gần nhất — khớp VRAM trước, sau đó đến tốc độ, rồi đến giá — và thông báo cho bạn mức VRAM mới cùng giá cước theo giờ để bạn có thể bắt đầu ngay lập tức hoặc chọn cách khác.

Nâng cấp GPU miễn phí

Việc chọn một GPU rẻ hơn RTX PRO 6000 giúp tác vụ của bạn đủ điều kiện sử dụng cơ sở hạ tầng do Ultralytics quản lý. Khi dung lượng đó trống, quá trình chạy sẽ thực thi trên RTX PRO 6000 nhưng vẫn được tính phí theo mức giá của GPU bạn đã chọn, do đó một quá trình chạy có thể hoàn thành nhanh hơn và tốn ít chi phí hơn so với trên GPU bạn đã chọn — bản thân việc nâng cấp không bao giờ làm cho quá trình chạy chậm hơn hoặc đắt hơn.

Bước 6: Bắt đầu Huấn luyện#

Nhấp vào Start Training để khởi chạy công việc của bạn. Nền tảng sẽ:

  1. Giải quyết phiên bản tập dữ liệu bất biến khi Save Dataset Version được bật
  2. Cấp phát một instance GPU
  3. Tải xuống tập dữ liệu của bạn
  4. Bắt đầu huấn luyện
  5. Truyền phát các chỉ số trong thời gian thực

Việc huấn luyện lại một mô hình hiện có sẽ tái sử dụng chính trang mô hình đó và xóa các biểu đồ, đầu ra bảng điều khiển (console), số liệu hệ thống và trạng thái lỗi của lần chạy trước ngay khi tác vụ mới được tạo. Một lần chạy thất bại trước khi tài nguyên tính toán được cung cấp sẽ giữ nguyên các kết quả trước đó.

Vòng đời của công việc huấn luyện#

Các công việc huấn luyện tiến triển qua các trạng thái sau:

Trạng tháiMô tả
PendingCông việc đã gửi, đang chờ cấp phát GPU
StartingGPU đã được cấp phát, đang tải xuống tập dữ liệu và model
RunningĐang huấn luyện, các chỉ số đang được truyền phát theo thời gian thực
CompletedHuấn luyện đã hoàn thành thành công
FailedHuấn luyện thất bại (xem log console để biết chi tiết)
CancelledHuấn luyện đã bị người dùng hủy

Một lỗi Python nghiêm trọng trong luồng bảng điều khiển — dấu vết ngăn xếp (traceback), lỗi CUDA out-of-memory hoặc lỗi khởi tạo CUDA không thành công — sẽ kết thúc ngay lập tức quá trình chạy thay vì chờ hết thời gian chờ (timeout), và thông báo được trích xuất sẽ xuất hiện trong một biểu ngữ lỗi trên trang mô hình với các hành động View full console logsRetry Training. Các lần chạy ngừng báo cáo hoạt động trong vài giờ sẽ tự động được đánh dấu là thất bại và tài nguyên tính toán của chúng sẽ được giải phóng.

Để nhận kết quả hoàn thành và thất bại mà không cần giữ mở trang này, hãy kết nối cảnh báo Slack.

Credit miễn phí

Tài khoản mới nhận được credit đăng ký — $5 cho email cá nhân và $25 cho email công ty. Kiểm tra số dư của bạn trong Settings > Billing.

Ultralytics Platform Training Progress With Charts

Theo dõi Huấn luyện#

Xem tiến trình huấn luyện thời gian thực trên tab Train của trang model:

Tab con Biểu đồ#

Ultralytics Platform Model Training Live Charts

Các biểu đồ được nhóm theo họ số liệu và các nhóm xuất hiện sẽ phụ thuộc vào những gì lần chạy báo cáo:

NhómNội dung
MetricsSố liệu tác vụ — mAP50, mAP50-95, độ chính xác (precision) và độ thu hồi (recall) đối với phát hiện; xem phần Models cho các tác vụ khác
LossMột biểu đồ cho mỗi thành phần hàm mất mát (loss component), với chuỗi huấn luyện là đường liền nét và chuỗi xác thực là đường đứt nét
Learning Ratelr/pg0, lr/pg1, lr/pg2

Mỗi nhóm có thể được thu gọn, các biểu đồ riêng lẻ có thể được ẩn hoặc hiện từ menu nhóm, và các biểu đồ có thể được kéo và thay đổi kích thước — bố cục sẽ được ghi nhớ cho lần sau.

Tab con Console#

Đầu ra bảng điều khiển trực tiếp hỗ trợ màu ANSI, thanh tiến trình và phát hiện lỗi nghiêm trọng. 2000 dòng cuối cùng được giữ lại, có thể bật/tắt dấu thời gian và toàn bộ nhật ký có thể được sao chép dưới dạng văn bản thuần túy.

Tab con Hệ thống#

Một thẻ máy chủ trực tiếp (tên máy chủ, CPU, GPU, tổng RAM và tổng đĩa) cộng với các biểu đồ cho từng epoch về mức sử dụng CPU và RAM, mức sử dụng và bộ nhớ GPU, nhiệt độ GPU, I/O mạng và I/O đĩa.

Checkpoint#

Checkpoint tốt nhất (best.pt) được tải lên Platform định kỳ trong khi huấn luyện và một lần nữa khi quá trình chạy kết thúc, do đó việc tải xuống, xuất và triển khai luôn sử dụng epoch tốt nhất được tạo ra cho đến nay. Nếu quá trình chạy bị hủy, checkpoint được tải lên trước khi hủy sẽ được giữ lại.

Hủy huấn luyện#

Nhấp vào Cancel trong thẻ Run Information trên trang mô hình và xác nhận hành động. Đối với huấn luyện trên đám mây, Platform sẽ dừng tác vụ, giải phóng tài nguyên tính toán và tính phí thời gian GPU đã sử dụng trước khi hủy. Đối với huấn luyện cục bộ, việc hủy sẽ báo hiệu quá trình dừng lại ở ranh giới epoch tiếp theo và bảo lưu các kết quả một phần — quá trình chạy sẽ tải lên những gì nó có trước khi thoát.

Huấn luyện từ xa (Remote Training)#

graph LR
    A[Local GPU]:::start --> B[ultralytics Package]:::proc
    B --> C[Train]:::proc
    C --> D[Stream Metrics]:::proc
    D --> E[Platform Dashboard]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Huấn luyện trên phần cứng của riêng bạn trong khi truyền tải các chỉ số (metrics) lên nền tảng.

Yêu cầu phiên bản gói

Tích hợp nền tảng yêu cầu ultralytics>=8.4.120. Các phiên bản thấp hơn sẽ không hoạt động với Platform.

pip install -U ultralytics

Thiết lập API Key#

  1. Đi tới Settings > API Keys
  2. Tạo một key mới (hoặc nền tảng sẽ tự động tạo một key khi bạn mở tab Local Training)
  3. Thiết lập biến môi trường:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"

Huấn luyện với truyền tải dữ liệu (Streaming)#

Sử dụng các tham số projectname để truyền tải số liệu:

yolo train model=yolo26n.pt data=coco.yaml epochs=100 \
  project=username/my-project name=experiment-1

Tab Local Training trong hộp thoại huấn luyện hiển thị một lệnh đã được cấu hình sẵn cùng với API key, các tham số đã chọn và các đối số nâng cao đi kèm.

Sử dụng tập dữ liệu (dataset) của Platform#

Huấn luyện với các dataset được lưu trữ trên nền tảng bằng cách sử dụng ul:// định dạng URI:

yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100 \
  project=username/my-project name=exp1

Định dạng URI ul:// sẽ tự động tải xuống và cấu hình dataset của bạn. Model được tự động liên kết với dataset trên nền tảng (xem Sử dụng Dataset trên Nền tảng).

Thanh toán#

Chi phí huấn luyện dựa trên mức sử dụng GPU:

Ước tính chi phí#

Trước khi quá trình huấn luyện bắt đầu, nền tảng ước tính tổng thời gian và chi phí dựa trên kích thước tập dữ liệu, kích thước mô hình, kích thước ảnh, kích thước batch, epochs và GPU đã chọn. Các ước tính chỉ mang tính chất gần đúng; mức sử dụng thực tế là những gì được tính phí.

Các yếu tố ảnh hưởng đến chi phí:

Yếu tốTác động
Kích thước tập dữ liệu (Dataset Size)Nhiều ảnh hơn = thời gian huấn luyện lâu hơn (tính toán tăng xấp xỉ tuyến tính với kích thước tập dữ liệu)
Kích thước mô hình (Model Size)Các mô hình lớn hơn (m, l, x) huấn luyện chậm hơn so với (n, s)
Số lượng EpochHệ số nhân trực tiếp cho thời gian huấn luyện
Kích thước Hình ảnhKích thước ảnh lớn hơn làm tăng đáng kể tính toán — 1280px có chi phí cao gấp nhiều lần so với 640px
Batch SizeCác batch lớn hơn huấn luyện hiệu quả hơn các batch nhỏ
Tốc độ GPUGPU nhanh hơn làm giảm thời gian huấn luyện, bù đắp một phần cho mức giá theo giờ cao hơn của chúng
OptimizerMuSGD mất khoảng gấp đôi thời gian so với các bộ tối ưu hóa khác
Thời gian khởi động (Startup Overhead)Tối đa 5 phút cho việc khởi tạo instance, tải dữ liệu và khởi động (tỷ lệ thuận với kích thước tập dữ liệu)

Các ước tính dựa trên các lần chạy huấn luyện trên đám mây thực tế và ước tính luôn sử dụng GPU bạn đã chọn — do đó, một tác vụ được định tuyến đến cơ sở hạ tầng Ultralytics nhanh hơn sẽ hoàn thành trước thời gian ước tính của nó.

Ví dụ về chi phí#

Ước tính

Các ước tính chi phí chỉ là xấp xỉ và phụ thuộc vào nhiều yếu tố. Hộp thoại huấn luyện sẽ hiển thị ước tính thời gian thực trước khi bạn bắt đầu huấn luyện.

Kịch bảnGPUChi phí ước tính
500 ảnh, YOLO26n, 50 epochRTX 4090~$0.03
1000 ảnh, YOLO26n, 100 epochRTX PRO 6000~$0.23
5000 ảnh, YOLO26s, 100 epochH100 SXM~$1.56

Quy trình thanh toán#

graph LR
    A[Estimate Cost]:::start --> B[Balance Check]:::decide
    B --> C[Train and Meter GPU Time]:::proc
    C --> D[Settle at Terminal State]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff

Quy trình thanh toán huấn luyện trên cloud:

  1. Ước tính: Chi phí được tính trước khi huấn luyện bắt đầu
  2. Kiểm tra số dư: Tín dụng khả dụng được kiểm tra trước khi chạy
  3. Train and Meter: Job chạy trên tài nguyên tính toán đã chọn, và thời gian GPU tích lũy sẽ được trừ dần từ số dư của bạn theo từng bước trong quá trình chạy
  4. Settle: Ở trạng thái cuối cùng, phần thời gian lẻ còn lại sẽ được trừ và một giao dịch Training duy nhất được ghi lại cho toàn bộ lượt chạy
Bảo vệ người tiêu dùng

Việc thanh toán theo dõi thời gian GPU thực tế, bao gồm cả các lượt chạy một phần bị hủy hoặc thất bại sau khi GPU đám mây đã khởi động.

Thanh toán theo trạng thái Job#

Trạng tháiCó bị tính phí không?
CompletedCó — thời gian GPU thực tế đã sử dụng
CancelledCó — thời gian GPU từ lúc bắt đầu đến khi hủy
FailedCó, khi tính toán trên đám mây bắt đầu — thời gian GPU đã sử dụng
Đang bị kẹt (Stuck)Có — thời gian GPU đã sử dụng cho đến khi tự động chấm dứt

Một lần chạy ngừng báo cáo hoạt động trong vài giờ sẽ tự động được đánh dấu là thất bại; phiên làm việc bị chấm dứt và thời gian GPU đã qua được thanh toán. Các lần chạy từ xa trên phần cứng của riêng bạn chỉ đơn giản được đánh dấu là thất bại mà không tính phí gì.

Lỗi trước khi tính toán bắt đầu

Lỗi xác thực hoặc lỗi khởi chạy trước khi GPU đám mây khởi động sẽ không phát sinh mức sử dụng tính toán để tính phí. Ngay khi GPU đang chạy, các tác vụ đã hoàn thành, bị hủy, thất bại và tự động chấm dứt sẽ được thanh toán dựa trên thời gian thực (wall-clock) của GPU.

Phương thức Thanh toán#

Cloud training được thanh toán từ số dư tín dụng Platform của bạn.

Số dư tối thiểu

Việc bắt đầu huấn luyện yêu cầu số dư khả dụng dương và đủ tín dụng cho chi phí tác vụ ước tính, trong đó mọi ước tính đều dành riêng ít nhất 15 phút thời gian GPU. Với nhiều lần chạy hoạt động cùng lúc, việc kiểm tra cũng tính đến phần chưa thanh toán của các lần chạy đó.

Xem chi phí huấn luyện#

Trước khi bắt đầu tác vụ trên đám mây, hộp thoại huấn luyện hiển thị số dư tín dụng hiện tại của bạn và ước tính thời gian cũng như chi phí tác vụ từ model, tập dữ liệu, epochs, kích thước ảnh và GPU được chọn. Ước tính này mang tính tham khảo; mức sử dụng thực tế được tính phí theo thời gian GPU tiêu thụ. Sau đó, hãy xem lại giao dịch tín dụng tương ứng trong mục Settings > Billing.

Ultralytics Platform Training Billing Details

Mẹo huấn luyện#

Chọn kích thước mô hình phù hợp#

Mô hìnhTham sốPhù hợp nhất cho
YOLO26n2.4MThời gian thực, thiết bị biên (edge)
YOLO26s9.5MCân bằng giữa tốc độ/độ chính xác
YOLO26m20.4MĐộ chính xác cao hơn
YOLO26l24.8MĐộ chính xác cho production
YOLO26x55.7MĐộ chính xác tối đa

Tối ưu hóa thời gian huấn luyện#

Chiến lược tiết kiệm chi phí
  1. Bắt đầu nhỏ: Thử nghiệm với 10-20 epoch trên một GPU giá rẻ để xác minh tập dữ liệu và cấu hình của bạn hoạt động tốt
  2. Sử dụng GPU phù hợp: RTX PRO 6000 xử lý hầu hết các khối lượng công việc rất hiệu quả
  3. Xác thực tập dữ liệu: Sửa các vấn đề về gán nhãn trước khi chi tiền cho việc huấn luyện
  4. Giám sát sớm: Hủy huấn luyện nếu loss đi ngang (plateaus) — bạn chỉ trả tiền cho thời gian tính toán đã sử dụng

Khắc phục sự cố#

Vấn đềGiải pháp
Huấn luyện bị kẹt ở 0%Kiểm tra định dạng tập dữ liệu, thử lại
Hết bộ nhớ (Out of memory)Giảm kích thước batch hoặc sử dụng GPU lớn hơn
Độ chính xác kémTăng số epoch, kiểm tra chất lượng dữ liệu
Huấn luyện chậmXem xét GPU nhanh hơn
Lỗi không khớp tác vụĐảm bảo model và tác vụ tập dữ liệu khớp nhau

Tham chiếu tham số huấn luyện#

Tham sốLoạiMặc địnhPhạm viMô tả
epochsint1001-10000Số epoch huấn luyện
batchint-1 (tự động)-1 đến 512Kích thước batch (-1 = tự động điều chỉnh theo VRAM khả dụng)
imgszint64032-4096Kích thước ảnh đầu vào
pretrainedboolTrue-Bắt đầu từ trọng số đã được huấn luyện trước thay vì khởi tạo ngẫu nhiên
patienceint1001-1000Độ kiên nhẫn dừng sớm (early stopping patience)
timefloatnull0.1-720Giới hạn thời gian huấn luyện theo đồng hồ thực tính bằng giờ, ghi đè lên epochs
seedint00-2147483647Hạt giống ngẫu nhiên cho tính tái lập
deterministicboolTrue-Chế độ huấn luyện xác định
ampbool/strTruetrue/false/fp16/bf16/fp32Độ chính xác huấn luyện
compileboolFalse-Biên dịch với torch.compile (epoch đầu tiên chậm hơn)
close_mosaicint100-50Tắt mosaic trong N epoch cuối
save_periodint-1-1-100Lưu checkpoint mỗi N epoch
deviceselecttự độngauto/0/cpu/mpsThiết bị huấn luyện
workersint80-64Dataloader workers
cacheselectfalseram/disk/falseCache ảnh
dropoutfloat0.00.0-1.0Dropout của phần đầu phân loại (chỉ dành cho classify)
ioufloat0.70.1-0.9Ngưỡng IoU cho NMS trong quá trình xác thực
max_detint3001-10000Số lượng phát hiện tối đa trên mỗi ảnh
Tham số đặc thù cho từng tác vụ

Một số tham số chỉ áp dụng cho các tác vụ cụ thể:

  • Every task except classify and depth (detect, segment, semantic, pose, obb): box, dfl, mosaic, mixup, close_mosaic, iou, max_det
  • Every task except depth (the tasks with classes): cls, label_smoothing, single_cls
  • Every task except classify (detect, segment, semantic, depth, pose, obb): degrees, translate, shear, perspective
  • Chỉ segment: copy_paste
  • Chỉ pose: pose (trọng số mất mát), kobj (tính khách thể của keypoint)
  • Chỉ dành cho classify: dropout

Câu hỏi thường gặp#

  • Thời gian huấn luyện phụ thuộc vào:

    • Kích thước tập dữ liệu
    • Kích thước model
    • Số lượng epoch
    • GPU đã chọn

    Thời gian tiêu biểu (1000 ảnh, 100 epochs):

    Mô hìnhRTX PRO 6000A100 SXM
    YOLO26n~6 phút~5 phút
    YOLO26m~15 phút~12 phút
    YOLO26x~30 phút~25 phút
    Thời gian ước tính

    Thời gian huấn luyện là ước tính và thay đổi tùy theo độ phức tạp của tập dữ liệu, cài đặt tăng cường dữ liệu và batch size. Sử dụng công cụ ước tính chi phí của hộp thoại huấn luyện để có dự đoán chính xác hơn.

  • Có. Quá trình huấn luyện có thể chạy tự động không cần giám sát miễn là vẫn còn đủ kinh phí, và Platform sẽ ghi lại sự kiện hoàn thành hoặc thất bại. Nếu việc đo lường làm cho số dư giảm xuống dưới số không, các lượt chạy cloud trả phí đang hoạt động sẽ dừng lại và thanh toán thời gian GPU đã sử dụng.

  • Mức sử dụng đám mây được đo lường khi quá trình huấn luyện diễn ra. Nếu một khoản phí làm giảm số dư của bạn xuống dưới số không, các lượt chạy cloud trả phí đang hoạt động sẽ bị dừng và thanh toán cho thời gian GPU đã sử dụng. Thêm tín dụng hoặc bật tính năng tự động nạp tiền để giữ cho các tác vụ chạy dài hạn được duy trì kinh phí.

    Số dư âm

    Số dư bằng không hoặc âm sẽ ngăn chặn các tác vụ cloud training trả phí mới. Số dư đo lường âm cũng kích hoạt việc tắt các lượt chạy cloud training trả phí đang hoạt động.

  • Ước tính chi phí mang tính xấp xỉ — thời gian huấn luyện thực tế có thể thay đổi do các yếu tố như tốc độ tải dữ liệu, thời gian khởi động GPU và hành vi hội tụ của model. Nếu mức sử dụng thực tế làm cạn kiệt số dư khả dụng, Platform sẽ dừng các lượt chạy cloud trả phí đang hoạt động sau khi số dư chuyển sang âm.

    Để quản lý chi phí:

    • Theo dõi tiến trình huấn luyện theo thời gian thực và hủy sớm nếu cần
    • Bật tự động nạp tiền để tự động bổ sung credit
    • Bắt đầu với các lượt chạy ngắn hơn (ít epoch hơn) để điều chỉnh kỳ vọng
  • Có, hãy mở rộng phần Advanced Settings trong hộp thoại huấn luyện để truy cập trình soạn thảo YAML với hơn 50 tham số có thể định cấu hình. Các giá trị không mặc định được bao gồm trong cả lệnh huấn luyện trên đám mây và cục bộ.

    Trình soạn thảo YAML cũng hỗ trợ nhập cấu hình từ các lượt huấn luyện trước đó:

    • Copy from existing model: Trên trang của bất kỳ mô hình nào đã hoàn thành, thẻ Training Configuration có menu Export data với tùy chọn Copy JSON. Dán trực tiếp JSON vào trình soạn thảo YAML — nó sẽ tự động phát hiện định dạng JSON và nhập tất cả các tham số. Menu tương tự cũng cho phép tải xuống cấu hình dưới dạng CSV hoặc JSON.
    • Paste YAML or JSON: Dán bất kỳ cấu hình huấn luyện YAML hoặc JSON hợp lệ nào vào trình soạn thảo. Các tham số được xác thực tự động, với các giá trị ngoài phạm vi được kẹp lại và các cảnh báo được hiển thị.
    • Kéo và thả tệp: Kéo trực tiếp tệp .yaml hoặc .json vào trình chỉnh sửa để nhập các tham số của nó.

    Ultralytics Platform Training Dialog Copy Training Config JSON Điều này giúp dễ dàng tái tạo hoặc lặp lại các cấu hình huấn luyện trước đó mà không cần nhập lại thủ công từng tham số.

  • Có. Một mô hình bị lỗi hiển thị biểu ngữ lỗi kèm theo hành động Retry để mở lại hộp thoại huấn luyện với cùng mô hình cơ sở, tập dữ liệu và các tham số, cho phép bạn điều chỉnh một giá trị và bắt đầu lại. Việc thử lại sẽ tái sử dụng trang mô hình đó: các biểu đồ, đầu ra bảng điều khiển, số liệu hệ thống và lỗi của lần chạy trước sẽ bị xóa ngay khi tác vụ mới được tạo và trọng số của nó sẽ được thay thế khi lần chạy mới tạo ra một checkpoint tốt hơn.

  • Có, nút New Model trên các trang tập dữ liệu sẽ mở hộp thoại huấn luyện với tập dữ liệu đã được chọn sẵn và khóa lại. Sau đó, bạn chọn một dự án và model để bắt đầu huấn luyện.

Bình luận