Bộ dữ liệu ImageNet#
Bộ dữ liệu Ultralytics ImageNet (data="imagenet") là tập con ImageNet-1k / ILSVRC-2012 được dùng để huấn luyện và đánh giá benchmark cho các model phân loại ảnh. Bộ dữ liệu chứa 1.000 lớp đối tượng, với 1.281.167 ảnh huấn luyện và 50.000 ảnh validation, thường được huấn luyện ở kích thước ảnh 224x224 và tải xuống với dung lượng khoảng 144 GB. Cơ sở dữ liệu ImageNet rộng hơn có quy mô lớn hơn nhiều — hơn 14 triệu ảnh độ phân giải cao được gán nhãn bằng các synset WordNet thuộc hơn 20.000 danh mục — nhưng Ultralytics huấn luyện trên tập con ILSVRC tiêu chuẩn gồm 1.000 lớp, tập dữ liệu đã trở thành benchmark mặc định cho deep learning trong thị giác máy tính.
Model ImageNet được huấn luyện trước#
| Model | kích thước (pixel) | acc top1 | acc top5 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) ở 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
Tính năng chính#
- Bộ dữ liệu Ultralytics
imagenetcung cấp 1.000 lớp với 1.281.167 ảnh huấn luyện và 50.000 ảnh validation (ILSVRC-2012), benchmark tiền huấn luyện tiêu chuẩn cho phân loại ảnh. - Các lớp được tổ chức theo hệ phân cấp WordNet, trong đó mỗi lớp tương ứng với một synset (một tập hợp các từ đồng nghĩa).
- Ảnh được huấn luyện ở kích thước 224x224; toàn bộ bộ dữ liệu cần tải xuống với dung lượng lớn, khoảng ~144 GB.
- Cuộc thi Nhận dạng Hình ảnh Quy mô Lớn ImageNet (ILSVRC) thường niên đã đóng vai trò quan trọng trong việc thúc đẩy nghiên cứu thị giác máy tính.
Cấu trúc dataset#
Bộ dữ liệu Ultralytics ImageNet sử dụng cách chia tập ILSVRC-2012:
| Tập dữ liệu | Hình ảnh | Các lớp |
|---|---|---|
| Huấn luyện | 1,281,167 | 1,000 |
| Validation | 50,000 | 1,000 |
Ảnh được lưu trong các thư mục riêng cho từng lớp, đặt tên theo ID synset WordNet (ví dụ: n01440764), đúng với cấu trúc mà quy trình huấn luyện phân loại của Ultralytics yêu cầu. Mỗi trong số 1.000 lớp ánh xạ tới một synset WordNet; không có tập kiểm tra riêng, vì vậy tập validation gồm 50.000 ảnh được dùng để đo độ chính xác.
ImageNet-1k cần tải xuống khoảng ~144 GB, vì vậy hãy đảm bảo bạn có đủ dung lượng ổ đĩa trước khi huấn luyện. Để thử nghiệm nhanh, các tập con ImageNette và ImageNet10 nhỏ hơn sử dụng cùng định dạng thư mục và có thời gian huấn luyện chỉ bằng một phần nhỏ.
Cuộc thi Nhận dạng Hình ảnh Quy mô Lớn ImageNet (ILSVRC)#
Cuộc thi Nhận dạng Hình ảnh Quy mô Lớn ImageNet (ILSVRC) thường niên cho phép các nhà nghiên cứu đánh giá benchmark thuật toán trên một bộ dữ liệu quy mô lớn, tiêu chuẩn hóa với các metric đánh giá nhất quán. Cuộc thi thúc đẩy những tiến bộ lớn trong deep learning cho phân loại ảnh, phát hiện đối tượng và các tác vụ thị giác khác — nổi bật nhất là chiến thắng của AlexNet năm 2012, góp phần mở đầu kỷ nguyên deep learning hiện đại.
Ứng dụng#
Bộ dữ liệu ImageNet được sử dụng rộng rãi để huấn luyện và đánh giá các model deep learning cho phân loại ảnh, phát hiện đối tượng và định vị đối tượng. Các kiến trúc mang tính bước ngoặt như AlexNet, VGG và ResNet đều được phát triển và đánh giá benchmark trên ImageNet; các trọng số được huấn luyện trước trên ImageNet vẫn là điểm khởi đầu phổ biến cho transfer learning trên nhiều tác vụ thị giác.
Cách sử dụng#
Để huấn luyện model phân loại YOLO trên ImageNet trong 100 epoch với kích thước ảnh 224x224, hãy sử dụng các đoạn mã bên dưới. Để xem danh sách toàn diện các tham số hiện có, hãy tham khảo trang Huấn luyện của model.
from ultralytics import YOLO
# Tải model
model = YOLO("yolo26n-cls.pt") # tải model đã huấn luyện trước (được khuyến nghị khi huấn luyện)
# Huấn luyện model
results = model.train(data="imagenet", epochs=100, imgsz=224)Bạn cũng có thể quản lý bộ dữ liệu phân loại và chạy huấn luyện trên cloud bằng Ultralytics Platform.
Hình ảnh mẫu và annotation#
Bộ dữ liệu ImageNet bao gồm 1.000 lớp ILSVRC-2012, cung cấp một tài nguyên đa dạng và phong phú để huấn luyện và đánh giá các model thị giác máy tính. Dưới đây là một số ảnh mẫu từ bộ dữ liệu:

Trích dẫn và lời cảm ơn#
Nếu sử dụng dataset ImageNet trong nghiên cứu hoặc công việc phát triển, vui lòng trích dẫn bài báo sau:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Chúng tôi xin ghi nhận công lao của nhóm ImageNet, do Olga Russakovsky, Jia Deng và Li Fei-Fei dẫn dắt, trong việc tạo và duy trì bộ dữ liệu ImageNet như một tài nguyên giá trị cho cộng đồng nghiên cứu machine learning và thị giác máy tính. Để biết thêm thông tin về bộ dữ liệu ImageNet và những người tạo ra bộ dữ liệu, hãy truy cập trang web ImageNet.
Câu hỏi thường gặp#
Bộ dữ liệu ImageNet là cơ sở dữ liệu ảnh quy mô lớn; bộ sưu tập mở rộng của bộ dữ liệu này có hơn 14 triệu ảnh độ phân giải cao được gán nhãn bằng các synset WordNet. Trong Ultralytics,
data="imagenet"huấn luyện trên tập con ILSVRC-2012 tiêu chuẩn gồm 1.000 lớp, benchmark mặc định cho tiền huấn luyện phân loại ảnh. Các model mang tính bước ngoặt như AlexNet, VGG và ResNet được huấn luyện và đánh giá benchmark trên ImageNet, cho thấy vai trò của bộ dữ liệu này trong việc thúc đẩy thị giác máy tính.Bộ dữ liệu Ultralytics
imagenetsử dụng tập con ILSVRC-2012 gồm 1.000 lớp, 1.281.167 ảnh huấn luyện và 50.000 ảnh validation, thường được huấn luyện ở kích thước ảnh 224x224, với tổng dung lượng tải xuống khoảng 144 GB. Cơ sở dữ liệu ImageNet đầy đủ lớn hơn nhiều (hơn 14 triệu ảnh thuộc hơn 20.000 synset WordNet), nhưng tập con 1.000 lớp là tập được dùng để huấn luyện và đánh giá benchmark phân loại.Để huấn luyện model Ultralytics YOLO trên ImageNet, hãy tải một model phân loại đã được huấn luyện trước và trỏ
datađếnimagenet:Ví dụ huấn luyệnfrom ultralytics import YOLO # Tải model model = YOLO("yolo26n-cls.pt") # tải model đã huấn luyện trước (được khuyến nghị khi huấn luyện) # Huấn luyện model results = model.train(data="imagenet", epochs=100, imgsz=224)Để xem hướng dẫn huấn luyện chuyên sâu hơn, hãy tham khảo trang Huấn luyện của chúng tôi.
Các model Ultralytics YOLO26 được huấn luyện trước mang lại hiệu năng tiên tiến về tốc độ và độ chính xác cho nhiều tác vụ thị giác máy tính. Ví dụ, model YOLO26n-cls có độ chính xác top-1 là 71.4% và top-5 là 90.1%, được tối ưu hóa cho các ứng dụng thời gian thực. Model được huấn luyện trước giúp giảm tài nguyên tính toán cần thiết so với huấn luyện từ đầu và rút ngắn chu kỳ phát triển. Tìm hiểu thêm về các metric hiệu năng của model YOLO26 trong mục Model được huấn luyện trước trên ImageNet.
Cuộc thi Nhận dạng Hình ảnh Quy mô Lớn ImageNet (ILSVRC) thường niên thúc đẩy tiến bộ trong thị giác máy tính bằng cách cung cấp một nền tảng cạnh tranh để đánh giá thuật toán trên bộ dữ liệu quy mô lớn, tiêu chuẩn hóa. Các metric đánh giá nhất quán của cuộc thi thúc đẩy đổi mới trong phân loại ảnh, phát hiện đối tượng và phân đoạn ảnh, liên tục mở rộng giới hạn của deep learning và thị giác máy tính.