Tập dữ liệu ImageNet#
Bộ dữ liệu Ultralytics ImageNet (data="imagenet") là tập con ImageNet-1k / ILSVRC-2012 được sử dụng để huấn luyện và đánh giá các mô hình phân loại ảnh. Nó chứa 1.000 lớp đối tượng với 1.281.167 ảnh huấn luyện và 50.000 ảnh xác thực ở kích thước ảnh 224x224, và tải xuống khoảng 144 GB dữ liệu. Cơ sở dữ liệu ImageNet rộng lớn hơn rất nhiều — hơn 14 triệu ảnh độ phân giải cao được chú thích bằng các tập đồng nghĩa WordNet trên hơn 20.000 danh mục — nhưng Ultralytics huấn luyện trên tập con ILSVRC 1.000 lớp tiêu chuẩn đã trở thành chuẩn mực thực tế cho học sâu trong thị giác máy tính.
Các mô hình được huấn luyện trước trên ImageNet#
| Mô hình | kích thước (pixel) | acc top1 | acc top5 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) tại 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.5 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.6 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.9 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.2 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.6 |
Tính năng chính#
- Bộ dữ liệu Ultralytics
imagenetcung cấp 1.000 lớp với 1.281.167 ảnh huấn luyện và 50.000 ảnh xác thực (ILSVRC-2012), chuẩn mực tiền huấn luyện tiêu chuẩn cho phân loại ảnh. - Các lớp được tổ chức theo hệ thống phân cấp WordNet, trong đó mỗi lớp tương ứng với một synset (một tập hợp các thuật ngữ đồng nghĩa).
- Ảnh được huấn luyện ở kích thước 224x224, và toàn bộ tập dữ liệu là một tệp tải xuống lớn khoảng ~144 GB.
- Thử thách nhận dạng hình ảnh quy mô lớn ImageNet (ILSVRC) hàng năm đóng vai trò quan trọng trong việc thúc đẩy nghiên cứu về computer vision.
Cấu trúc tập dữ liệu#
Tập dữ liệu Ultralytics ImageNet sử dụng tập phân tách ILSVRC-2012:
| Split | Hình ảnh | Các lớp |
|---|---|---|
| Huấn luyện (Train) | 1,281,167 | 1,000 |
| Validation | 50,000 | 1,000 |
Ảnh được lưu trữ trong các thư mục theo từng lớp được đặt tên theo ID tập đồng nghĩa WordNet (ví dụ: n01440764), bố cục mà quá trình huấn luyện phân loại của Ultralytics mong đợi. Mỗi trong số 1.000 lớp ánh xạ tới một tập đồng nghĩa WordNet và không có tập kiểm tra riêng, vì vậy tập xác thực gồm 50.000 ảnh được sử dụng để đo lường độ chính xác.
ImageNet-1k có dung lượng tải xuống khoảng ~144 GB, vì vậy hãy đảm bảo bạn có đủ dung lượng đĩa trước khi huấn luyện. Đối với các thí nghiệm nhanh, các tập con nhỏ hơn ImageNette và ImageNet10 sử dụng cùng định dạng thư mục và huấn luyện trong một phần nhỏ thời gian.
Thử thách nhận dạng hình ảnh quy mô lớn ImageNet (ILSVRC)#
Cuộc thi thường niên ImageNet Large Scale Visual Recognition Challenge (ILSVRC) cho phép các nhà nghiên cứu đánh giá các thuật toán trên một bộ dữ liệu chuẩn hóa, quy mô lớn với các chỉ số đánh giá nhất quán. Nó thúc đẩy những tiến bộ lớn trong học sâu cho phân loại ảnh, phát hiện đối tượng và các tác vụ thị giác khác — đáng chú ý nhất là chiến thắng năm 2012 của AlexNet, giúp mở ra kỷ nguyên học sâu hiện đại.
Ứng dụng#
Bộ dữ liệu ImageNet được sử dụng rộng rãi để huấn luyện và đánh giá các mô hình học sâu cho việc phân loại ảnh, phát hiện đối tượng và định vị đối tượng. Các kiến trúc mang tính bước ngoặt như AlexNet, VGG và ResNet đều được phát triển và đánh giá trên ImageNet, và trọng số tiền huấn luyện ImageNet vẫn là điểm khởi đầu phổ biến cho học chuyển giao trên các tác vụ thị giác.
Cách sử dụng#
Để huấn luyện một mô hình phân loại YOLO trên ImageNet trong 100 chu kỳ (epoch) ở kích thước ảnh 224x224, hãy sử dụng các đoạn mã bên dưới. Để có danh sách toàn diện các tham số khả dụng, hãy tham khảo trang Huấn luyện của mô hình.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)Bạn cũng có thể quản lý các bộ dữ liệu phân loại và chạy huấn luyện trên đám mây với Ultralytics Platform.
Hình ảnh mẫu và chú thích#
Tập dữ liệu ImageNet bao gồm 1.000 lớp ILSVRC-2012, cung cấp một tài nguyên đa dạng và phong phú để huấn luyện và đánh giá các mô hình computer vision. Dưới đây là một số ví dụ về ảnh từ tập dữ liệu:

Trích dẫn và Ghi nhận#
Nếu bạn sử dụng tập dữ liệu ImageNet trong công việc nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Chúng tôi xin cảm ơn nhóm ImageNet, dẫn đầu bởi Olga Russakovsky, Jia Deng và Li Fei-Fei, vì đã tạo và duy trì bộ dữ liệu ImageNet như một tài nguyên có giá trị cho cộng đồng nghiên cứu máy học và thị giác máy tính. Để biết thêm thông tin về bộ dữ liệu ImageNet và những người sáng tạo ra nó, hãy truy cập trang web ImageNet.
Câu hỏi thường gặp#
Bộ dữ liệu ImageNet là một cơ sở dữ liệu hình ảnh quy mô lớn có bộ sưu tập rộng hơn chứa hơn 14 triệu hình ảnh độ phân giải cao được chú thích bằng các tập đồng nghĩa WordNet. Trong Ultralytics,
data="imagenet"huấn luyện trên tập con ILSVRC-2012 1.000 lớp tiêu chuẩn, là chuẩn mực thực tế cho việc tiền huấn luyện phân loại ảnh. Các mô hình mang tính bước ngoặt như AlexNet, VGG và ResNet đã được huấn luyện và đánh giá trên ImageNet, nhấn mạnh vai trò của nó trong việc thúc đẩy thị giác máy tính.Bộ dữ liệu Ultralytics
imagenetsử dụng tập con ILSVRC-2012 với 1.000 lớp, 1.281.167 ảnh huấn luyện và 50.000 ảnh xác thực ở kích thước ảnh 224x224, cho tổng dung lượng tải xuống khoảng 144 GB. Cơ sở dữ liệu ImageNet đầy đủ lớn hơn nhiều (hơn 14 triệu ảnh trên hơn 20.000 tập đồng nghĩa WordNet), nhưng tập con 1.000 lớp là tập được sử dụng để huấn luyện và đánh giá phân loại.Để huấn luyện một mô hình Ultralytics YOLO trên ImageNet, hãy tải một mô hình phân loại đã được tiền huấn luyện và trỏ
datatớiimagenet:Ví dụ về Trainingfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)Để có hướng dẫn huấn luyện chi tiết hơn, hãy tham khảo trang Huấn luyện của chúng tôi.
Các mô hình tiền huấn luyện Ultralytics YOLO26 mang lại hiệu suất tối tân về tốc độ và độ chính xác cho các tác vụ thị giác máy tính khác nhau. Ví dụ, mô hình YOLO26n-cls, với độ chính xác top-1 là 71,4% và độ chính xác top-5 là 90,1%, được tối ưu hóa cho các ứng dụng thời gian thực. Các mô hình tiền huấn luyện làm giảm tài nguyên tính toán cần thiết để huấn luyện từ đầu và đẩy nhanh chu kỳ phát triển. Tìm hiểu thêm về các chỉ số hiệu suất của các mô hình YOLO26 trong phần Mô hình tiền huấn luyện ImageNet.
Cuộc thi thường niên ImageNet Large Scale Visual Recognition Challenge (ILSVRC) đã thúc đẩy những tiến bộ trong thị giác máy tính bằng cách cung cấp một nền tảng cạnh tranh để đánh giá các thuật toán trên một bộ dữ liệu tiêu chuẩn hóa, quy mô lớn. Các chỉ số đánh giá nhất quán của nó thúc đẩy sự đổi mới trong phân loại ảnh, phát hiện đối tượng và phân đoạn ảnh, liên tục đẩy mạnh ranh giới của học sâu và thị giác máy tính.