YOLO Vision 2026:

Tập dữ liệu Caltech-256#

Bộ dữ liệu Caltech-256 là một benchmark phân loại ảnh cổ điển với 30.607 hình ảnh bao trùm 256 danh mục đối tượng cộng với một lớp nền. Mỗi danh mục chứa ít nhất 80 hình ảnh về các đối tượng trong thế giới thực — động vật, phương tiện, vật dụng gia đình và con người — biến nó thành một phiên bản kế nhiệm lớn hơn, thử thách hơn của Caltech-101 cho các mô hình nhận dạng đối tượng.

Khám phá Caltech-256 trên Ultralytics Platform để xem trước các mẫu, kiểm tra thống kê dataset và nhân bản nó để huấn luyện.



Watch: How to Train Image Classification Model using Caltech-256 Dataset with Ultralytics YOLO26
Tự động phân chia dữ liệu

Caltech-256 được phân phối mà không có sẵn cấu trúc tách train/validation. Các lệnh huấn luyện bên dưới sẽ tự động tách tập dữ liệu theo tỷ lệ 80% train / 20% validation, vì vậy bạn không cần chuẩn bị thủ công.

Tính năng chính#

  • Caltech-256 chứa 30.607 hình ảnh màu trải trên 256 danh mục đối tượng cộng với một lớp nền 257.clutter (tổng cộng 257 thư mục lớp).
  • Các danh mục bao gồm nhiều đối tượng thực tế đa dạng, bao gồm động vật, phương tiện, đồ gia dụng và con người.
  • Mỗi danh mục chứa ít nhất 80 hình ảnh, với danh mục lớn nhất chứa khoảng 800 hình ảnh, vì vậy kích thước các lớp bị mất cân bằng.
  • Hình ảnh có kích thước và độ phân giải không đồng nhất.
  • Caltech-256 được sử dụng rộng rãi để làm benchmark cho các thuật toán phân loại ảnh và nhận dạng đối tượng.

Cấu trúc tập dữ liệu#

Caltech-256 được phân phối dưới dạng 257 thư mục — mỗi thư mục cho một lớp, bao gồm 256 danh mục đối tượng cộng với một lớp nền 257.clutter — không có tập chia huấn luyện/kiểm định được định nghĩa trước. Khi bạn khởi chạy quá trình huấn luyện, Ultralytics sẽ tự động phân chia các hình ảnh để các mô hình huấn luyện trên tất cả 257 lớp mà không cần thiết lập thủ công nào:

  • Các lớp: 257 (256 danh mục đối tượng + 1 lớp nền)
  • Tổng số hình ảnh: 30.607
  • Tỷ lệ train/validation: tự động 80% / 20% (≈24.385 train, ≈6.222 validation)
  • Số lượng hình ảnh mỗi lớp: ít nhất 80 (không cân bằng, lên đến khoảng 800)

Ứng dụng#

Bộ dữ liệu Caltech-256 được sử dụng rộng rãi để huấn luyện và đánh giá các mô hình phân loại ảnh và nhận dạng đối tượng, bao gồm Mạng thần kinh tích chập (CNN) và Máy vector hỗ trợ (SVM). Số lượng danh mục lớn và hình ảnh chất lượng cao biến nó thành một benchmark phổ biến cho việc nghiên cứu và tạo mẫu máy họcthị giác máy tính.

Cách sử dụng#

Huấn luyện một mô hình YOLO trên Caltech-256 trong 100 epoch với kích thước ảnh là 416. Để có danh sách đầy đủ các tham số khả dụng, hãy xem trang Huấn luyện và hướng dẫn tác vụ phân loại ảnh.

Ví dụ về Training
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="caltech256", epochs=100, imgsz=416)

Hình ảnh mẫu và chú thích#

Bộ dữ liệu Caltech-256 chứa các hình ảnh màu chất lượng cao của nhiều đối tượng khác nhau, cung cấp một bộ dữ liệu có cấu trúc tốt cho các tác vụ phân loại ảnh. Dưới đây là một số ví dụ về hình ảnh từ bộ dữ liệu (nghiên cứu gốc):

Mẫu bộ dữ liệu phân loại ảnh Caltech-256

Các mẫu này cho thấy sự đa dạng và phức tạp của các đối tượng trong tập dữ liệu Caltech-256, làm nổi bật giá trị của một tập dữ liệu đa dạng để huấn luyện các model nhận diện đối tượng mạnh mẽ.

Trích dẫn và Ghi nhận#

Nếu bạn sử dụng tập dữ liệu Caltech-256 trong công việc nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:

Trích dẫn
@article{griffin2007caltech,
         title={Caltech-256 object category dataset},
         author={Griffin, Gregory and Holub, Alex and Perona, Pietro},
         year={2007}
}

Chúng tôi muốn gửi lời cảm ơn đến Gregory Griffin, Alex Holub và Pietro Perona vì đã tạo và duy trì bộ dữ liệu Caltech-256 như một tài nguyên có giá trị cho cộng đồng nghiên cứu máy học và thị giác máy tính. Để biết thêm thông tin về bộ dữ liệu Caltech-256 và những người tạo ra nó, hãy truy cập trang web bộ dữ liệu Caltech-256.

Câu hỏi thường gặp#

  • Bộ dữ liệu Caltech-256 được sử dụng rộng rãi để huấn luyện và benchmark các mô hình phân loại ảnh và nhận dạng đối tượng. Nó chứa 30.607 hình ảnh trải trên 256 danh mục đối tượng cộng với một lớp nền, cung cấp một benchmark lớn hơn và thử thách hơn so với Caltech-101 cho các thuật toán như Mạng thần kinh tích chập (CNN) và Máy vector hỗ trợ (SVM).

  • Để huấn luyện một mô hình Ultralytics YOLO trên Caltech-256, hãy sử dụng các đoạn mã dưới đây. Bộ dữ liệu sẽ tự động tải xuống trong lần sử dụng đầu tiên. Để có danh sách đầy đủ các tham số, hãy xem trang Huấn luyện của mô hình.

    Ví dụ về Training
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="caltech256", epochs=100, imgsz=416)
  • Caltech-256 chứa 256 danh mục đối tượng cộng với một lớp nền 257.clutter, tổng cộng có 257 thư mục lớp và 30.607 hình ảnh. Khi bạn huấn luyện với Ultralytics, mô hình sẽ học tất cả 257 lớp. Mỗi danh mục chứa ít nhất 80 hình ảnh, nhưng kích thước các lớp không đồng đều, lớp lớn nhất chứa tới khoảng 800 hình ảnh.

  • Caltech-256 không có phân chia định sẵn. Lần đầu tiên bạn huấn luyện, Ultralytics sẽ tự động chia nó thành 80% huấn luyện / 20% kiểm định — khoảng 24.385 ảnh huấn luyện và 6.222 ảnh kiểm định — vì vậy bạn không cần phải tự tạo các tập chia. Để tự kiểm soát việc phân chia, hãy sắp xếp các hình ảnh vào các thư mục train/val/ trước khi huấn luyện.

  • Có. Ultralytics Platform cho phép bạn quản lý các bộ dữ liệu, huấn luyện các mô hình phân loại ảnh và triển khai chúng mà không cần viết quá nhiều mã. Đây là một cách thuận tiện để chạy các thí nghiệm Caltech-256 trên đám mây và bạn có thể khám phá thêm nhiều tùy chọn trong tổng quan về bộ dữ liệu phân loại của chúng tôi.

Bình luận