Ultralytics YOLO27:
Get Started

Bộ dữ liệu đầu lúa mì toàn cầu#

Bộ dữ liệu đầu lúa mì toàn cầu (GWHD) là bộ dữ liệu phát hiện đối tượng một lớp, dùng để phát hiện bông lúa mì — phần bông mang hạt của cây lúa mì — trong ảnh chụp ngoài đồng. Bộ dữ liệu cung cấp 3.422 ảnh huấn luyện, 748 ảnh validation và 1.276 ảnh kiểm thử được thu thập tại nhiều vùng canh tác; bộ dữ liệu được tạo ra nhờ sự hợp tác của chín viện nghiên cứu thuộc bảy quốc gia để model có thể tổng quát hóa trên các môi trường khác nhau. Phát hiện chính xác bông lúa mì là cơ sở để ước tính mật độ, kích thước bông và tiềm năng năng suất trong định kiểu hình thực vật và quản lý cây trồng.

Tính năng chính#

  • Ảnh chụp ngoài đồng trong điều kiện thực tế, ghi lại sự biến thiên tự nhiên về hình dạng bông lúa mì, ánh sáng và giai đoạn sinh trưởng.
  • Được xây dựng bởi chín viện nghiên cứu tại bảy quốc gia, bao quát các vùng canh tác ở châu Âu, Bắc Mỹ, châu Á và Úc, giúp tăng cường khả năng tổng quát hóa giữa các môi trường.
  • Annotation bounding box cho một lớp duy nhất, wheat_head, sẵn sàng cho các pipeline phát hiện đối tượng và tracking.
  • Ảnh kiểm thử được lấy từ các kiểu gene và khu vực không xuất hiện trong quá trình huấn luyện, tạo nên một benchmark tổng quát hóa thực sự.

Cấu trúc dataset#

Bộ dữ liệu đầu lúa mì toàn cầu được tổ chức thành ba tập con theo cấu hình GlobalWheat2020.yaml; tất cả đều được gắn nhãn với một lớp duy nhất, wheat_head:

Tập dữ liệuHình ảnhKhu vực
Huấn luyện3,422Châu Âu (Pháp, Anh, Thụy Sĩ), Bắc Mỹ (Canada)
Validation748Thụy Sĩ (ETH Zürich)
Kiểm thử1,276Úc, Nhật Bản, Trung Quốc
Tập validation

Tập validation (748 ảnh) là tập con ethz_1, đồng thời cũng nằm trong tập training — vì vậy các metric validation được đo trên những ảnh mà model cũng dùng để training. Tập test tách biệt từ Australia, Japan và China đo lường khả năng tổng quát hóa trong các môi trường chưa xuất hiện trong quá trình training.

Ứng dụng#

Global Wheat Head Dataset được sử dụng rộng rãi để training và đánh giá các model deep learning phát hiện bông lúa mì. Hình ảnh đa dạng từ nhiều khu vực, kiểu gene và điều kiện khác nhau khiến dataset này trở thành tài nguyên quý giá cho phân tích kiểu hình thực vật và quản lý cây trồng — hỗ trợ ước tính năng suất, giám sát sức khỏe cây trồng và phân tích kiểu hình.

Để gán nhãn ảnh thực địa, training và quản lý các phiên bản dataset ngay trên trình duyệt, hãy chạy toàn bộ quy trình bằng Ultralytics Platform.

YAML của dataset#

Tệp YAML được dùng để xác định cấu hình dataset. Tệp này định nghĩa các đường dẫn, class và thông tin cấu hình khác của dataset. Đối với Global Wheat Head Dataset, tệp GlobalWheat2020.yaml được duy trì tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/GlobalWheat2020.yaml.

ultralytics/cfg/datasets/GlobalWheat2020.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# Global Wheat 2020 dataset https://www.global-wheat.com/ by University of Saskatchewan
# Documentation: https://docs.ultralytics.com/datasets/detect/globalwheat2020
# Example usage: yolo train data=GlobalWheat2020.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── GlobalWheat2020 ← downloads here (7.0 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: GlobalWheat2020 # dataset root dir
train: # train images (relative to 'path') 3422 images
  - images/arvalis_1
  - images/arvalis_2
  - images/arvalis_3
  - images/ethz_1
  - images/rres_1
  - images/inrae_1
  - images/usask_1
val: # val images (relative to 'path') 748 images (WARNING: train set contains ethz_1)
  - images/ethz_1
test: # test images (optional) 1276 images
  - images/utokyo_1
  - images/utokyo_2
  - images/nau_1
  - images/uq_1

# Classes
names:
  0: wheat_head

# Download script/URL (optional) ---------------------------------------------------------------------------------------
download: |
  from pathlib import Path

  from ultralytics.utils.downloads import download

  # Download
  dir = Path(yaml["path"])  # dataset root dir
  urls = [
      "https://zenodo.org/record/4298502/files/global-wheat-codalab-official.zip",
      "https://github.com/ultralytics/assets/releases/download/v0.0.0/GlobalWheat2020_labels.zip",
  ]
  download(urls, dir=dir)

  # Make Directories
  for p in "annotations", "images", "labels":
      (dir / p).mkdir(parents=True, exist_ok=True)

  # Move
  for p in (
      "arvalis_1",
      "arvalis_2",
      "arvalis_3",
      "ethz_1",
      "rres_1",
      "inrae_1",
      "usask_1",
      "utokyo_1",
      "utokyo_2",
      "nau_1",
      "uq_1",
  ):
      (dir / "global-wheat-codalab-official" / p).rename(dir / "images" / p)  # move to /images
      f = (dir / "global-wheat-codalab-official" / p).with_suffix(".json")  # json file
      if f.exists():
          f.rename((dir / "annotations" / p).with_suffix(".json"))  # move to /annotations

Cách sử dụng#

Để training model YOLO26n trên Global Wheat Head Dataset trong 100 epoch với kích thước ảnh 640, bạn có thể dùng các đoạn code sau. Dataset (~7.0 GB) sẽ tự động tải xuống trong lần sử dụng đầu tiên. Để xem danh sách đầy đủ các tham số hiện có, hãy tham khảo trang Training của model.

Ví dụ huấn luyện
from ultralytics import YOLO

# Tải model
model = YOLO("yolo26n.pt")  # tải model đã huấn luyện trước (được khuyến nghị khi huấn luyện)

# Huấn luyện model
results = model.train(data="GlobalWheat2020.yaml", epochs=100, imgsz=640)

Hình ảnh mẫu và annotation#

Global Wheat Head Dataset bao gồm nhiều ảnh thực địa ngoài trời, ghi lại sự biến thiên tự nhiên về hình dạng bông lúa mì, môi trường và điều kiện. Dưới đây là ảnh mẫu từ dataset cùng với các chú thích tương ứng:

Ảnh mẫu Global Wheat, minh họa phát hiện bông lúa mì

  • Phát hiện bông lúa mì: Bông lúa mì được gán nhãn bằng bounding box để phát hiện đối tượng trong nhiều điều kiện thực địa khác nhau, phản ánh sự đa dạng và phức tạp của dataset.

Trích dẫn và lời cảm ơn#

Nếu sử dụng Global Wheat Head Dataset trong nghiên cứu hoặc phát triển, vui lòng trích dẫn bài báo sau:

Trích dẫn
@article{david2020global,
         title={Global Wheat Head Detection (GWHD) Dataset: A Large and Diverse Dataset of High-Resolution RGB-Labelled Images to Develop and Benchmark Wheat Head Detection Methods},
         author={David, Etienne and Madec, Simon and Sadeghi-Tehran, Pouria and Aasen, Helge and Zheng, Bangyou and Liu, Shouyang and Kirchgessner, Norbert and Ishikawa, Goro and Nagasawa, Koichi and Badhon, Minhajul and others},
         journal={arXiv preprint arXiv:2005.02162},
         year={2020}
}

Chúng tôi xin ghi nhận các nhà nghiên cứu và tổ chức đã đóng góp vào việc tạo lập và duy trì Global Wheat Head Dataset như một tài nguyên quý giá cho cộng đồng nghiên cứu phân tích kiểu hình thực vật và quản lý cây trồng. Để biết thêm thông tin về dataset và những người tạo ra dataset, hãy truy cập trang web Global Wheat Head Dataset.

Câu hỏi thường gặp#

  • Global Wheat Head Dataset chủ yếu được dùng để phát triển và training các model deep learning nhằm phát hiện bông lúa mì. Đây là yếu tố quan trọng đối với các ứng dụng phân tích kiểu hình lúa mì và quản lý cây trồng, giúp ước tính chính xác hơn mật độ, kích thước bông lúa mì và tiềm năng năng suất tổng thể của cây trồng. Các phương pháp phát hiện chính xác giúp đánh giá sức khỏe và độ trưởng thành của cây trồng, những yếu tố thiết yếu để quản lý cây trồng hiệu quả.

  • Global Wheat Head Dataset có một class duy nhất, wheat_head, và được chia thành ba tập con: 3,422 ảnh training, 748 ảnh validation và 1,276 ảnh test. Ảnh training và validation đến từ Europe và North America, trong khi tập test được lấy từ Australia, Japan và China để đánh giá khả năng tổng quát hóa trong các môi trường chưa từng gặp.

  • Để training model YOLO26n trên Global Wheat Head Dataset, bạn có thể dùng các đoạn code sau. Hãy đảm bảo bạn có tệp cấu hình GlobalWheat2020.yaml chỉ định đường dẫn dataset và các class:

    Ví dụ huấn luyện
    from ultralytics import YOLO
    
    # Tải model pretrained (khuyến nghị khi training)
    model = YOLO("yolo26n.pt")
    
    # Huấn luyện model
    results = model.train(data="GlobalWheat2020.yaml", epochs=100, imgsz=640)

    Để xem danh sách đầy đủ các tham số hiện có, hãy tham khảo trang Training của model.

  • Dataset (~7.0 GB) sẽ tự động tải xuống trong lần đầu tiên bạn training với data="GlobalWheat2020.yaml" — không cần thao tác thủ công. Ultralytics tải ảnh và nhãn xuống, rồi giải nén vào thư mục datasets cục bộ của bạn. Bạn có thể duyệt các dataset liên quan trong tổng quan về dataset phát hiện.

  • Tệp cấu hình YAML của Global Wheat Head Dataset có tên GlobalWheat2020.yaml và được lưu trên GitHub. Bạn có thể truy cập tệp tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/GlobalWheat2020.yaml. Tệp này chứa các đường dẫn dataset, class và thông tin cấu hình khác cần thiết để training model trong Ultralytics YOLO.

  • Phát hiện bông lúa mì đóng vai trò thiết yếu trong quản lý cây trồng vì cho phép ước tính chính xác mật độ và kích thước bông lúa mì, những yếu tố cần thiết để đánh giá sức khỏe, độ trưởng thành và tiềm năng năng suất của cây trồng. Bằng cách tận dụng các model deep learning được training trên những dataset như Global Wheat Head Dataset, nông dân và nhà nghiên cứu có thể giám sát và quản lý cây trồng tốt hơn, từ đó cải thiện năng suất và tối ưu hóa việc sử dụng tài nguyên trong hoạt động nông nghiệp. Tiến bộ công nghệ này hỗ trợ nông nghiệp bền vững và các sáng kiến đảm bảo an ninh lương thực.

    Để biết thêm thông tin về các ứng dụng AI trong nông nghiệp, hãy truy cập AI trong nông nghiệp.

Bình luận