Bộ dữ liệu Global Wheat Head Dataset#
The Global Wheat Head Dataset (GWHD) là một tập dữ liệu object detection đơn lớp dùng để phát hiện wheat heads — những bông mang hạt của cây lúa mì — trong các hình ảnh đồng ruộng ngoài trời. Tập dữ liệu này cung cấp 3.422 ảnh huấn luyện, 748 ảnh xác thực và 1.276 ảnh kiểm tra được thu thập từ nhiều vùng sinh trưởng khác nhau, và được tạo ra bởi sự hợp tác của chín viện nghiên cứu từ bảy quốc gia nhằm giúp các mô hình khái quát hóa tốt trên các môi trường khác nhau. Việc phát hiện bông lúa mì chính xác là nền tảng cho việc ước tính mật độ, kích thước và tiềm năng năng suất bông trong plant phenotyping và quản lý cây trồng.
Tính năng chính#
- Hình ảnh thực tế ngoài đồng nắm bắt sự biến đổi tự nhiên về hình dáng, ánh sáng và giai đoạn sinh trưởng của bông lúa mì.
- Được xây dựng bởi chín viện nghiên cứu trên bảy quốc gia, bao gồm các vùng canh tác tại Châu Âu, Bắc Mỹ, Châu Á và Úc để đạt được khả năng tổng quát hóa mạnh mẽ giữa các môi trường.
- Các chú thích bounding-box cho một lớp duy nhất,
wheat_head, sẵn sàng cho các pipeline object detection và tracking. - Các hình ảnh kiểm tra đến từ các kiểu gen và vùng địa lý chưa từng xuất hiện trong quá trình huấn luyện, mang lại một chuẩn đánh giá tổng quát hóa thực sự.
Cấu trúc tập dữ liệu#
The Global Wheat Head Dataset được tổ chức thành ba tập con được xác định bởi cấu hình GlobalWheat2020.yaml, tất cả đều được chú thích với một lớp duy nhất, wheat_head:
| Split | Hình ảnh | Các vùng |
|---|---|---|
| Huấn luyện (Train) | 3,422 | Châu Âu (Pháp, Anh, Thụy Sĩ), Bắc Mỹ (Canada) |
| Validation | 748 | Thụy Sĩ (ETH Zürich) |
| Kiểm thử | 1,276 | Úc, Nhật Bản, Trung Quốc |
Tập xác thực (748 ảnh) là tập con ethz_1, cũng là một phần của các miền huấn luyện — do đó các số liệu xác thực phản ánh hiệu suất trong miền. Tập kiểm tra được giữ lại từ Úc, Nhật Bản và Trung Quốc đo lường khả năng khái quát hóa sang các môi trường chưa từng thấy trong quá trình huấn luyện.
Ứng dụng#
The Global Wheat Head Dataset được sử dụng rộng rãi để huấn luyện và đánh giá các mô hình deep learning cho việc phát hiện bông lúa mì. Hình ảnh đa dạng của tập dữ liệu này qua các vùng, kiểu gen và điều kiện khiến nó trở thành một tài nguyên có giá trị cho plant phenotyping và quản lý cây trồng — hỗ trợ ước tính năng suất, theo dõi sức khỏe cây trồng và phân tích kiểu hình.
Để chú thích hình ảnh đồng ruộng, huấn luyện và quản lý các phiên bản tập dữ liệu ngay trong trình duyệt của bạn, hãy chạy toàn bộ quy trình làm việc với Ultralytics Platform.
YAML tập dữ liệu#
Một tệp YAML được sử dụng để xác định cấu hình tập dữ liệu. Nó định nghĩa các đường dẫn, các lớp và các chi tiết cấu hình khác của tập dữ liệu. Đối với The Global Wheat Head Dataset, tệp GlobalWheat2020.yaml được duy trì tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/GlobalWheat2020.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Global Wheat 2020 dataset https://www.global-wheat.com/ by University of Saskatchewan
# Documentation: https://docs.ultralytics.com/datasets/detect/globalwheat2020
# Example usage: yolo train data=GlobalWheat2020.yaml
# parent
# ├── ultralytics
# └── datasets
# └── GlobalWheat2020 ← downloads here (7.0 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: GlobalWheat2020 # dataset root dir
train: # train images (relative to 'path') 3422 images
- images/arvalis_1
- images/arvalis_2
- images/arvalis_3
- images/ethz_1
- images/rres_1
- images/inrae_1
- images/usask_1
val: # val images (relative to 'path') 748 images (WARNING: train set contains ethz_1)
- images/ethz_1
test: # test images (optional) 1276 images
- images/utokyo_1
- images/utokyo_2
- images/nau_1
- images/uq_1
# Classes
names:
0: wheat_head
# Download script/URL (optional) ---------------------------------------------------------------------------------------
download: |
from pathlib import Path
from ultralytics.utils.downloads import download
# Download
dir = Path(yaml["path"]) # dataset root dir
urls = [
"https://zenodo.org/record/4298502/files/global-wheat-codalab-official.zip",
"https://github.com/ultralytics/assets/releases/download/v0.0.0/GlobalWheat2020_labels.zip",
]
download(urls, dir=dir)
# Make Directories
for p in "annotations", "images", "labels":
(dir / p).mkdir(parents=True, exist_ok=True)
# Move
for p in (
"arvalis_1",
"arvalis_2",
"arvalis_3",
"ethz_1",
"rres_1",
"inrae_1",
"usask_1",
"utokyo_1",
"utokyo_2",
"nau_1",
"uq_1",
):
(dir / "global-wheat-codalab-official" / p).rename(dir / "images" / p) # move to /images
f = (dir / "global-wheat-codalab-official" / p).with_suffix(".json") # json file
if f.exists():
f.rename((dir / "annotations" / p).with_suffix(".json")) # move to /annotationsCách sử dụng#
Để huấn luyện mô hình YOLO26n trên The Global Wheat Head Dataset trong 100 epochs với kích thước ảnh là 640, bạn có thể sử dụng các đoạn mã sau. Tập dữ liệu (~7.0 GB) sẽ tự động tải xuống trong lần sử dụng đầu tiên. Để có danh sách đầy đủ các đối số khả dụng, hãy tham khảo trang Training của mô hình.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="GlobalWheat2020.yaml", epochs=100, imgsz=640)Hình ảnh mẫu và chú thích#
Global Wheat Head Dataset chứa một tập hợp đa dạng các hình ảnh thực tế ngoài đồng, ghi lại sự biến đổi tự nhiên về hình dáng, môi trường và điều kiện của bông lúa mì. Dưới đây là một ví dụ hình ảnh từ tập dữ liệu, cùng với các chú thích tương ứng của nó:

- Wheat Head Detection: Các bông lúa mì được chú thích bằng các bounding box cho object detection, trong nhiều điều kiện đồng ruộng khác nhau phản ánh tính đa dạng và phức tạp của tập dữ liệu.
Trích dẫn và Ghi nhận#
Nếu bạn sử dụng Global Wheat Head Dataset trong công việc nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:
@article{david2020global,
title={Global Wheat Head Detection (GWHD) Dataset: A Large and Diverse Dataset of High-Resolution RGB-Labelled Images to Develop and Benchmark Wheat Head Detection Methods},
author={David, Etienne and Madec, Simon and Sadeghi-Tehran, Pouria and Aasen, Helge and Zheng, Bangyou and Liu, Shouyang and Kirchgessner, Norbert and Ishikawa, Goro and Nagasawa, Koichi and Badhon, Minhajul and others},
journal={arXiv preprint arXiv:2005.02162},
year={2020}
}Chúng tôi xin gửi lời cảm ơn đến các nhà nghiên cứu và các tổ chức đã đóng góp vào việc tạo ra và duy trì The Global Wheat Head Dataset như một nguồn tài nguyên quý giá cho cộng đồng nghiên cứu về kiểu hình thực vật và quản lý cây trồng. Để biết thêm thông tin về tập dữ liệu và những người tạo ra nó, hãy truy cập Global Wheat Head Dataset website.
Câu hỏi thường gặp#
The Global Wheat Head Dataset chủ yếu được sử dụng để phát triển và huấn luyện các mô hình deep learning nhằm mục đích phát hiện bông lúa mì. Điều này rất quan trọng đối với các ứng dụng trong wheat phenotyping và quản lý cây trồng, cho phép ước tính chính xác hơn về mật độ, kích thước bông lúa mì và tiềm năng năng suất cây trồng tổng thể. Các phương pháp phát hiện chính xác giúp đánh giá sức khỏe và độ chín của cây trồng, điều cần thiết cho việc quản lý cây trồng hiệu quả.
The Global Wheat Head Dataset có một lớp duy nhất,
wheat_head, và được chia thành ba tập con: 3.422 ảnh huấn luyện, 748 ảnh xác thực và 1.276 ảnh kiểm tra. Ảnh huấn luyện và xác thực đến từ Châu Âu và Bắc Mỹ, trong khi tập kiểm tra được lấy từ Úc, Nhật Bản và Trung Quốc để đánh giá khả năng khái quát hóa sang các môi trường chưa từng thấy.Để huấn luyện mô hình YOLO26n trên The Global Wheat Head Dataset, bạn có thể sử dụng các đoạn mã sau. Đảm bảo rằng bạn có tệp cấu hình
GlobalWheat2020.yamlchỉ định các đường dẫn tập dữ liệu và các lớp:Ví dụ về Trainingfrom ultralytics import YOLO # Load a pretrained model (recommended for training) model = YOLO("yolo26n.pt") # Train the model results = model.train(data="GlobalWheat2020.yaml", epochs=100, imgsz=640)Để có danh sách toàn diện các đối số khả dụng, hãy tham khảo trang Training của mô hình.
Tập dữ liệu (~7.0 GB) sẽ tự động tải xuống lần đầu tiên bạn huấn luyện với
data="GlobalWheat2020.yaml"— không cần thực hiện bước thủ công nào. Ultralytics sẽ lấy hình ảnh và nhãn rồi giải nén chúng vào thư mục tập dữ liệu cục bộ của bạn. Bạn có thể duyệt qua các tập dữ liệu liên quan trong detection datasets overview.Tệp YAML cấu hình cho The Global Wheat Head Dataset, có tên
GlobalWheat2020.yaml, có sẵn trên GitHub. Bạn có thể truy cập tệp này tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/GlobalWheat2020.yaml. Tệp này chứa các đường dẫn tập dữ liệu, các lớp và các chi tiết cấu hình khác cần thiết cho việc huấn luyện mô hình trong Ultralytics YOLO.Việc phát hiện bông lúa mì đóng vai trò quan trọng trong quản lý cây trồng vì nó cho phép ước tính chính xác mật độ và kích thước bông lúa mì, những yếu tố cần thiết để đánh giá sức khỏe, độ chín và tiềm năng năng suất của cây trồng. Bằng cách tận dụng các deep learning models được huấn luyện trên các tập dữ liệu như The Global Wheat Head Dataset, nông dân và các nhà nghiên cứu có thể theo dõi và quản lý cây trồng tốt hơn, dẫn đến năng suất được cải thiện và tối ưu hóa việc sử dụng tài nguyên trong thực tiễn nông nghiệp. Tiến bộ công nghệ này hỗ trợ sustainable agriculture và các sáng kiến an ninh lương thực.
Để biết thêm thông tin về các ứng dụng của AI trong nông nghiệp, hãy truy cập AI in Agriculture.



