Ultralytics YOLO27:
Get Started

Các tác vụ thị giác máy tính được Ultralytics YOLO26 hỗ trợ#

Ultralytics YOLO supported computer vision tasks

Ultralytics YOLO26 là framework AI linh hoạt hỗ trợ nhiều tác vụ thị giác máy tính. Framework này có thể thực hiện phát hiện, phân đoạn, phân đoạn ngữ nghĩa, ước tính độ sâu, phân loại, ước tính tư thế và OBB. Mỗi tác vụ có mục tiêu và trường hợp sử dụng riêng, cho phép bạn giải quyết nhiều bài toán thị giác máy tính bằng một framework duy nhất.

Để biết thông tin về kế hoạch hỗ trợ YOLO27, hãy xem bản xem trước YOLO27. YOLO27 sẽ ra mắt trong thời gian tới và hiện chưa khả dụng; hướng dẫn này sử dụng các model YOLO26 đã phát hành.



Xem: Khám phá các tác vụ Ultralytics YOLO26: Phát hiện đối tượng, phân đoạn instance, phân đoạn ngữ nghĩa, ước tính độ sâu, phân loại, ước tính tư thế và OBB.

Phát hiện#

Phát hiện là tác vụ chính được YOLO26 hỗ trợ. Tác vụ này xác định đối tượng trong ảnh hoặc khung hình video và vẽ bounding box quanh đối tượng. Các đối tượng được phát hiện sẽ được phân loại thành những danh mục khác nhau dựa trên đặc trưng. YOLO26 có thể phát hiện nhiều đối tượng trong một ảnh hoặc khung hình video với độ chính xác và tốc độ cao, phù hợp với các ứng dụng thời gian thực như hệ thống giám sát và xe tự hành.

Ví dụ về phát hiện

Phân đoạn đối tượng#

Phân đoạn mở rộng khả năng phát hiện đối tượng bằng cách tạo mask ở cấp pixel cho từng đối tượng. Độ chính xác này hữu ích trong các ứng dụng như chẩn đoán hình ảnh y khoa, phân tích nông nghiệp và kiểm soát chất lượng trong sản xuất.

Ví dụ về phân đoạn

Phân đoạn ngữ nghĩa#

Phân đoạn ngữ nghĩa gán nhãn lớp cho từng pixel trong ảnh, tạo ra bản đồ lớp dày đặc cho toàn bộ khung cảnh. Không giống phân đoạn instance, phương pháp này không phân biệt các đối tượng riêng lẻ thuộc cùng một lớp. Vì vậy, phương pháp này lý tưởng cho lái xe tự hành, phân tích khung cảnh và lập bản đồ lớp phủ đất, nơi việc hiểu toàn bộ bố cục không gian quan trọng hơn việc nhận diện từng đối tượng.

Ví dụ về phân đoạn ngữ nghĩa

Ước lượng độ sâu#

Ước tính độ sâu đơn ảnh dự đoán bản đồ độ sâu theo từng pixel, tính bằng mét, từ một ảnh RGB duy nhất. Đầu ra là bản đồ float dày đặc được căn chỉnh với ảnh đầu vào, phù hợp cho tái dựng cảnh 3D, điều hướng robot và ứng dụng AR/VR, nơi cần suy luận bố cục không gian từ một camera duy nhất.

Ví dụ về ước tính độ sâu

Phân loại#

Phân loại là quá trình phân loại toàn bộ ảnh dựa trên nội dung. Tác vụ này thiết yếu cho các ứng dụng như phân loại sản phẩm trong thương mại điện tử, kiểm duyệt nội dung và giám sát động vật hoang dã.

Ví dụ về phân loại

Ước lượng tư thế#

Ước tính tư thế phát hiện các keypoint cụ thể trong ảnh hoặc khung hình video để theo dõi chuyển động hoặc ước tính tư thế. Các keypoint này có thể biểu thị khớp cơ thể người, đặc điểm khuôn mặt hoặc các điểm quan tâm quan trọng khác. YOLO26 vượt trội trong phát hiện keypoint với độ chính xác và tốc độ cao, hữu ích cho ứng dụng thể dục, phân tích thể thao và tương tác người-máy.

Ví dụ về tư thế

OBB#

Phát hiện hộp giới hạn định hướng (OBB) cải tiến phương pháp phát hiện đối tượng truyền thống bằng cách bổ sung góc định hướng để định vị đối tượng xoay chính xác hơn. Khả năng này đặc biệt hữu ích trong phân tích ảnh hàng không, xử lý tài liệu và ứng dụng công nghiệp, nơi các đối tượng xuất hiện ở nhiều góc khác nhau. YOLO26 mang lại độ chính xác và tốc độ cao khi phát hiện đối tượng xoay trong nhiều tình huống đa dạng.

Ví dụ OBB

Tiếp theo là gì#

Đã chọn tác vụ? Hãy định dạng dữ liệu cho tác vụ đó bằng hướng dẫn về dataset, sau đó huấn luyện bằng hình ảnh của riêng bạn.

Câu hỏi thường gặp#

  • Ultralytics YOLO26 là một framework AI đa năng, có khả năng thực hiện nhiều tác vụ thị giác máy tính với độ chính xác và tốc độ cao. Các tác vụ này bao gồm:

  • Để sử dụng Ultralytics YOLO26 cho tác vụ phát hiện đối tượng, hãy làm theo các bước sau:

    1. Chuẩn bị dataset theo định dạng phù hợp.
    2. Huấn luyện model YOLO26 bằng tác vụ phát hiện.
    3. Dùng model để đưa ra dự đoán bằng cách cung cấp ảnh hoặc khung hình video mới.
    Ví dụ
    from ultralytics import YOLO
    
    # Tải model YOLO đã huấn luyện trước (điều chỉnh loại model nếu cần)
    model = YOLO("yolo26n.pt")  # Có các phiên bản n, s, m, l, x
    
    # Thực hiện phát hiện đối tượng trên hình ảnh
    results = model.predict(source="image.jpg")  # Cũng có thể dùng video, thư mục, URL, v.v.
    
    # Hiển thị kết quả
    results[0].show()  # Hiển thị kết quả của ảnh đầu tiên

    Để xem hướng dẫn chi tiết hơn, hãy tham khảo ví dụ phát hiện của chúng tôi.

  • Sử dụng YOLO26 cho các tác vụ phân đoạn mang lại một số ưu điểm:

    1. Độ chính xác cao: Tác vụ phân đoạn tạo ra mask chính xác ở cấp pixel.
    2. Tốc độ: YOLO26 được tối ưu cho các ứng dụng thời gian thực, xử lý nhanh ngay cả với ảnh có độ phân giải cao.
    3. Nhiều ứng dụng: Model phù hợp cho chẩn đoán hình ảnh y tế, xe tự hành và các ứng dụng khác cần phân đoạn ảnh chi tiết.

    Tìm hiểu thêm về lợi ích và trường hợp sử dụng YOLO26 cho phân đoạn trong mục phân đoạn ảnh.

  • Có, Ultralytics YOLO26 có thể thực hiện hiệu quả việc ước lượng tư thế và phát hiện keypoint với độ chính xác và tốc độ cao. Tính năng này đặc biệt hữu ích để theo dõi chuyển động trong phân tích thể thao, chăm sóc sức khỏe và các ứng dụng tương tác người-máy. YOLO26 phát hiện keypoint trong ảnh hoặc khung hình video, cho phép ước lượng tư thế chính xác.

    Để biết thêm chi tiết và mẹo triển khai, hãy xem ví dụ ước lượng tư thế của chúng tôi.

  • Phát hiện đối tượng có định hướng (OBB) với YOLO26 nâng cao độ chính xác bằng cách phát hiện đối tượng với tham số góc bổ sung. Tính năng này hữu ích cho các ứng dụng cần định vị chính xác đối tượng xoay, chẳng hạn như phân tích ảnh hàng không và tự động hóa kho hàng.

    • Tăng độ chính xác: Thành phần góc giúp giảm dương tính giả đối với các đối tượng xoay.
    • Ứng dụng đa dạng: Hữu ích cho các tác vụ phân tích không gian địa lý, robot học, v.v.

    Xem mục Phát hiện đối tượng có định hướng để biết thêm chi tiết và ví dụ.

Bình luận