YOLO Vision 2026:

Các tác vụ thị giác máy tính được hỗ trợ bởi Ultralytics YOLO26#

Ultralytics YOLO supported computer vision tasks

Ultralytics YOLO26 là một framework AI linh hoạt hỗ trợ nhiều computer vision tasks. Framework này có thể được sử dụng để thực hiện detection, segmentation, semantic segmentation, depth estimation, classification, pose estimation và OBB. Mỗi task này có mục tiêu và trường hợp sử dụng khác nhau, cho phép bạn giải quyết các thách thức về computer vision khác nhau chỉ với một framework duy nhất.



Watch: Explore Ultralytics YOLO Tasks: Object Detection, Segmentation, OBB, Tracking, and Pose Estimation.

Phát hiện#

Detection là tác vụ chính được hỗ trợ bởi YOLO26. Tác vụ này bao gồm việc nhận diện các đối tượng trong một hình ảnh hoặc khung hình video và vẽ BBox xung quanh chúng. Các đối tượng được phát hiện sẽ được phân loại vào các nhóm khác nhau dựa trên đặc trưng của chúng. YOLO26 có thể phát hiện nhiều đối tượng trong cùng một hình ảnh hoặc khung hình video với độ chính xác và tốc độ cao, khiến nó trở nên lý tưởng cho các ứng dụng thời gian thực như hệ thống giám sátxe tự hành.

Ví dụ về phát hiện

Phân đoạn hình ảnh#

Phân đoạn đưa việc phát hiện đối tượng tiến xa hơn bằng cách tạo ra các mặt nạ (mask) ở cấp độ pixel cho từng đối tượng. Độ chính xác này hữu ích cho các ứng dụng như hình ảnh y tế, phân tích nông nghiệpkiểm soát chất lượng sản xuất.

Ví dụ về phân đoạn

Phân đoạn ngữ nghĩa#

Semantic segmentation gán nhãn lớp cho từng pixel trong hình ảnh, tạo ra một bản đồ lớp dày đặc cho toàn bộ cảnh. Không giống như instance segmentation, nó không phân biệt giữa các đối tượng riêng lẻ thuộc cùng một lớp. Điều này làm cho nó trở nên lý tưởng cho xe tự hành, phân tích cảnh và lập bản đồ lớp phủ đất, nơi việc hiểu bố cục không gian toàn diện quan trọng hơn việc xác định từng đối tượng riêng lẻ.

Ví dụ về phân đoạn ngữ nghĩa

Monocular Depth Estimation#

Monocular depth estimation dự đoán bản đồ độ sâu trên mỗi pixel tính bằng mét từ một ảnh RGB duy nhất. Đầu ra là một bản đồ float dày đặc được căn chỉnh với ảnh đầu vào, giúp nó phù hợp cho việc tái tạo cảnh 3D, điều hướng robot và các ứng dụng AR/VR nơi mà bố cục không gian cần được suy luận từ một camera đơn lẻ.

Ví dụ về Depth Estimation

Phân loại#

Phân loại bao gồm việc phân loại toàn bộ hình ảnh dựa trên nội dung của chúng. Tác vụ này rất cần thiết cho các ứng dụng như phân loại sản phẩm trong thương mại điện tử, kiểm duyệt nội dunggiám sát động vật hoang dã.

Ví dụ về phân loại

Ước tính tư thế#

Ước tính tư thế phát hiện các điểm chính cụ thể trong hình ảnh hoặc khung hình video để theo dõi chuyển động hoặc ước tính tư thế. Các điểm chính này có thể đại diện cho các khớp của con người, các đặc điểm khuôn mặt hoặc các điểm quan tâm quan trọng khác. YOLO26 vượt trội trong việc phát hiện điểm chính với độ chính xác và tốc độ cao, giúp nó trở nên giá trị cho các ứng dụng thể dục, phân tích thể thaotương tác người-máy.

Ví dụ về tư thế

OBB#

Phát hiện hộp bao định hướng (OBB) nâng cao khả năng phát hiện đối tượng truyền thống bằng cách thêm góc định hướng để xác định vị trí tốt hơn cho các đối tượng bị xoay. Khả năng này đặc biệt có giá trị đối với phân tích hình ảnh trên không, xử lý tài liệucác ứng dụng công nghiệp nơi các đối tượng xuất hiện ở nhiều góc độ khác nhau. YOLO26 mang lại độ chính xác và tốc độ cao cho việc phát hiện các đối tượng bị xoay trong nhiều tình huống đa dạng.

Phát hiện định hướng

Kết luận#

Ultralytics YOLO26 hỗ trợ nhiều tác vụ computer vision, bao gồm detection, instance segmentation, semantic segmentation, monocular depth estimation, classification, oriented object detection và keypoint detection. Mỗi tác vụ giải quyết các nhu cầu cụ thể trong lĩnh vực computer vision, từ xác định đối tượng cơ bản đến suy luận độ sâu dày đặc trên từng pixel. Bằng cách hiểu rõ khả năng và ứng dụng của từng tác vụ, bạn có thể chọn phương pháp phù hợp nhất cho các thách thức computer vision cụ thể của mình và tận dụng các tính năng mạnh mẽ của YOLO26 để xây dựng các giải pháp hiệu quả.

Các bước tiếp theo#

Đã chọn xong task? Hãy định dạng dữ liệu cho task đó với Datasets guide, sau đó train on your own images.

Câu hỏi thường gặp#

  • Ultralytics YOLO26 là một framework AI linh hoạt có khả năng thực hiện nhiều tác vụ thị giác máy tính khác nhau với độ chính xác và tốc độ cao. Các tác vụ này bao gồm:

    • Phát hiện đối tượng: Xác định và định vị đối tượng trong hình ảnh hoặc khung hình video bằng cách vẽ hộp bao xung quanh chúng.
    • Phân đoạn hình ảnh: Phân đoạn hình ảnh thành các vùng khác nhau dựa trên nội dung của chúng, hữu ích cho các ứng dụng như hình ảnh y tế.
    • Phân đoạn ngữ nghĩa: Gán nhãn lớp cho mọi pixel trong hình ảnh để hiểu sâu về cảnh quan.
    • Monocular Depth Estimation: Dự đoán bản đồ độ sâu trên mỗi pixel tính bằng mét từ một ảnh RGB duy nhất.
    • Phân loại: Phân loại toàn bộ hình ảnh dựa trên nội dung của chúng.
    • Ước tính tư thế: Phát hiện các điểm chính cụ thể trong hình ảnh hoặc khung hình video để theo dõi chuyển động hoặc tư thế.
    • Phát hiện đối tượng định hướng (OBB): Phát hiện các đối tượng bị xoay với góc định hướng bổ sung để tăng độ chính xác.
  • Để sử dụng Ultralytics YOLO26 cho việc phát hiện đối tượng, hãy làm theo các bước sau:

    1. Chuẩn bị tập dữ liệu của bạn theo đúng định dạng.
    2. Huấn luyện model YOLO26 bằng cách sử dụng tác vụ phát hiện.
    3. Sử dụng model để đưa ra dự đoán bằng cách nạp vào các hình ảnh hoặc khung hình video mới.
    Ví dụ
    from ultralytics import YOLO
    
    # Load a pretrained YOLO model (adjust model type as needed)
    model = YOLO("yolo26n.pt")  # n, s, m, l, x versions available
    
    # Perform object detection on an image
    results = model.predict(source="image.jpg")  # Can also use video, directory, URL, etc.
    
    # Display the results
    results[0].show()  # Show the first image results

    Để biết thêm hướng dẫn chi tiết, hãy xem các ví dụ về phát hiện của chúng tôi.

  • Việc sử dụng YOLO26 cho các tác vụ phân đoạn mang lại nhiều ưu điểm:

    1. Độ chính xác cao: Tác vụ phân đoạn cung cấp các mặt nạ (mask) chính xác ở cấp độ pixel.
    2. Tốc độ: YOLO26 được tối ưu hóa cho các ứng dụng thời gian thực, cung cấp khả năng xử lý nhanh chóng ngay cả đối với hình ảnh có độ phân giải cao.
    3. Nhiều ứng dụng: Nó rất lý tưởng cho hình ảnh y tế, lái xe tự hành và các ứng dụng khác đòi hỏi phân đoạn hình ảnh chi tiết.

    Tìm hiểu thêm về lợi ích và các trường hợp sử dụng của YOLO26 cho phân đoạn trong phần phân đoạn hình ảnh.

  • Có, Ultralytics YOLO26 có thể thực hiện hiệu quả việc ước tính tư thế và phát hiện điểm chính với độ chính xác và tốc độ cao. Tính năng này đặc biệt hữu ích cho việc theo dõi chuyển động trong phân tích thể thao, chăm sóc sức khỏe và các ứng dụng tương tác người-máy. YOLO26 phát hiện các điểm chính trong hình ảnh hoặc khung hình video, cho phép ước tính tư thế một cách chính xác.

    Để biết thêm chi tiết và mẹo triển khai, hãy truy cập các ví dụ về ước tính tư thế của chúng tôi.

  • Phát hiện đối tượng định hướng (OBB) với YOLO26 cung cấp độ chính xác nâng cao bằng cách phát hiện các đối tượng với tham số góc bổ sung. Tính năng này có lợi cho các ứng dụng đòi hỏi định vị chính xác các đối tượng bị xoay, như phân tích hình ảnh trên không và tự động hóa kho bãi.

    • Độ chính xác tăng cường: Thành phần góc giúp giảm thiểu các kết quả dương tính giả đối với các đối tượng bị xoay.
    • Ứng dụng linh hoạt: Hữu ích cho các tác vụ trong phân tích địa không gian, robotics, v.v.

    Xem phần Phát hiện đối tượng định hướng để biết thêm chi tiết và ví dụ.

Bình luận