YOLO Vision 2026:

Các tác vụ thị giác máy tính được hỗ trợ bởi Ultralytics YOLO26#

Ultralytics YOLO supported computer vision tasks

Ultralytics YOLO26 là một framework AI linh hoạt, hỗ trợ nhiều computer vision tasks. Framework này có thể được sử dụng để thực hiện detection, segmentation, semantic segmentation, depth estimation, classification, ước lượng poseOBB. Mỗi tác vụ này có mục tiêu và trường hợp sử dụng riêng, cho phép bạn giải quyết các thách thức thị giác máy tính khác nhau chỉ với một framework duy nhất.



Watch: Explore Ultralytics YOLO Tasks: Object Detection, Segmentation, OBB, Tracking, and Pose Estimation.

Phát hiện#

Detection là tác vụ chính được hỗ trợ bởi YOLO26. Tác vụ này liên quan đến việc xác định các đối tượng trong một hình ảnh hoặc khung hình video và vẽ các hộp giới hạn xung quanh chúng. Các đối tượng được phát hiện sẽ được phân loại thành các danh mục khác nhau dựa trên các đặc điểm của chúng. YOLO26 có thể phát hiện nhiều đối tượng trong một hình ảnh hoặc khung hình video duy nhất với accuracy và tốc độ cao, làm cho nó trở nên lý tưởng cho các ứng dụng thời gian thực như surveillance systemsautonomous vehicles.

Ví dụ về phát hiện

Image segmentation#

Segmentation đưa việc phát hiện đối tượng tiến xa hơn bằng cách tạo ra các mặt nạ cấp độ pixel cho từng đối tượng. Độ chính xác này rất hữu ích cho các ứng dụng như medical imaging, agricultural analysismanufacturing quality control.

Ví dụ về phân đoạn

Phân đoạn Ngữ nghĩa#

Semantic segmentation gán một nhãn lớp cho mọi pixel trong một hình ảnh, tạo ra một bản đồ lớp dày đặc cho toàn bộ cảnh. Không giống như instance segmentation, phương pháp này không phân biệt giữa các đối tượng riêng lẻ cùng lớp. Điều này làm cho nó trở nên lý tưởng cho autonomous driving, scene parsing và lập bản đồ lớp phủ mặt đất, nơi việc hiểu rõ bố cục không gian toàn diện quan trọng hơn việc nhận diện từng đối tượng riêng lẻ.

Ví dụ về phân đoạn ngữ nghĩa

Ước lượng Chiều sâu Đơn ảnh#

Monocular depth estimation dự đoán bản đồ độ sâu trên mỗi pixel tính bằng mét từ một ảnh RGB duy nhất. Đầu ra là một bản đồ float dày đặc được căn chỉnh với ảnh đầu vào, giúp nó phù hợp cho việc tái tạo cảnh 3D, điều hướng robot và các ứng dụng AR/VR nơi mà bố cục không gian cần được suy luận từ một camera đơn lẻ.

Ví dụ về Depth Estimation

Phân loại#

Classification liên quan đến việc phân loại toàn bộ hình ảnh dựa trên nội dung của chúng. Tác vụ này rất cần thiết cho các ứng dụng như product categorization trong thương mại điện tử, content moderationwildlife monitoring.

Ví dụ về phân loại

Pose estimation#

Pose estimation phát hiện các điểm mấu chốt cụ thể trong hình ảnh hoặc khung hình video để theo dõi chuyển động hoặc ước lượng tư thế. Các điểm mấu chốt này có thể đại diện cho các khớp của con người, đặc điểm khuôn mặt hoặc các điểm quan tâm quan trọng khác. YOLO26 xuất sắc trong việc phát hiện điểm mấu chốt với độ chính xác và tốc độ cao, làm cho nó có giá trị đối với fitness applications, sports analyticshuman-computer interaction.

Ví dụ về tư thế

OBB#

Oriented Bounding Box (OBB) detection cải thiện phương pháp phát hiện đối tượng truyền thống bằng cách thêm góc định hướng để xác định vị trí các đối tượng xoay tốt hơn. Khả năng này đặc biệt có giá trị đối với aerial imagery analysis, document processingindustrial applications nơi các đối tượng xuất hiện ở nhiều góc độ khác nhau. YOLO26 mang lại độ chính xác và tốc độ cao để phát hiện các đối tượng xoay trong các kịch bản đa dạng.

Phát hiện định hướng

Kết luận#

Ultralytics YOLO26 hỗ trợ nhiều tác vụ computer vision, bao gồm detection, instance segmentation, semantic segmentation, monocular depth estimation, classification, oriented object detection và keypoint detection. Mỗi tác vụ giải quyết các nhu cầu cụ thể trong lĩnh vực computer vision, từ xác định đối tượng cơ bản đến suy luận độ sâu dày đặc trên từng pixel. Bằng cách hiểu rõ khả năng và ứng dụng của từng tác vụ, bạn có thể chọn phương pháp phù hợp nhất cho các thách thức computer vision cụ thể của mình và tận dụng các tính năng mạnh mẽ của YOLO26 để xây dựng các giải pháp hiệu quả.

Các bước tiếp theo#

Đã chọn được tác vụ? Hãy định dạng dữ liệu của bạn cho tác vụ đó với Datasets guide, sau đó train on your own images.

Câu hỏi thường gặp#

  • Ultralytics YOLO26 là một framework AI linh hoạt có khả năng thực hiện nhiều tác vụ thị giác máy tính khác nhau với độ chính xác và tốc độ cao. Các tác vụ này bao gồm:

    • Object Detection: Xác định và định vị các đối tượng trong hình ảnh hoặc khung hình video bằng cách vẽ các hộp giới hạn xung quanh chúng.
    • Image segmentation: Phân đoạn hình ảnh thành các vùng khác nhau dựa trên nội dung của chúng, hữu ích cho các ứng dụng như hình ảnh y tế.
    • Semantic Segmentation: Gán nhãn lớp cho mọi pixel trong một hình ảnh để hiểu ngữ cảnh cảnh vật chi tiết.
    • Monocular Depth Estimation: Dự đoán bản đồ độ sâu theo từng pixel tính bằng mét từ một hình ảnh RGB duy nhất.
    • Classification: Phân loại toàn bộ hình ảnh dựa trên nội dung của chúng.
    • Pose estimation: Phát hiện các điểm mấu chốt cụ thể trong hình ảnh hoặc khung hình video để theo dõi chuyển động hoặc tư thế.
    • Oriented Object Detection (OBB): Phát hiện các đối tượng bị xoay với một tham số góc bổ sung để nâng cao độ chính xác.
  • Để sử dụng Ultralytics YOLO26 cho việc phát hiện đối tượng, hãy làm theo các bước sau:

    1. Chuẩn bị tập dữ liệu của bạn theo đúng định dạng.
    2. Huấn luyện model YOLO26 bằng cách sử dụng tác vụ phát hiện.
    3. Sử dụng model để đưa ra dự đoán bằng cách nạp vào các hình ảnh hoặc khung hình video mới.
    Ví dụ
    from ultralytics import YOLO
    
    # Load a pretrained YOLO model (adjust model type as needed)
    model = YOLO("yolo26n.pt")  # n, s, m, l, x versions available
    
    # Perform object detection on an image
    results = model.predict(source="image.jpg")  # Can also use video, directory, URL, etc.
    
    # Display the results
    results[0].show()  # Show the first image results

    Để biết thêm hướng dẫn chi tiết, hãy xem detection examples của chúng tôi.

  • Việc sử dụng YOLO26 cho các tác vụ phân đoạn mang lại nhiều ưu điểm:

    1. Độ chính xác cao: Tác vụ phân đoạn cung cấp các mặt nạ (mask) chính xác ở cấp độ pixel.
    2. Tốc độ: YOLO26 được tối ưu hóa cho các ứng dụng thời gian thực, cung cấp khả năng xử lý nhanh chóng ngay cả đối với hình ảnh có độ phân giải cao.
    3. Nhiều ứng dụng: Nó rất lý tưởng cho hình ảnh y tế, lái xe tự hành và các ứng dụng khác đòi hỏi phân đoạn hình ảnh chi tiết.

    Tìm hiểu thêm về lợi ích và trường hợp sử dụng của YOLO26 cho việc phân đoạn trong image segmentation section.

  • Có, Ultralytics YOLO26 có thể thực hiện hiệu quả việc ước tính tư thế và phát hiện điểm chính với độ chính xác và tốc độ cao. Tính năng này đặc biệt hữu ích cho việc theo dõi chuyển động trong phân tích thể thao, chăm sóc sức khỏe và các ứng dụng tương tác người-máy. YOLO26 phát hiện các điểm chính trong hình ảnh hoặc khung hình video, cho phép ước tính tư thế một cách chính xác.

    Để biết thêm chi tiết và mẹo triển khai, hãy truy cập pose estimation examples của chúng tôi.

  • Oriented Object Detection (OBB) với YOLO26 cung cấp precision nâng cao bằng cách phát hiện các đối tượng với tham số góc bổ sung. Tính năng này mang lại lợi ích cho các ứng dụng yêu cầu định vị chính xác các đối tượng bị xoay, chẳng hạn như phân tích hình ảnh trên không và tự động hóa kho hàng.

    • Độ chính xác tăng cường: Thành phần góc giúp giảm thiểu các kết quả dương tính giả đối với các đối tượng bị xoay.
    • Ứng dụng linh hoạt: Hữu ích cho các tác vụ trong phân tích địa không gian, robotics, v.v.

    Hãy xem Oriented Object Detection section để biết thêm chi tiết và ví dụ.

Bình luận