YOLO Vision 2026:

YOLOv8 so với YOLOv10#

Sự tiến hóa của object detection thời gian thực đang diễn ra với tốc độ chưa từng có. Khi các nhà phát triển và nhà nghiên cứu tìm cách tích hợp các mô hình computer vision hiệu quả và chính xác nhất vào các pipeline của họ, việc so sánh các kiến trúc hàng đầu trở nên thiết yếu. Trong bài viết chuyên sâu này, chúng ta so sánh Ultralytics YOLOv8 và YOLOv10, xem xét sự khác biệt về kiến trúc, các metric hiệu suất và các kịch bản triển khai lý tưởng để giúp bạn đưa ra quyết định sáng suốt cho dự án AI tiếp theo của mình.

Tổng quan mô hình: YOLOv8#

Được giới thiệu như một bước tiến lớn trong dòng họ YOLO, YOLOv8 đã thiết lập một tiêu chuẩn mới cho một framework thống nhất và linh hoạt. Nó được thiết kế từ đầu để hỗ trợ vô số tác vụ ngoài các bounding box tiêu chuẩn, biến nó thành một công cụ cực kỳ linh hoạt cho thị giác máy tính hiện đại.

Chi tiết YOLOv8:

Kiến trúc và thế mạnh#

YOLOv8 giới thiệu một detection head không có anchor và phần backbone CSPDarknet được cải tiến, giúp cải thiện đáng kể cả độ chính xác lẫn inference latency. Bằng cách loại bỏ các ô anchor, mô hình làm giảm số lượng dự đoán hộp, giúp tăng tốc Non-Maximum Suppression (NMS) trong quá trình xử lý hậu kỳ (post-processing).

Một trong những ưu điểm nổi bật khi chọn YOLOv8 là tính linh hoạt cực7 kỳ cao của nó. Trong khi nhiều mô hình tập trung hoàn toàn vào object detection, YOLOv8 hỗ trợ gốc instance segmentation, image classification, pose estimation, và oriented bounding boxes (OBB). Điều này làm cho nó trở thành một cỗ máy mạnh mẽ cho các pipeline phức tạp, nhiều giai đoạn, nơi yêu cầu các loại hiểu biết hình ảnh khác nhau cùng một lúc. Hơn nữa, các yêu cầu về bộ nhớ trong quá trình huấn luyện được tối ưu hóa mạnh mẽ so với các kiến trúc dựa trên Transformer như RT-DETR, cho phép các nhà nghiên cứu huấn luyện các mô hình lớn trên các GPU phổ thông tiêu chuẩn.

Tìm hiểu thêm về YOLOv8

Tổng quan mô hình: YOLOv10#

Được phát triển bởi các nhà nghiên cứu tại Đại học Thanh Hoa, YOLOv10 nhằm giải quyết một trong những nút thắt lâu đời nhất trong dòng họ YOLO: sự phụ thuộc vào hậu xử lý NMS.

Chi tiết về YOLOv10:

Kiến trúc và thế mạnh#

Đổi mới chính của YOLOv10 là chiến lược Consistent Dual Assignments, cho phép đào tạo không cần NMS và triển khai end-to-end. Bằng cách loại bỏ bước NMS, YOLOv10 giảm đáng kể độ trễ suy luận, đặc biệt là trên các thiết bị biên nơi các thao tác hậu xử lý có thể gây tốn kém về mặt tính toán.

Ngoài ra, YOLOv10 tích hợp thiết kế mô hình hướng đến hiệu quả-độ chính xác toàn diện, tinh chỉnh cẩn thận chi phí tính toán của từng lớp. Điều này tạo ra một mô hình đòi hỏi ít tham số hơn và ít FLOPs hơn trong khi vẫn đạt được mean Average Precision (mAP) cạnh tranh. Đây là một đóng góp học thuật tuyệt vời cho các trường hợp sử dụng đòi hỏi độ trễ tối thiểu tuyệt đối trong các tác vụ phát hiện thuần túy.

Nhận diện End-to-End

Việc loại bỏ NMS trong YOLOv10 đơn giản hóa đáng kể quá trình xuất sang các framework như OpenVINOTensorRT, vì toàn bộ mô hình có thể được biên dịch thành một đồ thị duy nhất mà không cần các lớp xử lý hậu kỳ tùy chỉnh.

Tìm hiểu thêm về YOLOv10

So sánh Hiệu năng và Chỉ số#

Khi so sánh hai kiến trúc này, việc xem xét sự đánh đổi giữa số lượng tham số, FLOPs và độ chính xác là rất quan trọng. Dưới đây là so sánh chính xác về các metric hiệu suất của chúng trên COCO dataset.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Mặc dù YOLOv10 đạt được mAP cao hơn một chút với ít tham số hơn ở một số quy mô, YOLOv8 cung cấp một hệ sinh thái mạnh mẽ hơn và hỗ trợ tác vụ rộng hơn, khiến nó nhìn chung đáng tin cậy hơn cho các môi trường sản xuất yêu cầu nhiều hơn chỉ là bounding box.

Hệ sinh thái và Phương pháp đào tạo#

Điểm khác biệt thực sự đối với các quy trình ML hiện đại thường là hệ sinh thái bao quanh kiến trúc. Việc chọn một mô hình Ultralytics như YOLOv8 mang lại sự dễ sử dụng vô song và trải nghiệm nhà phát triển liền mạch.

Với Python SDK có tính trực quan cao, các nhà phát triển có thể xử lý việc gán nhãn dữ liệu, huấn luyện và triển khai với độ ma sát tối thiểu. Hệ sinh thái Ultralytics được bảo trì cực kỳ tốt, cung cấp các bản cập nhật thường xuyên, tài liệu toàn diện về hyperparameter tuning, và sự hỗ trợ cộng đồng mạnh mẽ trên các nền tảng như Discord và GitHub.

Ví dụ mã: Đào tạo đơn giản hóa#

Python API của Ultralytics giúp việc khởi tạo, đào tạo và xác thực mô hình trở nên cực kỳ đơn giản. Hãy chú ý cách quy trình tương tự được áp dụng bất kể kiến trúc cơ bản là gì.

from ultralytics import YOLO

# Load a pretrained YOLOv8 model
model = YOLO("yolov8n.pt")

# Train the model efficiently with automated learning rate scheduling
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # optimized CUDA memory usage
    batch=16,
)

# Validate the model to check mAP metrics
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")

# Export to ONNX for edge deployment
model.export(format="onnx")

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa YOLOv8 và YOLOv10 phụ thuộc vào yêu cầu dự án cụ thể, ràng buộc triển khai và sở thích hệ sinh thái của bạn.

Khi nào nên chọn YOLOv8#

YOLOv8 là lựa chọn mạnh mẽ cho:

  • Triển khai đa tác vụ linh hoạt: Các dự án yêu cầu một model đã được chứng minh cho detection, segmentation, classificationpose estimation trong hệ sinh thái Ultralytics.
  • Hệ thống sản xuất đã thiết lập: Các môi trường sản xuất hiện có đã được xây dựng trên kiến trúc YOLOv8 với các pipeline triển khai ổn định, đã được kiểm thử tốt.
  • Hỗ trợ cộng đồng và hệ sinh thái rộng lớn: Các ứng dụng được hưởng lợi từ các hướng dẫn mở rộng, tích hợp bên thứ ba và tài nguyên cộng đồng tích cực của YOLOv8.

Khi nào nên chọn YOLOv10#

YOLOv10 được khuyến nghị cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ việc phát hiện đầu cuối (end-to-end) mà không cần NMS, giúp giảm độ phức tạp khi triển khai.
  • Sự cân bằng giữa tốc độ và độ chính xác: Các dự án yêu cầu sự cân bằng mạnh mẽ giữa tốc độ suy luận và độ chính xác của phát hiện trên nhiều quy mô model khác nhau.
  • Các ứng dụng có độ trễ nhất quán: Các kịch bản triển khai nơi thời gian suy luận có thể dự đoán được là tối quan trọng, chẳng hạn như robot hoặc các hệ thống tự hành.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Tương lai: Bước tiến tới YOLO26#

Trong khi YOLOv8 là một mô hình toàn diện tuyệt vời và YOLOv10 mang lại những hiểu biết học thuật quý giá về các kiến trúc không cần NMS, thì mũi nhọn của thị giác máy tính đã tiến xa hơn. Để đạt được sự cân bằng tối ưu giữa tốc độ, độ chính xác và sự đơn giản trong triển khai, chúng tôi thực sự khuyên bạn nên chuyển sang YOLO26.

Được phát hành vào đầu năm 2026, YOLO26 đại diện cho đỉnh cao tuyệt đối của dòng YOLO. Nó kết hợp mượt mà các tính năng tốt nhất từ các phiên bản tiền nhiệm đồng thời giới thiệu các công nghệ mới mang tính đột phá:

  • Thiết kế End-to-End không NMS: Áp dụng bước đột phá tiên phong bởi YOLOv10, YOLO26 loại bỏ NMS một cách tự nhiên để triển khai nhanh hơn, đơn giản hơn.
  • DFL Removal: Việc loại bỏ Distribution Focal Loss giúp quá trình xuất mô hình sang CoreML và các thiết bị biên trở nên mượt mà hơn đáng kể.
  • Trình tối ưu hóa MuSGD: Lấy cảm hứng từ các mô hình đào tạo Large Language Model (LLM), trình tối ưu hóa lai này đảm bảo khả năng hội tụ nhanh hơn và sự ổn định khi đào tạo chưa từng có.
  • CPU Inference Dominance: YOLO26 đem lại hiệu suất suy luận trên CPU nhanh hơn tới 43% so với các thế hệ trước, biến nó thành một yếu tố thay đổi cuộc chơi cho Raspberry Pi và các ứng dụng IoT.
  • ProgLoss + STAL: Những hàm loss tiên tiến này cung cấp những cải tiến đáng kể trong việc nhận diện các đối tượng nhỏ, điều cực kỳ quan trọng đối với hình ảnh trên không và robot.

Tìm hiểu thêm về YOLO26

Nếu bạn hiện đang đánh giá các mô hình, bạn cũng có thể quan tâm đến YOLO11, phiên bản tiền nhiệm trực tiếp của YOLO26, vẫn là một framework vững chắc, sẵn sàng cho sản xuất được sử dụng rộng rãi trong các giải pháp doanh nghiệp ngày nay. Tuy nhiên, để tối đa hóa khả năng chống lỗi tương lai và hiệu suất, việc khám phá các tính năng nâng cao của Ultralytics Platform với YOLO26 là con đường tốt nhất phía trước cho chiến lược thị giác AI của bạn.

Người đóng góp

Bình luận