YOLO Vision 2026:

YOLOv10 so với YOLOv8#

Sự tiến hóa của phát hiện đối tượng thời gian thực đã chứng kiến một chuỗi nhanh chóng các kiến trúc đột phá, mỗi kiến trúc đều cố gắng vượt qua giới hạn về độ chính xác, tốc độ suy luận và hiệu quả tính toán. Trong hướng dẫn kỹ thuật toàn diện này, chúng tôi so sánh hai cột mốc quan trọng trong bối cảnh thị giác máy tính: YOLOv10Ultralytics YOLOv8. Trong khi YOLOv8 thiết lập một tiêu chuẩn có tính linh hoạt cao và sẵn sàng cho môi trường sản xuất, YOLOv10 giới thiệu các thay đổi về kiến trúc nhằm mục đích cụ thể là loại bỏ các nút thắt cổ chai trong quá trình xử lý hậu kỳ.

Việc hiểu rõ những ưu điểm, kiến trúc và các số liệu hiệu năng khác biệt của các model này là yếu tố cốt lõi đối với các lập trình viên và nhà nghiên cứu đang hướng tới việc triển khai các giải pháp AI thị giác tiên tiến trong các tình huống thực tế.

Thông số kỹ thuật và Quyền tác giả#

Để đánh giá hiệu quả các model này, việc hiểu rõ nguồn gốc và trọng tâm cốt lõi của các đội ngũ nghiên cứu tương ứng sẽ rất hữu ích.

YOLOv10: Hiệu quả từ đầu đến cuối (End-to-End)#

Được phát triển bởi các nhà nghiên cứu tại Đại học Thanh Hoa, YOLOv10 được thiết kế để giải quyết tình trạng quá tải tính toán gây ra bởi các bước hậu xử lý trong các thế hệ trước đó.

Tìm hiểu thêm về YOLOv10

Ultralytics YOLOv8: Tiêu chuẩn linh hoạt#

Ra mắt vào đầu năm 2023, YOLOv8 nhanh chóng trở thành tiêu chuẩn công nghiệp nhờ kiến trúc mạnh mẽ và khả năng tích hợp vô song trong hệ sinh thái machine learning rộng lớn hơn.

Tìm hiểu thêm về YOLOv8

Cải tiến kiến trúc#

Cả hai model đều mang lại những cải tiến đáng kể cho kiến trúc YOLO truyền thống, mặc dù chúng nhắm đến các khía cạnh hơi khác nhau trong quy trình xử lý.

Kiến trúc YOLOv10#

Tính năng nổi bật của YOLOv10 là chiến lược huấn luyện không cần NMS (NMS-free training strategy). Theo truyền thống, các bộ phát hiện đối tượng dựa vào Non-Maximum Suppression (NMS) trong quá trình suy luận để lọc bỏ các hộp bao chồng lấp. Bước này có thể tạo ra độ trễ và làm phức tạp quá trình triển khai đầu cuối (end-to-end). YOLOv10 sử dụng các phép gán kép nhất quán trong quá trình huấn luyện, cho phép mô hình dự đoán một hộp bao chính xác duy nhất cho mỗi đối tượng một cách tự nhiên. Hơn nữa, nó tận dụng thiết kế mô hình hướng đến hiệu quả và độ chính xác toàn diện, tối ưu hóa các thành phần khác nhau để giảm đáng kể số lượng FLOP và tham số.

Kiến trúc YOLOv8#

YOLOv8 đã giới thiệu đầu phát hiện không neo (anchor-free detection head), chuyển dịch khỏi các cách tiếp cận dựa trên neo của các phiên bản tiền nhiệm. Điều này làm giảm số lượng dự đoán hộp và tăng tốc các thao tác NMS. Ngoài ra, YOLOv8 tích hợp mô-đun C2f (Cross-Stage Partial bottleneck với hai phép tích chập), giúp cải thiện luồng gradient và cho phép mạng học các biểu diễn đặc trưng phong phú hơn mà không làm tăng đáng kể chi phí tính toán. Cấu trúc đầu tách rời của nó tách biệt các tác vụ tính đối tượng (objectness), phân loại và hồi quy, dẫn đến thời gian hội tụ nhanh hơn và độ chính xác tổng thể cao hơn.

Hiệu năng và Benchmark#

Khi triển khai các model lên thiết bị biên (edge device) hoặc máy chủ cloud, sự cân bằng giữa tốc độ và độ chính xác là tối quan trọng. Bảng dưới đây cung cấp một sự so sánh trực tiếp giữa hai model ở các kích cỡ khác nhau.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8

Lưu ý: Các ô trống biểu thị những số liệu không được công bố chính thức trong các điều kiện thử nghiệm tương đương.

Như đã thấy trong dữ liệu, YOLOv10 thể hiện hiệu quả tham số đặc biệt, thường khớp hoặc vượt qua mAP của các phiên bản YOLOv8 tương đương trong khi sử dụng ít tham số và FLOP hơn. Tuy nhiên, YOLOv8 vẫn có tính cạnh tranh cực高, cung cấp tích hợp TensorRT được tối ưu hóa cao đảm bảo độ trễ suy luận tối thiểu trên các GPU hiện đại.

Tăng tốc phần cứng

Khi nhắm mục tiêu đến các môi trường sản xuất, việc tận dụng các định dạng như ONNX hoặc TensorRT có thể cải thiện đáng kể tốc độ suy luận. Cả YOLOv8 và YOLOv10 đều hỗ trợ xuất liền mạch sang các định dạng đồ thị được tối ưu hóa cao này.

Hệ sinh thái, Hiệu quả huấn luyện và Tính linh hoạt#

Việc lựa chọn một model không chỉ dừng lại ở các chỉ số benchmark lý thuyết; trải nghiệm của lập trình viên và hệ sinh thái xung quanh cũng quan trọng không kém.

Lợi thế từ Ultralytics#

Một trong những điểm mạnh cốt lõi của YOLOv8 là sự tích hợp chặt chẽ của nó vào hệ sinh thái Ultralytics. Môi trường này cung cấp trải nghiệm "từ con số không đến chuyên gia", đặc trưng bởi API Python rất trực quan và tài liệu phong phú. Không giống như các kho lưu trữ tập trung vào nghiên cứu có thể yêu cầu thiết lập môi trường phức tạp, các mô hình Ultralytics nổi tiếng với tính dễ sử dụng.

Hơn nữa, YOLOv8 vốn dĩ rất linh hoạt. Trong khi YOLOv10 được tối ưu hóa hoàn toàn cho việc phát hiện đối tượng, framework Ultralytics cho phép các nhà phát triển chuyển đổi mượt mà giữa các tác vụ phát hiện đối tượng, phân đoạn thực thể, phân loại hình ảnh, ước lượng tư thế, và hộp bao có định hướng (OBB) trong cùng một cấu trúc thư viện và API.

Yêu cầu bộ nhớ và Huấn luyện#

Các mô hình Ultralytics YOLO được thiết kế với trọng tâm là hiệu quả huấn luyện. Chúng thường thể hiện mức sử dụng bộ nhớ thấp hơn trong quá trình huấn luyện và suy luận so với các mô hình Transformer phức tạp, cho phép các nhà phát triển huấn luyện các mô hình tiên tiến nhất trên phần cứng cấp độ tiêu dùng hoặc các instance đám mây tiêu chuẩn mà không bị cạn kiệt bộ nhớ CUDA. Việc tự động xử lý điều chỉnh siêu tham số và tăng cường dữ liệu đảm bảo sự hội tụ nhanh chóng.

Dưới đây là một ví dụ thực tế về việc huấn luyện và kiểm chứng một model bằng API Python của Ultralytics đơn giản đến mức nào:

from ultralytics import YOLO

# Load a pretrained model (YOLOv8 recommended for general tasks)
model = YOLO("yolov8n.pt")

# Train the model on the COCO8 dataset with automatic memory management
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Run inference on a test image
predictions = model("https://ultralytics.com/images/zidane.jpg")
predictions[0].show()

Thế hệ tiếp theo: YOLO26#

Trong khi YOLOv8 và YOLOv10 đại diện cho những mốc son đặc biệt, lĩnh vực học máy không ngừng tiến bộ. Đối với các nhà phát triển bắt đầu các dự án mới, chúng tôi đặc biệt khuyên bạn nên tận dụng YOLO26, mô hình chủ lực mới nhất từ Ultralytics được phát hành vào tháng 1 năm 2026.

YOLO26 kết hợp những tiến bộ kiến trúc tốt nhất trong những năm qua vào một framework duy nhất được tối ưu hóa cao. Nó kế thừa thiết kế End-to-End NMS-Free tiên phong bởi các model như YOLOv10, tinh giản các đường ống triển khai và giảm thiểu biến động độ trễ. Hơn nữa, YOLO26 giới thiệu MuSGD Optimizer, một bộ tối ưu hóa lai lấy cảm hứng từ tính ổn định khi huấn luyện LLM, đảm bảo sự hội tụ nhanh và ổn định hơn.

Những cải tiến chính trong YOLO26 bao gồm:

  • Suy luận trên CPU nhanh hơn tới 43%: Được tối ưu hóa mạnh mẽ cho các thiết bị biên thông qua việc loại bỏ Distribution Focal Loss (DFL).
  • ProgLoss + STAL: Các hàm loss tiên tiến cải thiện đáng kể khả năng nhận diện vật thể nhỏ, vốn rất quan trọng đối với hình ảnh từ drone và các cảm biến IoT.
  • Các cải tiến cụ thể cho tác vụ: Kiến trúc chuyên biệt cho phân đoạn, ước tính tư thế và OBB, đảm bảo hiệu năng hàng đầu trên tất cả các lĩnh vực thị giác máy tính.

Các trường hợp sử dụng lý tưởng và chiến lược triển khai#

Khi quyết định giữa các kiến trúc này, hãy cân nhắc nhu cầu cụ thể của môi trường triển khai của bạn:

  • Chọn YOLOv10 nếu: Bạn đang làm việc trên một pipeline phát hiện vật thể thuần túy, nơi việc tối ưu hóa từng chút hiệu quả tham số là tối quan trọng, và bạn muốn thử nghiệm với các triển khai sớm của các kiến trúc không cần NMS.
  • Hãy chọn Ultralytics YOLOv8 nếu: Bạn cần một mô hình có tính ổn định cao, sẵn sàng cho sản xuất được hỗ trợ bởi Nền tảng Ultralytics mạnh mẽ. Đây là lựa chọn lý tưởng nếu dự án của bạn yêu cầu nhiều tác vụ (ví dụ: phát hiện đối tượng và sau đó phân đoạn chúng) bằng cách sử dụng một cơ sở mã thống nhất, dễ bảo trì.
  • Chọn YOLO26 (Khuyên dùng) nếu: Bạn muốn sự cân bằng tối ưu giữa độ chính xác hiện đại, hiệu quả NMS-free end-to-end tự nhiên và tốc độ nhanh nhất có thể trên CPU và phần cứng biên.

Nếu bạn đang khám phá bối cảnh rộng lớn hơn, bạn cũng có thể quan tâm đến việc so sánh các mô hình này với YOLO11 hoặc xem xét các tích hợp triển khai biên cụ thể như Intel OpenVINO để tăng tốc thêm các ứng dụng AI thị giác của bạn. Bằng cách tận dụng các công cụ thống nhất được cung cấp bởi Ultralytics, việc triển khai các giải pháp thị giác máy tính mạnh mẽ chưa bao giờ dễ tiếp cận đến thế.

Người đóng góp

Bình luận