Ultralytics YOLO27:

YOLOv10 so với YOLOv8#

Sự phát triển của lĩnh vực phát hiện đối tượng theo thời gian thực đã chứng kiến sự xuất hiện nhanh chóng của hàng loạt kiến trúc đột phá, mỗi kiến trúc đều nỗ lực mở rộng giới hạn về độ chính xác, tốc độ suy luận và hiệu quả tính toán. Trong hướng dẫn kỹ thuật toàn diện này, chúng ta sẽ so sánh hai cột mốc quan trọng trong lĩnh vực thị giác máy tính: YOLOv10Ultralytics YOLOv8. Trong khi YOLOv8 thiết lập một tiêu chuẩn có tính linh hoạt cao và sẵn sàng cho production, YOLOv10 giới thiệu những thay đổi về kiến trúc nhằm loại bỏ các nút thắt trong quá trình hậu xử lý.

Việc hiểu rõ những ưu điểm, kiến trúc và chỉ số hiệu năng khác biệt của các model này là yếu tố then chốt đối với các developer và researcher muốn triển khai các giải pháp vision AI tiên tiến trong những tình huống thực tế.

Thông số kỹ thuật và tác giả#

Để đánh giá hiệu quả các model này, việc tìm hiểu nguồn gốc và trọng tâm chính của các nhóm nghiên cứu tương ứng sẽ rất hữu ích.

YOLOv10: Hiệu quả đầu cuối#

Được phát triển bởi các researcher tại Đại học Thanh Hoa, YOLOv10 được thiết kế để giải quyết chi phí tính toán phát sinh từ các bước hậu xử lý trong những thế hệ trước.

Tìm hiểu thêm về YOLOv10

Ultralytics YOLOv8: Tiêu chuẩn linh hoạt#

Ra mắt vào đầu năm 2023, YOLOv8 nhanh chóng trở thành một tiêu chuẩn phổ biến trong ngành nhờ kiến trúc mạnh mẽ và khả năng tích hợp vượt trội vào hệ sinh thái machine learning rộng lớn.

Các cải tiến về kiến trúc#

Cả hai model đều mang lại những cải tiến đáng kể cho kiến trúc YOLO truyền thống, mặc dù chúng hướng đến các khía cạnh hơi khác nhau trong pipeline.

Kiến trúc YOLOv10#

Đặc điểm nổi bật của YOLOv10 là chiến lược huấn luyện không cần NMS. Theo cách truyền thống, các bộ phát hiện đối tượng phụ thuộc vào Non-Maximum Suppression (NMS) trong quá trình suy luận để lọc các bounding box chồng lấn. Bước này có thể làm tăng độ trễ và khiến việc triển khai đầu cuối trở nên phức tạp. YOLOv10 sử dụng cơ chế gán kép nhất quán trong quá trình huấn luyện, cho phép model dự đoán tự nhiên một bounding box chính xác duy nhất cho mỗi đối tượng. Ngoài ra, model áp dụng thiết kế tổng thể dựa trên sự cân bằng giữa hiệu quả và độ chính xác, tối ưu nhiều thành phần khác nhau để giảm đáng kể FLOPs và số lượng parameter.

Kiến trúc YOLOv8#

YOLOv8 giới thiệu detection head không dùng anchor, loại bỏ các phương pháp dựa trên anchor của những thế hệ tiền nhiệm. Điều này làm giảm số lượng dự đoán box và tăng tốc các phép toán NMS. Ngoài ra, YOLOv8 tích hợp module C2f (nút thắt Cross-Stage Partial với hai phép tích chập), giúp cải thiện luồng gradient và cho phép network học các biểu diễn đặc trưng phong phú hơn mà không làm tăng đáng kể chi phí tính toán. Cấu trúc head tách biệt các tác vụ objectness, classification và regression, từ đó giúp hội tụ nhanh hơn và đạt độ chính xác tổng thể cao hơn.

Hiệu năng và benchmark#

Khi triển khai model trên edge device hoặc cloud server, sự đánh đổi giữa tốc độ và độ chính xác là yếu tố tối quan trọng. Bảng dưới đây cung cấp phần so sánh trực tiếp giữa hai model ở nhiều kích thước khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8

Lưu ý: Các ô trống cho biết những metric chưa được báo cáo chính thức trong cùng điều kiện kiểm thử.

Như dữ liệu cho thấy, YOLOv10 có hiệu quả về parameter đặc biệt tốt, thường đạt hoặc vượt mAP của các phiên bản YOLOv8 tương ứng trong khi sử dụng ít parameter và FLOPs hơn. Tuy nhiên, YOLOv8 vẫn có tính cạnh tranh rất cao nhờ khả năng tích hợp TensorRT được tối ưu mạnh, bảo đảm độ trễ suy luận tối thiểu trên các GPU hiện đại.

Tăng tốc phần cứng

Khi nhắm đến môi trường production, việc sử dụng các format như ONNX hoặc TensorRT có thể cải thiện đáng kể tốc độ suy luận. Cả YOLOv8 và YOLOv10 đều hỗ trợ export liền mạch sang các format graph được tối ưu cao này.

Hệ sinh thái, hiệu quả huấn luyện và tính linh hoạt#

Việc lựa chọn model không chỉ dựa trên các benchmark lý thuyết; trải nghiệm developer và hệ sinh thái xung quanh cũng quan trọng không kém.

Lợi thế của Ultralytics#

Một trong những thế mạnh cốt lõi của YOLOv8 là khả năng tích hợp chặt chẽ vào hệ sinh thái Ultralytics. Môi trường này mang đến trải nghiệm "từ zero đến hero", nổi bật với Python API trực quan cao và tài liệu phong phú. Không giống các repository tập trung vào nghiên cứu, vốn có thể yêu cầu thiết lập environment phức tạp, các model Ultralytics nổi tiếng nhờ tính dễ sử dụng.

Hơn nữa, YOLOv8 vốn có tính linh hoạt cao. Trong khi YOLOv10 chỉ được tối ưu cho object detection, framework Ultralytics cho phép developer chuyển đổi liền mạch giữa các tác vụ phát hiện đối tượng, phân đoạn instance, phân loại image, ước tính posebounding box định hướng (OBB) trong cùng một library và cấu trúc API.

Yêu cầu bộ nhớ và huấn luyện#

Các model YOLO của Ultralytics được thiết kế tập trung vào hiệu quả huấn luyện. Nhìn chung, chúng sử dụng ít bộ nhớ hơn trong quá trình huấn luyện và suy luận so với các model Transformer phức tạp, cho phép developer huấn luyện các model tiên tiến trên phần cứng cấp consumer hoặc cloud instance tiêu chuẩn mà không bị hết bộ nhớ CUDA. Việc tự động xử lý tinh chỉnh hyperparameter và tăng cường dữ liệu giúp hội tụ nhanh chóng.

Dưới đây là một ví dụ thực tế cho thấy việc huấn luyện và validation một model bằng Ultralytics Python API đơn giản như thế nào:

from ultralytics import YOLO

# Load a pretrained model (YOLOv8 recommended for general tasks)
model = YOLO("yolov8n.pt")

# Train the model on the COCO8 dataset with automatic memory management
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Run inference on a test image
predictions = model("https://ultralytics.com/images/zidane.jpg")
predictions[0].show()

Thế hệ tiếp theo: YOLO26#

Mặc dù YOLOv8 và YOLOv10 là những cột mốc xuất sắc, lĩnh vực machine learning vẫn không ngừng phát triển. Đối với các developer bắt đầu dự án mới, chúng tôi đặc biệt khuyến nghị sử dụng YOLO26, model flagship mới nhất của Ultralytics, được phát hành vào tháng 1 năm 2026.

YOLO26 kết hợp những cải tiến kiến trúc tốt nhất trong các năm qua vào một framework duy nhất, được tối ưu cao. Model kế thừa thiết kế đầu cuối không cần NMS do các model như YOLOv10 tiên phong, giúp tinh gọn pipeline triển khai và giảm biến động độ trễ. Ngoài ra, YOLO26 giới thiệu Optimizer MuSGD, một optimizer lai lấy cảm hứng từ độ ổn định trong quá trình huấn luyện LLM, bảo đảm hội tụ nhanh hơn và ổn định hơn.

Các cải tiến chính trong YOLO26 gồm:

  • Suy luận CPU nhanh hơn tới 43%: Được tối ưu mạnh cho edge device thông qua việc loại bỏ Distribution Focal Loss (DFL).
  • ProgLoss + STAL: Các hàm loss nâng cao giúp cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố quan trọng đối với hình ảnh từ drone và cảm biến IoT.
  • Cải tiến theo từng tác vụ: Các kiến trúc chuyên biệt cho segmentation, pose estimation và OBB, bảo đảm hiệu năng hàng đầu trên mọi lĩnh vực vision.

Các trường hợp sử dụng và chiến lược triển khai lý tưởng#

Khi quyết định giữa các kiến trúc này, hãy cân nhắc những nhu cầu cụ thể của môi trường triển khai:

  • Chọn YOLOv10 nếu: Bạn đang làm việc trên một pipeline object detection thuần túy, trong đó việc tối ưu từng chút hiệu quả về parameter là yếu tố quan trọng, và bạn muốn thử nghiệm những triển khai ban đầu của các kiến trúc không cần NMS.
  • Chọn Ultralytics YOLOv8 nếu: Bạn cần một model ổn định cao, sẵn sàng cho production và được hỗ trợ bởi Ultralytics Platform mạnh mẽ. Đây là lựa chọn lý tưởng nếu dự án của bạn yêu cầu nhiều tác vụ (ví dụ: phát hiện đối tượng rồi phân đoạn chúng) bằng một codebase thống nhất, dễ bảo trì.
  • Chọn YOLO26 (Khuyến nghị) nếu: Bạn muốn đạt sự cân bằng tối ưu giữa độ chính xác tiên tiến, hiệu quả đầu cuối không cần NMS nguyên bản và tốc độ nhanh nhất có thể trên CPU cũng như phần cứng edge.

Nếu đang tìm hiểu bức tranh rộng hơn, bạn cũng có thể quan tâm đến việc so sánh các model này với YOLO11 hoặc xem các tích hợp triển khai edge cụ thể như Intel OpenVINO để tăng tốc hơn nữa cho các ứng dụng vision AI. Nhờ tận dụng các công cụ thống nhất do Ultralytics cung cấp, việc triển khai các giải pháp thị giác máy tính mạnh mẽ chưa bao giờ dễ tiếp cận hơn thế.

Những người đóng góp

Bình luận