Ultralytics YOLO27:
Get Started

YOLOv5 và YOLO11#

Khi chọn kiến trúc thị giác máy tính phù hợp cho một dự án mới, việc hiểu rõ quá trình phát triển của các model tiên tiến nhất là rất quan trọng. Tiến trình từ kiến trúc đời trước đến các framework thống nhất hiện đại cho thấy những bước tiến đáng kể về cả hiệu quả thuật toán lẫn trải nghiệm nhà phát triển. Hướng dẫn này cung cấp so sánh kỹ thuật chuyên sâu giữa hai model tiêu biểu do Ultralytics phát triển: YOLOv5 tiên phong và YOLO11 được hoàn thiện cao.

Giới thiệu các model#

Cả hai kiến trúc đều là những cột mốc quan trọng trong lĩnh vực phát hiện đối tượng thời gian thực, với các ưu điểm riêng tùy theo môi trường triển khai và yêu cầu tương thích hệ thống cũ.

YOLOv5: Model chủ lực của ngành#

Ra mắt vào mùa hè năm 2020, YOLOv5 nhanh chóng trở thành tiêu chuẩn ngành nhờ triển khai PyTorch nguyên bản, giúp giảm đáng kể rào cản khi huấn luyện và triển khai. Model không còn sử dụng các framework C Darknet phức tạp của những phiên bản tiền nhiệm, thay vào đó áp dụng phương pháp xây dựng model theo phong cách Python.

YOLOv5 thiết lập một mốc chuẩn vững chắc về tính dễ sử dụng và giới thiệu các phương pháp huấn luyện hiệu quả, bao gồm tăng cường dữ liệu mosaic tiên tiến và tự động đặt anchor. Model vẫn rất phổ biến với các nhà nghiên cứu xây dựng dựa trên codebase được tài liệu hóa đầy đủ và kiểm thử kỹ lưỡng.

YOLO11: Framework thị giác thống nhất#

Dựa trên nhiều năm phản hồi và nghiên cứu kiến trúc, YOLO11 được giới thiệu như một phần của framework thống nhất, có khả năng xử lý nguyên bản nhiều tác vụ thị giác. Không chỉ giới hạn ở bounding box, model được thiết kế từ đầu để đạt tính linh hoạt và hiệu quả tối đa.

YOLO11 mang đến trải nghiệm người dùng tinh gọn thông qua package Python ultralytics, với API đơn giản thống nhất phát hiện đối tượng, phân đoạn thực thể, phân loại, ước tính tư thế và hộp giới hạn định hướng (OBB). Model đạt được sự cân bằng rất thuận lợi giữa tốc độ và độ chính xác, phù hợp với nhiều kịch bản triển khai thực tế.

Nền tảng tích hợp

Cả hai model đều được hưởng lợi từ hệ sinh thái được duy trì tốt của Ultralytics Platform. Môi trường tích hợp này đơn giản hóa việc gán nhãn tập dữ liệu, huấn luyện đám mây và xuất model cho nhiều loại phần cứng.

So sánh hiệu năng và chỉ số#

So sánh trực tiếp các model này cho thấy những cải tiến kiến trúc chuyển thành mức tăng hiệu năng thực tế như thế nào. Bảng dưới đây minh họa độ chính xác trung bình (mAP) được đánh giá trên tập dữ liệu COCO, cùng với tốc độ suy luận CPU và GPU cũng như số lượng tham số.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Phân tích kết quả#

Các chỉ số cho thấy YOLO11 đạt bước tiến rõ rệt về cân bằng hiệu năng. Chẳng hạn, model YOLO11n (nano) đạt mAP 39.5% so với 28.0% của YOLOv5n, tăng 11.5 điểm chỉ với thêm 0.7M tham số. Hơn nữa, YOLO11 duy trì yêu cầu bộ nhớ khi huấn luyện thấp hơn đáng kể so với các model nặng sử dụng Transformer, nhờ đó dễ tiếp cận hơn khi triển khai trên phần cứng phổ thông và thiết bị biên.

Khác biệt về kiến trúc#

Những cải thiện hiệu năng của YOLO11 bắt nguồn từ một số bước phát triển kiến trúc quan trọng. Trong khi YOLOv5 sử dụng backbone CSPNet tiêu chuẩn với các module C3, những model Ultralytics mới hơn đã giới thiệu các khối trích xuất đặc trưng hiệu quả hơn như C2f (YOLOv8) và C3k2 (YOLO11), giúp tối ưu luồng gradient và giảm chi phí tính toán.

YOLO11 cũng có head được cải tiến đáng kể. Thay cho thiết kế dùng anchor của các model cũ, kiến trúc Ultralytics mới áp dụng phương pháp không dùng anchor. Cách này giảm số lượng dự đoán box, tinh gọn pipeline hậu xử lý và cải thiện khả năng tổng quát hóa của model trên các tỷ lệ kích thước và tỷ lệ khung hình khác nhau. Ngoài ra, các model này có hiệu quả huấn luyện vượt trội cùng weights tiền huấn luyện sẵn có, giúp tăng tốc độ hội tụ khi fine-tune trên các tập dữ liệu.

Triển khai và ví dụ mã nguồn#

Một trong những điểm nổi bật của hệ sinh thái Ultralytics là tính đơn giản. Trong khi YOLOv5 phổ biến hóa việc sử dụng torch.hub để suy luận nhanh, YOLO11 tiến thêm một bước với package Python thống nhất ultralytics.

Huấn luyện với YOLO11#

Việc tải, huấn luyện và xác thực model chỉ cần rất ít mã khung. API xử lý liền mạch việc tinh chỉnh hyperparameter và quản lý model.

from ultralytics import YOLO

# Tải model YOLO11 đã huấn luyện trước
model = YOLO("yolo11s.pt")

# Huấn luyện trên tập dữ liệu tùy chỉnh trong 50 epoch
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Chạy suy luận nhanh và hiển thị kết quả
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# Dễ dàng xuất model sang TensorRT để tăng tốc phần cứng
model.export(format="engine")

Suy luận với YOLOv5 trên hệ thống cũ#

Nếu đang duy trì một pipeline cũ, YOLOv5 tích hợp trực tiếp với cơ chế tải nguyên bản của PyTorch, giúp dễ dàng đưa model vào các script suy luận hiện có.

import torch

# Tải model YOLOv5 tùy chỉnh hoặc tiền huấn luyện từ PyTorch Hub
model = torch.hub.load("ultralytics/yolov5", "yolov5s")

# Thực hiện suy luận trên URL ảnh
results = model("https://ultralytics.com/images/zidane.jpg")

# In thông tin chi tiết về dự đoán ra console
results.print()
Tính linh hoạt khi triển khai

Cả hai model đều hỗ trợ nhiều định dạng xuất. Dù bạn nhắm đến NVIDIA Jetson bằng TensorRT hay ứng dụng iOS sử dụng CoreML, quy trình triển khai đều được tài liệu hóa đầy đủ và cộng đồng hỗ trợ.

Các trường hợp sử dụng phù hợp nhất#

Việc lựa chọn giữa các model này phần lớn phụ thuộc vào giai đoạn vòng đời và yêu cầu cụ thể của dự án.

Khi nào nên chọn YOLOv5#

  • Duy trì codebase cũ: Nếu môi trường production được tùy chỉnh sâu dựa trên cấu trúc repository YOLOv5 hoặc các kỹ thuật tiến hóa hyperparameter cụ thể.
  • Mốc chuẩn học thuật: Khi công bố nghiên cứu cần benchmark trực tiếp với các tiêu chuẩn thị giác máy tính đã được thiết lập trong giai đoạn 2020–2022.

Khi nào nên chọn YOLO11#

  • Dự án đa tác vụ: Khi ứng dụng cần kết hợp nhiều tác vụ như ước tính tư thế và phân đoạn thực thể thông qua một API thống nhất duy nhất.
  • Triển khai biên: Dành cho các kịch bản điện toán biên, trong đó việc tối đa hóa mAP trong một ngân sách tính toán nhất định (FLOPs) là yếu tố then chốt.
  • Giải pháp AI thương mại: Lý tưởng cho ứng dụng doanh nghiệp trong lĩnh vực bán lẻ và an ninh, tận dụng sự hỗ trợ vững chắc của Ultralytics Platform.

Thế hệ tiếp theo: Ultralytics YOLO26#

Dù YOLO11 cân bằng rất tốt giữa tốc độ và độ chính xác, lĩnh vực trí tuệ nhân tạo phát triển nhanh chóng. Với các nhà phát triển bắt đầu dự án mới hiện nay, chúng tôi đặc biệt khuyến nghị tìm hiểu chuẩn mới nhất về AI thị giác: Ultralytics YOLO26.

Ra mắt vào tháng 1 năm 2026, YOLO26 giới thiệu những cải tiến mang tính đột phá mô hình, được thiết kế chuyên biệt cho nhu cầu triển khai hiện đại:

  • Thiết kế đầu cuối không cần NMS: Phát triển dựa trên những khái niệm được tiên phong lần đầu trong YOLOv10, YOLO26 vốn được thiết kế theo hướng đầu cuối. Head một-một tùy chọn (nms=False) loại bỏ nhu cầu hậu xử lý bằng Ức chế phi cực đại (NMS), giúp đơn giản hóa đáng kể pipeline triển khai và giảm độ trễ.
  • Optimizer MuSGD: Lấy cảm hứng từ những đổi mới trong huấn luyện LLM ở các model như Kimi K2 của Moonshot AI, phương pháp kết hợp SGD và Muon này đảm bảo quá trình huấn luyện cực kỳ ổn định và hội tụ nhanh hơn đáng kể.
  • Tốc độ CPU vượt trội: Bằng cách loại bỏ Hàm mất mát tiêu điểm phân phối (DFL), YOLO26 đạt tốc độ suy luận CPU nhanh hơn tới 43%, trở thành lựa chọn tốt nhất cho thiết bị biên và môi trường không có GPU chuyên dụng.
  • Hàm loss tiên tiến: Việc tích hợp ProgLoss và STAL giúp cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố quan trọng trong phân tích drone, IoT và robot.
  • Cải tiến chuyên biệt theo tác vụ: Model giới thiệu các tối ưu hóa chuyên biệt, chẳng hạn như Ước tính hợp lý cực đại phần dư (RLE) cho tư thế và hàm loss góc chuyên biệt cho hộp giới hạn định hướng, đảm bảo hiệu năng vượt trội trên mọi tác vụ thị giác máy tính.

Nếu quan tâm đến các kiến trúc chuyên biệt ngoài tác vụ phát hiện đối tượng tiêu chuẩn, bạn có thể tìm hiểu thêm các model như RT-DETR để phát hiện bằng Transformer hoặc YOLO-World để theo dõi và phát hiện với từ vựng mở. Việc sử dụng những công cụ được duy trì tốt và tối ưu hóa cao này giúp pipeline thị giác máy tính luôn hiệu quả, có khả năng mở rộng và dẫn đầu xu hướng.

Người đóng góp

Bình luận