Ultralytics YOLO27:

YOLOv5 so với YOLOv8#

Khi xây dựng các ứng dụng thị giác máy tính có khả năng mở rộng và hiệu quả, việc lựa chọn đúng kiến trúc là yếu tố then chốt. Hệ sinh thái Ultralytics không ngừng mở rộng các giới hạn về tốc độ và độ chính xác, cung cấp cho developer những công cụ mạnh mẽ để triển khai trong thực tế. Bài so sánh kỹ thuật này đi sâu vào những khác biệt giữa YOLOv5YOLOv8, phân tích kiến trúc, sự đánh đổi về hiệu năng và các trường hợp sử dụng phù hợp, giúp bạn đưa ra quyết định sáng suốt cho dự án AI tiếp theo.

Cả hai model này đều là những cột mốc quan trọng trong lịch sử phát hiện đối tượng theo thời gian thực, đồng thời đều được hưởng lợi từ yêu cầu bộ nhớ được tối ưu hóa cao và tính dễ sử dụng vốn đặc trưng cho hệ sinh thái Ultralytics.

YOLOv5: Tiêu chuẩn đáng tin cậy của ngành#

Được giới thiệu vào năm 2020, YOLOv5 nhanh chóng trở thành tiêu chuẩn của ngành về khả năng phát hiện đối tượng nhanh, dễ tiếp cận và đáng tin cậy. Nhờ triển khai PyTorch nguyên bản, model này đã tinh gọn vòng đời huấn luyện và triển khai cho các kỹ sư trên toàn cầu.

Ưu điểm về kiến trúc#

YOLOv5 hoạt động theo mô hình phát hiện dựa trên anchor, dựa vào các hộp neo được xác định trước để dự đoán ranh giới đối tượng. Kiến trúc của model tích hợp backbone mạng một phần xuyên giai đoạn (CSP), tối ưu hóa luồng gradient và giảm dư thừa tính toán. Nhờ đó, model có footprint bộ nhớ cực kỳ nhẹ, cho phép huấn luyện đặc biệt nhanh ngay cả trên các GPU phổ thông.

Các trường hợp sử dụng lý tưởng#

YOLOv5 đặc biệt phù hợp với các dự án đặt throughput tối đa và mức sử dụng tài nguyên tối thiểu lên hàng đầu. Model này hoạt động hiệu quả trong các môi trường AI biên, chẳng hạn như triển khai trên Raspberry Pi hoặc thiết bị di động. Độ trưởng thành của model đồng nghĩa với việc nó đã được kiểm chứng thực tế kỹ lưỡng qua hàng nghìn lần triển khai thương mại, mang lại độ ổn định vượt trội cho các workflow phát hiện đối tượng truyền thống.

Lợi thế triển khai hệ thống cũ

Nhờ được sử dụng rộng rãi, YOLOv5 có các đường dẫn export cực kỳ ổn định tới những framework triển khai hệ thống cũ như TensorRTONNX, giúp tích hợp liền mạch vào các technology stack cũ hơn.

YOLOv8: Framework thị giác thống nhất#

Được phát hành vào tháng 1 năm 2023, YOLOv8 đánh dấu một bước chuyển lớn về kiến trúc, phát triển từ một model chuyên phát hiện đối tượng thành một framework thị giác đa nhiệm linh hoạt.

Các cải tiến về kiến trúc#

Không giống phiên bản tiền nhiệm, YOLOv8 giới thiệu head phát hiện không dùng anchor. Điều này loại bỏ nhu cầu tinh chỉnh thủ công các cấu hình anchor dựa trên phân bố dataset, cải thiện khả năng tổng quát hóa trên nhiều dataset tùy chỉnh đa dạng như dataset COCO phổ biến.

Kiến trúc này cũng nâng cấp backbone bằng mô-đun C2f (nút thắt cổ chai một phần xuyên giai đoạn với hai phép tích chập), thay thế mô-đun C3 cũ. Cải tiến này nâng cao khả năng biểu diễn đặc trưng mà không gây áp lực lớn lên bộ nhớ. Ngoài ra, việc triển khai head tách rời—phân tách các tác vụ objectness, phân loại và hồi quy—cải thiện đáng kể quá trình hội tụ trong quá trình huấn luyện model.

Tính linh hoạt và Python API#

YOLOv8 giới thiệu Python API hiện đại ultralytics, chuẩn hóa workflow trên nhiều tác vụ thị giác máy tính. Dù bạn thực hiện phân đoạn ảnh, phân loại ảnh hay ước tính tư thế, API thống nhất này chỉ yêu cầu thay đổi nhỏ trong cấu hình.

from ultralytics import YOLO

# Load a pretrained YOLOv8 model
model = YOLO("yolov8n.pt")

# Train on a custom dataset with built-in memory efficiency
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference and easily parse results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

So sánh hiệu năng chi tiết#

Khi so sánh hai thế hệ, chúng ta nhận thấy một sự đánh đổi kinh điển: YOLOv8 đạt Độ chính xác trung bình (mAP) cao hơn trên mọi phương diện, trong khi YOLOv5 vẫn nhỉnh hơn một chút về tốc độ suy luận thô tuyệt đối và số lượng tham số ở các biến thể nhỏ nhất.

Dưới đây là phần so sánh chi tiết các chỉ số hiệu năng của chúng trên dataset COCO với kích thước ảnh 640 pixel.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8

Dữ liệu cho thấy YOLOv8 mang lại mức cải thiện độ chính xác đáng kể. Chẳng hạn, YOLOv8s đạt 44.9 mAP so với 37.4 mAP của YOLOv5s, một bước nhảy lớn giúp cải thiện đáng kể hiệu năng trong các môi trường dày đặc hoặc khi nhận diện các đối tượng nhỏ. Tuy nhiên, trong các môi trường bị giới hạn tài nguyên nghiêm ngặt, YOLOv5n vẫn cực kỳ hiệu quả, với số lượng tham số và FLOPs thấp nhất.

Yêu cầu bộ nhớ

Cả hai model đều được tối ưu hóa cao để sử dụng ít bộ nhớ CUDA hơn trong quá trình huấn luyện so với các kiến trúc nặng hơn như model Transformer. Điều này cho phép các chuyên gia sử dụng batch size lớn hơn trên GPU tiêu chuẩn, qua đó đẩy nhanh vòng đời nghiên cứu.

Lợi thế của hệ sinh thái#

Việc lựa chọn YOLOv5 hoặc YOLOv8 đều cấp cho developer quyền truy cập vào Ultralytics Platform được duy trì tốt. Môi trường tích hợp này cung cấp các công cụ đơn giản cho việc gán nhãn dataset, tinh chỉnh hyperparameter, huấn luyện trên cloud và giám sát model. Hoạt động phát triển tích cực cùng sự hỗ trợ mạnh mẽ từ cộng đồng đảm bảo developer có thể nhanh chóng xử lý sự cố và tích hợp với các công cụ bên ngoài như Weights & BiasesClearML.

Trong khi các framework khác có thể gặp phải đường cong học tập dốc, Ultralytics ưu tiên trải nghiệm người dùng tinh gọn, đảm bảo sự đánh đổi thuận lợi giữa tốc độ và độ chính xác, phù hợp với nhiều kịch bản triển khai thực tế.

Vượt qua v8: Khám phá YOLO11 và YOLO26#

Mặc dù YOLOv8 là một framework rất mạnh, lĩnh vực trí tuệ nhân tạo vẫn phát triển nhanh chóng. Developer quan tâm đến hiệu năng hiện đại nhất cũng nên khám phá YOLO11, model được xây dựng dựa trên v8 với độ chính xác và tốc độ được cải thiện.

Đối với những ai tìm kiếm công nghệ thị giác máy tính tiên tiến nhất, chúng tôi đặc biệt khuyến nghị Ultralytics YOLO26. Được phát hành vào năm 2026, YOLO26 đánh dấu một bước tiến vượt bậc:

  • Thiết kế end-to-end không dùng NMS: Ban đầu được tiên phong trong các kiến trúc thử nghiệm, YOLO26 loại bỏ nguyên bản bước hậu xử lý Non-Maximum Suppression, dẫn đến pipeline triển khai đơn giản và nhanh hơn đáng kể.
  • Optimizer MuSGD: Lấy cảm hứng từ những cải tiến trong huấn luyện LLM được áp dụng ở các model như Kimi K2, YOLO26 sử dụng một optimizer lai để huấn luyện ổn định hơn và hội tụ nhanh hơn.
  • Làm chủ điện toán biên: Với tốc độ suy luận CPU nhanh hơn tới 43% so với các thế hệ trước, đây là model tối ưu cho những thiết bị không có GPU chuyên dụng.
  • Độ chính xác được nâng cao: Nhờ sử dụng các hàm loss ProgLoss + STAL mới, model cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố quan trọng đối với robotics và hình ảnh từ drone trên không.

Dù bạn đang duy trì một hệ thống cũ với YOLOv5, mở rộng một ứng dụng linh hoạt với YOLOv8 hay đổi mới bằng các khả năng tiên tiến của YOLO26, bộ công cụ Ultralytics cung cấp đầy đủ tooling cần thiết để thành công trong lĩnh vực AI thị giác hiện đại.

Những người đóng góp

Bình luận