Ultralytics YOLO27:

YOLOv6-3.0 so với YOLOv5#

Sự phát triển của bài toán phát hiện đối tượng theo thời gian thực đã chứng kiến nhiều kiến trúc được tối ưu cho các kịch bản triển khai khác nhau. Trong bài phân tích chuyên sâu này, chúng ta so sánh hai model nổi bật: YOLOv6-3.0 định hướng cho ngành công nghiệp và Ultralytics YOLOv5 nền tảng, có tính linh hoạt cao. Việc nắm rõ các lựa chọn kiến trúc, chỉ số hiệu năng và mức độ hỗ trợ của hệ sinh thái cho từng model sẽ giúp bạn chọn framework thị giác máy tính tối ưu cho các ứng dụng thực tế.

YOLOv6-3.0: Thông lượng công nghiệp và tối ưu hóa phần cứng#

Được phát triển bởi Phòng AI Thị giác tại Meituan, YOLOv6-3.0 được thiết kế chuyên biệt cho các môi trường công nghiệp có thông lượng cao. Model tập trung tối đa hóa tốc độ khung hình trên các bộ tăng tốc phần cứng như GPU NVIDIA chuyên dụng.

  • Tác giả: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu và Xiangxiang Chu
  • Tổ chức: Meituan
  • Ngày: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6
  • Tài liệu: Tài liệu YOLOv6

Ưu điểm về kiến trúc#

YOLOv6-3.0 giới thiệu một số tối ưu hóa cấu trúc được thiết kế để tăng tốc. Model sử dụng backbone EfficientRep, được thiết kế chuyên biệt để thân thiện với phần cứng trong quá trình inference trên GPU. Điều này khiến kiến trúc đặc biệt mạnh trong các tác vụ xử lý batch ngoại tuyến.

Trong giai đoạn training, model tích hợp chiến lược Huấn luyện có hỗ trợ Anchor (AAT). Phương pháp này cố gắng kết hợp tính ổn định của quá trình training dựa trên anchor với tốc độ inference không dựa trên anchor. Ngoài ra, kiến trúc neck sử dụng module Nối hai chiều (BiC) để cải thiện việc hợp nhất feature ở các scale khác nhau. Mặc dù được tối ưu cao cho GPU server cao cấp sử dụng TensorRT, tính chuyên biệt này đôi khi có thể làm tăng latency trên các thiết bị chỉ có CPU hoặc thiết bị edge công suất thấp.

Tìm hiểu thêm về YOLOv6

Ultralytics YOLOv5: Tiên phong trong AI Thị giác dễ tiếp cận#

Được Ultralytics phát hành, YOLOv5 đã thiết lập một tiêu chuẩn mới về tính dễ sử dụng, hiệu quả training và khả năng triển khai mạnh mẽ. Model đã phổ biến hóa bài toán phát hiện đối tượng hiệu năng cao bằng cách tích hợp sâu với các workflow deep learning hiện đại.

Hệ sinh thái và tính linh hoạt#

Đặc điểm nổi bật của YOLOv5 là Tính dễ sử dụng. Được xây dựng nguyên bản trên framework PyTorch, repository cung cấp một Python API thống nhất, giúp đơn giản hóa đáng kể vòng đời machine learning. Từ cấu hình dataset đến triển khai cuối cùng, hệ sinh thái tích hợp giúp developer dành ít thời gian hơn cho việc debug môi trường và nhiều thời gian hơn để xây dựng ứng dụng.

YOLOv5 không chỉ giới hạn ở phát hiện đối tượng. Model sở hữu Tính linh hoạt vượt trội, hỗ trợ nguyên bản phân loại ảnhphân đoạn instance. Hơn nữa, model cung cấp Hiệu quả Training nổi bật nhờ cơ chế caching thông minh, data loader tự động và hỗ trợ tích hợp cho training phân tán trên nhiều GPU.

Hiệu quả sử dụng bộ nhớ trong các model Ultralytics

Khi so sánh các kiến trúc model, mức tiêu thụ bộ nhớ là một yếu tố quan trọng. Các model YOLO của Ultralytics yêu cầu VRAM thấp hơn đáng kể trong cả training và inference so với các model transformer nặng hơn, giúp chúng dễ tiếp cận với developer sử dụng phần cứng phổ thông hoặc notebook cloud như Google Colab.

So sánh hiệu năng và kiến trúc#

Bảng dưới đây trình bày các chỉ số hiệu năng của cả hai kiến trúc khi được đánh giá trên dataset COCO tiêu chuẩn. Hãy lưu ý cách các model cân bằng sự đánh đổi giữa mean average precision và tốc độ inference trong các môi trường khác nhau.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Phân tích#

YOLOv6-3.0 đạt các điểm mAP ấn tượng và được tối ưu mạnh cho các pipeline TensorRT trên GPU T4. Tuy nhiên, YOLOv5 đáp lại bằng một Hệ sinh thái được duy trì tốt với khả năng export ngay sang nhiều định dạng, bao gồm ONNX, CoreML và TFLite. Sự cân bằng hiệu năng này đảm bảo YOLOv5 hoạt động ổn định không chỉ trên các server chuyên dụng mà còn trên thiết bị di động và môi trường điện toán edge như Raspberry Pi.

Ví dụ code: Training liền mạch với Ultralytics#

Một trong những ưu điểm lớn nhất của hệ sinh thái Ultralytics là trải nghiệm người dùng được tinh gọn. Việc training một model, đánh giá model và export model chỉ yêu cầu vài dòng Python.

from ultralytics import YOLO

# Load a pre-trained YOLOv5 small model
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
# The API automatically handles dataset downloads and hyperparameter configuration
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export the model to ONNX format for flexible deployment
model.export(format="onnx")

Các trường hợp sử dụng và kịch bản triển khai lý tưởng#

Việc lựa chọn giữa các kiến trúc này thường phụ thuộc vào các ràng buộc hạ tầng cụ thể của bạn:

  • Khi nào nên triển khai YOLOv6-3.0: Lý tưởng cho các dây chuyền sản xuất tự động và hoạt động phân tích server có thông lượng cao, nơi có GPU NVIDIA chuyên dụng và latency phải ở mức tối thiểu. Kiến trúc này phát huy tối đa hiệu quả trong những môi trường có thể tận dụng đầy đủ các tối ưu hóa của TensorRT.
  • Khi nào nên triển khai YOLOv5: Lựa chọn hoàn hảo cho việc prototype nhanh, triển khai đa nền tảng và các team cần một pipeline thống nhất. Khả năng export đa dạng khiến model trở nên lý tưởng cho phân tích bán lẻ trên thiết bị edge, giám sát drone nông nghiệp và ước tính pose trong các ứng dụng fitness.

Tương lai của bài toán phát hiện đối tượng: YOLO26 xuất hiện#

Mặc dù YOLOv5 và YOLOv6 là những cột mốc quan trọng, lĩnh vực thị giác máy tính đang phát triển nhanh chóng. Đối với developer bắt đầu dự án mới hoặc tìm kiếm giải pháp tiên tiến nhất, chúng tôi đặc biệt khuyến nghị nâng cấp lên Ultralytics YOLO26 (phát hành tháng 1 năm 2026).

YOLO26 định nghĩa lại AI thị giác ưu tiên edge bằng cách giới thiệu Thiết kế đầu-cuối không cần NMS mang tính đột phá. Việc loại bỏ nhu cầu hậu xử lý Non-Maximum Suppression giúp đơn giản hóa logic triển khai và giảm đáng kể độ biến thiên của latency.

Các đổi mới chính trong YOLO26 bao gồm:

  • Optimizer MuSGD: Một phương pháp kết hợp giữa SGD và Muon, đưa tính ổn định nâng cao trong training LLM vào lĩnh vực thị giác máy tính để hội tụ nhanh hơn và đáng tin cậy hơn.
  • Inference trên CPU nhanh hơn tới 43%: Được tối ưu mạnh cho các môi trường không có bộ tăng tốc chuyên dụng.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp đơn giản hóa quá trình export và tăng khả năng tương thích với các thiết bị edge công suất thấp.
  • ProgLoss + STAL: Các hàm loss nâng cao giúp cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố quan trọng đối với ảnh trên không và các sensor IoT trong thành phố thông minh.

Đối với các tác vụ đa dụng, YOLO11 cũng vẫn là một lựa chọn xuất sắc và được hỗ trợ đầy đủ trong hệ sinh thái Ultralytics.

Kết luận#

YOLOv6-3.0 và YOLOv5 đều đóng vai trò then chốt trong việc thúc đẩy phát hiện theo thời gian thực. YOLOv6-3.0 cung cấp một kiến trúc chuyên biệt cao cho thông lượng được tăng tốc bằng GPU, trong khi YOLOv5 mang đến trải nghiệm developer vượt trội nhờ tài liệu phong phú, tính dễ sử dụng và khả năng xử lý nhiều task.

Đối với các ứng dụng hiện đại, việc tận dụng hệ sinh thái Ultralytics tích hợp đảm bảo một workflow có khả năng thích ứng lâu dài. Bằng cách áp dụng các kiến trúc mới nhất như YOLO26, bạn đảm bảo các pipeline triển khai của mình hưởng lợi từ những đột phá mới nhất về tốc độ, độ chính xác và tính đơn giản của thuật toán.

Những người đóng góp

Bình luận