Ultralytics YOLO27:

So sánh YOLOv5 và YOLOv6-3.0#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn về tốc độ và độ chính xác. Khi lựa chọn model cho dự án AI thị giác tiếp theo, các developer thường phải so sánh những framework đã được kiểm chứng, linh hoạt với các detector công nghiệp chuyên biệt cao. Bài phân tích chuyên sâu này khám phá những khác biệt kỹ thuật giữa Ultralytics YOLOv5YOLOv6-3.0 của Meituan, giúp bạn lựa chọn công cụ phù hợp nhất với nhu cầu triển khai.

Giới thiệu về các Model#

Ultralytics YOLOv5: Tiêu chuẩn linh hoạt#

Ra mắt vào năm 2020, Ultralytics YOLOv5 nhanh chóng trở thành tiêu chuẩn vàng cho bài toán phát hiện đối tượng dễ tiếp cận và hiệu năng cao. Model này nổi tiếng nhờ tính dễ sử dụng vượt trội, các pipeline huấn luyện mạnh mẽ và khả năng tích hợp triển khai phong phú.

YOLOv5 được thiết kế ngay từ đầu nhằm mang lại trải nghiệm developer liền mạch trong hệ sinh thái PyTorch. Model cung cấp sự cân bằng hiệu năng thuận lợi, đạt độ chính xác trung bình (mAP) xuất sắc trong khi vẫn duy trì tốc độ suy luận cao, phù hợp với nhiều kịch bản triển khai thực tế, từ thiết bị edge đến server cloud.

YOLOv6-3.0: Thông lượng công nghiệp#

Được phát triển bởi Bộ phận AI Thị giác tại Meituan, YOLOv6-3.0 được tối ưu riêng cho các ứng dụng công nghiệp, đặc biệt chú trọng thông lượng thuần trên các bộ tăng tốc phần cứng chuyên dụng.

  • Tác giả: Chuyi Li, Lulu Li, Yifei Geng và cộng sự
  • Tổ chức: Meituan
  • Ngày: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

YOLOv6 hướng đến việc tối đa hóa tốc độ xử lý trên các GPU như NVIDIA T4. Model sử dụng các phương pháp lượng tử hóa tùy chỉnh và backbone chuyên biệt để đạt được hiệu năng này, trở thành một lựa chọn phù hợp cho xử lý trên server backend, nơi suy luận theo batch được sử dụng rộng rãi.

Tìm hiểu thêm về YOLOv6

Sự khác biệt về Architecture#

Việc hiểu rõ các lựa chọn kiến trúc phía sau những model này rất quan trọng để xác định các trường hợp sử dụng lý tưởng của chúng.

Kiến trúc YOLOv5#

YOLOv5 sử dụng backbone CSPDarknet được tối ưu hóa cao, kết hợp với neck Mạng tổng hợp đường dẫn (PANet). Cấu trúc này được tinh chỉnh kỹ lưỡng nhằm đảm bảo yêu cầu bộ nhớ tối thiểu trong quá trình huấn luyện và suy luận. Không giống các model Transformer lớn cần lượng bộ nhớ CUDA khổng lồ và thời gian huấn luyện dài, YOLOv5 hoạt động hiệu quả trên phần cứng phổ thông dành cho người dùng.

Hiệu quả bộ nhớ

Các model Ultralytics được thiết kế chuyên biệt để đạt hiệu quả huấn luyện cao. Bạn thường có thể huấn luyện một model YOLOv5 trên một GPU tầm trung duy nhất, giúp model này dễ tiếp cận với cả các nhà nghiên cứu và startup.

Hơn nữa, YOLOv5 không chỉ là một detector đối tượng. Kiến trúc của model mở rộng liền mạch sang các tác vụ khác, cung cấp hỗ trợ mạnh mẽ ngay từ đầu cho phân đoạn ảnhphân loại ảnh.

Kiến trúc YOLOv6-3.0#

YOLOv6-3.0 có backbone EfficientRep, được thiết kế thân thiện với phần cứng, đặc biệt trong quá trình thực thi trên GPU. Model sử dụng module Nối hai chiều (BiC) trong neck để tăng cường việc hợp nhất đặc trưng.

Trong quá trình huấn luyện, YOLOv6 sử dụng chiến lược Huấn luyện có hỗ trợ Anchor (AAT) để ổn định quá trình hội tụ, mặc dù trong giai đoạn suy luận, model vẫn là một detector không dùng anchor. Mặc dù kiến trúc này nổi bật trong các tác vụ được tăng tốc bằng GPU, đôi khi việc điều chỉnh nó cho nhiều thiết bị edge khác nhau có thể phức tạp hơn so với framework YOLOv5 có tính portable cao.

Phân tích hiệu năng#

Khi đánh giá các model này, các chỉ số về tốc độ thuần và độ chính xác là rất quan trọng. Bên dưới là bảng so sánh làm nổi bật hiệu năng của nhiều kích thước model khác nhau trên dataset COCO.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

Mặc dù YOLOv6-3.0 đạt điểm mAP cao hơn ở các biến thể lớn, YOLOv5 vẫn duy trì footprint cực kỳ gọn nhẹ. Chẳng hạn, YOLOv5n yêu cầu ít tham số và FLOPs hơn đáng kể so với phiên bản tương ứng của YOLOv6, khiến model này đặc biệt tối ưu cho các triển khai trên thiết bị di động hoặc bị giới hạn bởi CPU.

Hệ sinh thái và tính dễ sử dụng#

Yếu tố thực sự mang tính quyết định đối với nhiều đội ngũ kỹ thuật là hệ sinh thái xung quanh model.

YOLOv6 là một repository nghiên cứu ấn tượng, nhưng cần một lượng mã boilerplate đáng kể để triển khai trên nhiều format khác nhau. Ngược lại, Ultralytics cung cấp một hệ sinh thái được duy trì tốt, nổi bật với trải nghiệm người dùng tinh gọn. Thông qua Python API thống nhất và Ultralytics Platform trực quan, các developer có thể quản lý dataset liền mạch, huấn luyện bằng một cú nhấp chuột và xuất trực tiếp sang các format như ONNXTensorRT.

Ví dụ mã: Ultralytics API thống nhất#

Package pip ultralytics của Ultralytics cho phép bạn load, huấn luyện và triển khai model chỉ với vài dòng mã.

from ultralytics import YOLO

# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")

# Train the model effortlessly on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run fast inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for edge deployment
model.export(format="onnx")

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv5 và YOLOv6 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.

Khi nào nên chọn YOLOv5#

YOLOv5 là lựa chọn phù hợp cho:

  • Hệ thống production đã được kiểm chứng: Các triển khai hiện có, trong đó bề dày ổn định, tài liệu phong phú và sự hỗ trợ lớn từ cộng đồng của YOLOv5 được đánh giá cao.
  • Huấn luyện trong điều kiện hạn chế tài nguyên: Các môi trường có tài nguyên GPU hạn chế, nơi pipeline huấn luyện hiệu quả và yêu cầu bộ nhớ thấp hơn của YOLOv5 mang lại lợi thế.
  • Hỗ trợ đa dạng định dạng export: Các dự án yêu cầu triển khai trên nhiều định dạng, bao gồm ONNX, TensorRT, CoreMLTFLite.

Khi nào nên chọn YOLOv6#

YOLOv6 được khuyến nghị cho:

  • Triển khai nhận biết phần cứng công nghiệp: Các kịch bản trong đó thiết kế nhận biết phần cứng và quá trình tái tham số hóa hiệu quả của model mang lại hiệu năng tối ưu trên phần cứng mục tiêu cụ thể.
  • Phát hiện một giai đoạn tốc độ cao: Các ứng dụng ưu tiên tốc độ suy luận thô trên GPU để xử lý video thời gian thực trong môi trường được kiểm soát.
  • Tích hợp hệ sinh thái Meituan: Các team đã làm việc trong stack công nghệ và hạ tầng triển khai của Meituan.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Định hướng tiếp theo: Ưu thế của YOLO26#

Trong khi YOLOv5 vẫn là một công cụ đáng tin cậy và YOLOv6-3.0 cung cấp thông lượng GPU công nghiệp mạnh mẽ, công nghệ tiên tiến nhất đã phát triển. Đối với các developer bắt đầu dự án mới hiện nay, hướng đi được khuyến nghị là Ultralytics YOLO26.

Ra mắt vào tháng 1 năm 2026, YOLO26 đại diện cho một bước tiến vượt bậc. Model này kế thừa tính linh hoạt vượt trội của hệ sinh thái Ultralytics, đồng thời giới thiệu các cải tiến kiến trúc đột phá:

  • Thiết kế end-to-end không NMS: YOLO26 loại bỏ bước hậu xử lý Non-Maximum Suppression, giúp giảm đáng kể biến thiên độ trễ và đơn giản hóa logic triển khai.
  • Suy luận CPU nhanh hơn tới 43%: Nhờ loại bỏ DFL và sử dụng head được tối ưu hóa, model vượt trội đáng kể so với các thế hệ trước trên thiết bị edge và thiết bị công suất thấp.
  • Optimizer MuSGD: Tận dụng các cải tiến trong huấn luyện LLM, optimizer MuSGD mới đảm bảo quá trình huấn luyện ổn định cao và hội tụ nhanh đáng kể.
  • Tính linh hoạt nâng cao: YOLO26 xử lý liền mạch Hộp giới hạn định hướng (OBB), Ước tính tư thế và Segmentation với các loss chuyên biệt cho từng tác vụ như ProgLoss và STAL, mang lại khả năng nhận diện vật thể nhỏ vượt trội.

Nếu đang khám phá các lựa chọn khác trong hệ sinh thái Ultralytics, bạn cũng có thể cân nhắc YOLO11 đa dụng hoặc YOLO-World mang tính đổi mới cho các tác vụ phát hiện với vocabulary mở.

Kết luận#

Cả YOLOv5 và YOLOv6-3.0 đều tạo ra tác động đáng kể đến lĩnh vực thị giác máy tính. YOLOv6-3.0 cung cấp thông lượng xuất sắc trên phần cứng server cao cấp, phù hợp với các tác vụ phân tích offline chuyên biệt. Tuy nhiên, YOLOv5 vẫn là lựa chọn vượt trội cho các developer cần một model mạnh mẽ, dễ sử dụng và có tính linh hoạt cao, được hỗ trợ bởi một platform đẳng cấp thế giới.

Để đạt được sự cân bằng tối ưu giữa độ chính xác thế hệ mới, khả năng triển khai native không NMS và trải nghiệm developer tốt nhất trong ngành, nâng cấp lên YOLO26 thông qua Ultralytics Platform là lựa chọn dứt khoát cho các giải pháp AI thị giác hiện đại.

Những người đóng góp

Bình luận