Ultralytics YOLO27:
Get Started

YOLOv6-3.0 và PP-YOLOE+#

Khi chọn framework cho phát hiện vật thể thời gian thực, các kỹ sư machine learning thường đánh giá nhiều kiến trúc hiệu năng cao. Hai model đáng chú ý trong lĩnh vực ứng dụng công nghiệp là YOLOv6-3.0 và PP-YOLOE+. Cả hai model đều mở rộng giới hạn về độ chính xác và tốc độ, nhưng được thiết kế cho các hệ sinh thái và phần cứng triển khai hơi khác nhau.

Bài so sánh kỹ thuật này phân tích chuyên sâu kiến trúc, chỉ số hiệu năng và phương pháp huấn luyện của hai model, đồng thời giới thiệu các lựa chọn thay thế hiện đại như Ultralytics YOLO26, vốn linh hoạt và dễ sử dụng hơn.

YOLOv6-3.0: Động cơ công nghiệp thông lượng cao#

Được phát triển bởi Bộ phận Vision AI của Meituan, YOLOv6-3.0 được tối ưu hóa mạnh cho môi trường công nghiệp, đặc biệt là những môi trường sử dụng GPU cấp máy chủ mạnh mẽ.

  • Tác giả: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu và Xiangxiang Chu
  • Tổ chức: Meituan
  • Ngày: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Các cải tiến kiến trúc#

YOLOv6-3.0 sử dụng backbone EfficientRep, được thiết kế riêng để tối đa hóa khả năng khai thác các bộ tăng tốc phần cứng như GPU NVIDIA. Kiến trúc này đưa module Phép nối hai chiều (BiC) vào neck, cải thiện đáng kể việc hợp nhất đặc trưng đa tỷ lệ. Ngoài ra, model tích hợp chiến lược Huấn luyện có hỗ trợ anchor (AAT). Phương pháp lai này tận dụng khả năng hội tụ mạnh mẽ của các mạng dựa trên anchor trong giai đoạn huấn luyện, đồng thời loại bỏ anchor khi suy luận để duy trì tốc độ cao đặc trưng của phương pháp không anchor.

Tìm hiểu thêm về YOLOv6

PP-YOLOE+: Model phát hiện hàng đầu của PaddlePaddle#

PP-YOLOE+ là phiên bản phát triển của dòng PP-YOLO, được các nhà nghiên cứu Baidu phát triển hoàn toàn trong framework PaddlePaddle. Model hoạt động tốt trong những môi trường đã thiết lập hệ sinh thái Paddle.

Các cải tiến kiến trúc#

PP-YOLOE+ là detector không anchor, giới thiệu chiến lược gán nhãn động có tên TAL (Task Alignment Learning). Model sử dụng backbone CSPRepResNet, giúp trích xuất đặc trưng ngữ nghĩa hiệu quả mà vẫn duy trì hiệu suất tính toán. Model được tối ưu hóa cao để triển khai qua TensorRT và OpenVINO, là lựa chọn đáng cân nhắc cho các triển khai edge và máy chủ, nếu người dùng thành thạo PaddlePaddle API.

Tìm hiểu thêm về PP-YOLOE+

Các yếu tố cần cân nhắc về framework

Dù PP-YOLOE+ mang lại kết quả xuất sắc, việc phụ thuộc vào PaddlePaddle có thể tạo ra trở ngại ban đầu cho các kỹ sư quen với PyTorch. Sử dụng framework thống nhất như Ultralytics có thể giảm đáng kể thời gian thiết lập.

So sánh hiệu năng#

Để đánh giá các model này, cần xem xét sự cân bằng giữa độ chính xác trung bình (mAP) và tốc độ suy luận. Bảng dưới đây nêu bật hiệu năng của chúng trên bộ dữ liệu validation COCO.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Cả hai model đều có hiệu năng mạnh, nhưng YOLOv6-3.0 thường nhỉnh hơn đôi chút về tốc độ TensorRT thuần ở các kích thước model nhỏ, nhờ đó rất hiệu quả cho thanh toán tự động tốc độ cao hoặc phát hiện lỗi trong sản xuất. Ngược lại, PP-YOLOE+ mở rộng tốt với số lượng tham số lớn hơn để đạt độ chính xác tối đa.

Ưu thế của Ultralytics: Giới thiệu YOLO26#

Dù YOLOv6-3.0 và PP-YOLOE+ đều có năng lực cao, sự phát triển nhanh chóng của thị giác máy tính đòi hỏi các kiến trúc không chỉ có tốc độ thuần mà còn phải dễ sử dụng vượt trội, cần ít bộ nhớ hơn và có hệ sinh thái thống nhất. Các model Ultralytics YOLO, đặc biệt là YOLO11 và YOLO26 tiên tiến, chính là những model định hình lại công nghệ tiên tiến nhất.

Ra mắt vào tháng 1 năm 2026, YOLO26 thiết lập chuẩn mới cho AI thị giác ưu tiên edge và sẵn sàng cho cloud, với những lợi thế đáng kể so với các model cũ:

  • Thiết kế end-to-end không NMS: Dựa trên nền tảng do YOLOv10 đặt ra, head one-to-one tùy chọn của YOLO26 (nms=False) bỏ qua bước Loại bỏ cực đại không tối đa (NMS) trong hậu xử lý. Điều này giúp đơn giản hóa đáng kể logic triển khai và giảm biến thiên độ trễ trong các cảnh đông đúc.
  • Suy luận trên CPU nhanh hơn tới 43%: Bằng cách loại bỏ có chủ đích Hàm mất mát tiêu điểm phân phối (DFL), YOLO26 tăng tốc đáng kể hiệu năng CPU, vượt trội hơn hẳn YOLOv6 hoặc PP-YOLOE+ trên các thiết bị IoT và ứng dụng di động.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM tiên tiến (như Kimi K2 của Moonshot AI), optimizer lai MuSGD mang lại khả năng huấn luyện cực kỳ ổn định và hiệu quả, hội tụ nhanh hơn SGD hoặc AdamW truyền thống.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố then chốt đối với ảnh chụp bằng drone và giám sát trên không.
  • Tính linh hoạt trên nhiều tác vụ: Khác với YOLOv6-3.0 vốn tập trung mạnh vào phát hiện, YOLO26 hỗ trợ sẵn phân đoạn instance, ước tính tư thế, phân loại và phát hiện Bounding Box định hướng (OBB).

Hệ sinh thái huấn luyện tinh gọn#

Việc triển khai PP-YOLOE+ đòi hỏi quản lý môi trường PaddlePaddle, còn YOLOv6-3.0 cần thao tác với các script tập trung vào nghiên cứu. Ngược lại, Nền tảng Ultralytics mang lại trải nghiệm liền mạch, giúp bạn đi từ con số không đến thành thạo.

Chỉ cần vài dòng Python để huấn luyện model YOLO26 tiên tiến:

from ultralytics import YOLO

# Khởi tạo model nano YOLO26 tiên tiến
model = YOLO("yolo26n.pt")

# Huấn luyện model trên bộ dữ liệu tùy chỉnh của bạn (optimizer='auto' chọn MuSGD cho các lượt huấn luyện dài hơn)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Đánh giá độ chính xác của model
metrics = model.val()

# Export liền mạch sang OpenVINO hoặc TensorRT
path = model.export(format="engine")

API đơn giản này, kết hợp với mức sử dụng bộ nhớ thấp hơn trong quá trình huấn luyện so với các model sử dụng nhiều Transformer như RT-DETR, giúp phổ cập AI hiệu năng cao.

Trường hợp sử dụng lý tưởng và chiến lược triển khai#

Việc chọn đúng model quyết định sự thành công của pipeline triển khai.

Khi nào nên sử dụng YOLOv6-3.0#

  • Sản xuất tốc độ cao: Các môi trường trong đó camera công nghiệp kết nối trực tiếp với GPU NVIDIA T4 hoặc A100 chuyên dụng, yêu cầu suy luận ổn định dưới 5 ms.
  • Phân tích video phía máy chủ: Xử lý nhiều luồng video dày đặc, trong đó thông lượng GPU thuần là nút thắt chính.

Khi nào nên dùng PP-YOLOE+#

  • Hệ sinh thái Baidu/Paddle: Môi trường doanh nghiệp đầu tư mạnh vào stack công nghệ PaddlePaddle hoặc triển khai riêng trên phần cứng được tối ưu cho toolchain của Baidu.
  • Ảnh tĩnh độ chính xác cao: Các tình huống trong đó mAP cao của model Extra-Large (PP-YOLOE+x) quan trọng hơn tốc độ triển khai edge.

Khi nào nên chọn Ultralytics YOLO26#

  • Thiết bị edge và IoT: Với khả năng suy luận không NMS tùy chọn và loại bỏ DFL, YOLO26 là lựa chọn hàng đầu cho triển khai trên Raspberry Pi, NXP hoặc CPU di động.
  • Ứng dụng đa tác vụ: Các dự án cần theo dõi vật thể, ước tính tư thế hoặc phân đoạn đồng thời thông qua một API thống nhất.
  • Từ tạo mẫu nhanh đến production: Các nhóm sử dụng Nền tảng Ultralytics để tinh gọn gắn nhãn bộ dữ liệu, tinh chỉnh siêu tham số và triển khai model chỉ với một cú nhấp.

Đối với nhà phát triển muốn khám phá rộng hơn các model phát hiện, những framework như YOLOX và DAMO-YOLO cũng có các phương pháp kiến trúc độc đáo đáng tìm hiểu trong tài liệu Ultralytics.

Người đóng góp

Bình luận