Ultralytics YOLO27:

YOLOv6-3.0 so với YOLOv7#

Sự phát triển của thị giác máy tính thời gian thực được đánh dấu bởi những tiến bộ nhanh chóng trong hiệu quả kiến trúc và phương pháp huấn luyện. Hai model nổi bật đã tác động đáng kể đến lĩnh vực này là YOLOv6-3.0YOLOv7. Cả hai framework đều giới thiệu các kỹ thuật mới để cân bằng tốc độ suy luận với độ chính xác phát hiện, hướng đến nhiều môi trường triển khai, từ GPU server cao cấp đến các thiết bị biên.

Bài so sánh kỹ thuật toàn diện này phân tích kiến trúc, các chỉ số hiệu năng và các trường hợp sử dụng lý tưởng của chúng, đồng thời làm nổi bật cách Ultralytics Platform hiện đại và model YOLO26 mới nhất phát triển dựa trên các khái niệm nền tảng này để mang lại trải nghiệm chưa từng có cho developer.

YOLOv6-3.0: Tối ưu hóa thông lượng công nghiệp#

Được phát triển bởi Phòng AI Thị giác tại Meituan, YOLOv6-3.0 được thiết kế chuyên biệt cho các ứng dụng công nghiệp có thông lượng cao. Model tập trung mạnh vào việc tối đa hóa hiệu năng trên các bộ tăng tốc phần cứng, trở thành lựa chọn phù hợp cho những môi trường có thể xử lý theo batch trên các GPU chuyên dụng.

  • Tác giả: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu và Xiangxiang Chu
  • Tổ chức: Meituan
  • Ngày: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Các cải tiến về kiến trúc#

YOLOv6-3.0 dựa trên backbone EfficientRep, một kiến trúc thân thiện với phần cứng được thiết kế để tối ưu chi phí truy cập bộ nhớ trên GPU. Để tăng cường việc hợp nhất đặc trưng giữa các scale khác nhau, model đưa vào module Nối kết hai chiều (BiC) trong neck. Điều này cho phép network nắm bắt các cấp bậc không gian phức tạp hiệu quả hơn so với các phiên bản trước.

Ngoài ra, YOLOv6-3.0 triển khai chiến lược Huấn luyện hỗ trợ bởi anchor (AAT). Phương pháp này kết hợp các tín hiệu gradient phong phú của quá trình huấn luyện dựa trên anchor với lợi ích triển khai tinh gọn của suy luận không anchor, giúp model hội tụ ổn định hơn mà không làm giảm tốc độ hậu xử lý.

Tìm hiểu thêm về YOLOv6

Các yếu tố cần cân nhắc về phần cứng

Mặc dù YOLOv6-3.0 đạt hiệu năng vượt trội trên GPU cấp server (chẳng hạn NVIDIA T4), sự phụ thuộc lớn vào việc tái tham số hóa cấu trúc cụ thể đôi khi có thể dẫn đến độ trễ chưa tối ưu trên các thiết bị biên bị giới hạn nghiêm ngặt bởi CPU so với các kiến trúc mới hơn.

YOLOv7: Tiên phong của Bag-of-Freebies#

Được các nhà nghiên cứu tại Academia Sinica phát hành, YOLOv7 áp dụng một hướng tiếp cận khác bằng cách tập trung mạnh vào phân tích đường dẫn gradient và các tối ưu hóa trong thời gian huấn luyện không làm tăng chi phí suy luận—một khái niệm được các tác giả gọi là "túi quà miễn phí có thể huấn luyện".

  • Tác giả: Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao
  • Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
  • Ngày: 2022-07-06
  • Arxiv: 2207.02696
  • GitHub: WongKinYiu/yolov7

Các cải tiến về kiến trúc#

Nền tảng cốt lõi của YOLOv7 là Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). E-ELAN tối ưu đường dẫn gradient bằng cách cho phép các lớp khác nhau học các đặc trưng đa dạng hơn mà không làm gián đoạn topology network ban đầu. Kết quả là một model có khả năng biểu đạt cao, đạt độ chính xác trung bình (mAP) hàng đầu.

YOLOv7 cũng sử dụng mạnh mẽ việc tái tham số hóa model, hợp nhất các lớp convolution với batch normalization trong quá trình suy luận. Điều này làm giảm số lượng tham số và tăng tốc forward pass khi triển khai bằng các framework như NVIDIA TensorRT hoặc ONNX.

Tìm hiểu thêm về YOLOv7

So sánh hiệu năng#

Khi đánh giá các model này trên dataset MS COCO, chúng tôi nhận thấy sự đánh đổi rõ rệt giữa các biến thể YOLOv6 siêu nhẹ và các kiến trúc YOLOv7 có nhiều tham số, tập trung vào độ chính xác.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Dữ liệu cho thấy YOLOv6-3.0n có tốc độ suy luận xuất sắc, phù hợp với phân tích video tần suất cao. Ngược lại, YOLOv7x đạt mAP cao nhất, chiếm ưu thế trong các tác vụ mà độ chính xác phát hiện quan trọng hơn tốc độ khung hình thuần túy.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv6 và YOLOv7 phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn ecosystem của bạn.

Khi nào nên chọn YOLOv6#

YOLOv6 là lựa chọn phù hợp cho:

  • Triển khai nhận biết phần cứng công nghiệp: Các kịch bản trong đó thiết kế nhận biết phần cứng và quá trình tái tham số hóa hiệu quả của model mang lại hiệu năng tối ưu trên phần cứng mục tiêu cụ thể.
  • Phát hiện một giai đoạn tốc độ cao: Các ứng dụng ưu tiên tốc độ suy luận thô trên GPU để xử lý video thời gian thực trong môi trường được kiểm soát.
  • Tích hợp hệ sinh thái Meituan: Các team đã làm việc trong stack công nghệ và hạ tầng triển khai của Meituan.

Khi nào nên chọn YOLOv7#

YOLOv7 được khuyến nghị cho:

  • Benchmarking học thuật: Tái tạo các kết quả state-of-the-art thời kỳ năm 2022 hoặc nghiên cứu ảnh hưởng của E-ELAN và các kỹ thuật bag-of-freebies có thể training.
  • Nghiên cứu tái tham số hóa: Nghiên cứu các convolution được tái tham số hóa theo kế hoạch và các chiến lược mở rộng model kết hợp.
  • Pipeline tùy chỉnh hiện có: Các dự án có pipeline được tùy chỉnh sâu, xây dựng xoay quanh kiến trúc cụ thể của YOLOv7 và không thể dễ dàng refactor.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Lợi thế Ultralytics: Bước vào tương lai#

Mặc dù YOLOv6-3.0 và YOLOv7 là những cột mốc quan trọng, việc tích hợp các repository riêng biệt vào pipeline production thường gây ra thách thức trong triển khai model và tinh chỉnh hyperparameter. Ecosystem Ultralytics giải quyết các điểm khó này bằng cách cung cấp một interface hợp nhất, tinh gọn.

Tại sao nên chọn Ultralytics?#

  • Dễ sử dụng: Ultralytics Python API cho phép developer load, train và export model chỉ với vài dòng code. Việc chuyển từ một model cũ sang kiến trúc mới nhất chỉ yêu cầu thay đổi một string duy nhất.
  • Ecosystem được duy trì tốt: Ultralytics cung cấp các bản cập nhật thường xuyên, hỗ trợ tích cực từ cộng đồng và tài liệu toàn diện.
  • Tính linh hoạt: Không giống các model trước đây chủ yếu tập trung vào bounding box, các model Ultralytics hỗ trợ native việc học đa tác vụ, bao gồm phân đoạn instance, ước tính posehộp giới hạn định hướng (OBB).
  • Yêu cầu bộ nhớ: Các model Ultralytics YOLO duy trì mức sử dụng bộ nhớ thấp hơn trong quá trình huấn luyện so với các kiến trúc dựa trên Transformer như RT-DETR, cho phép nhà nghiên cứu huấn luyện hiệu quả trên phần cứng cấp người dùng.

Nâng cấp lên YOLO26#

Đối với các developer tìm kiếm hiệu năng đỉnh cao, YOLO26 (phát hành vào tháng 1 năm 2026) tạo ra một thay đổi căn bản trong mô hình phát hiện đối tượng. Model giới thiệu Thiết kế end-to-end không cần NMS hoàn toàn, loại bỏ logic hậu xử lý phức tạp và giảm đáng kể biến thiên độ trễ trên các thiết bị biên.

Các đổi mới chính trong YOLO26 bao gồm:

  • Optimizer MuSGD: Một optimizer hybrid tinh vi giữa SGD và Muon, bảo đảm động lực huấn luyện cực kỳ ổn định và hội tụ nhanh hơn.
  • Loại bỏ DFL: Bằng cách loại bỏ hàm mất mát tiêu điểm phân phối, YOLO26 đơn giản hóa khả năng tương thích khi export và tăng hiệu năng trên các thiết bị công suất thấp.
  • ProgLoss + STAL: Các hàm loss nâng cao mang lại cải thiện đáng kể trong khả năng nhận diện đối tượng nhỏ.
  • Tốc độ vượt trội: Đạt tốc độ suy luận CPU nhanh hơn tới 43% so với các thế hệ trước, rất phù hợp với các hệ thống nhúng như triển khai trên Raspberry Pi hoặc Apple CoreML.

Các model có năng lực cao khác trong ecosystem bao gồm YOLO11YOLOv8, cả hai đều mang lại sự cân bằng hiệu năng xuất sắc cho các tích hợp phần cứng legacy.

Đảm bảo pipeline sẵn sàng cho tương lai

Bằng cách xây dựng các ứng dụng thị giác máy tính trên Ultralytics Platform, bạn đảm bảo có quyền truy cập ngay vào các model state-of-the-art trong tương lai mà không cần viết lại các data loader hoặc script triển khai.

Ví dụ code: Training tinh gọn#

Đoạn code sau minh họa cách bạn có thể dễ dàng train một model YOLO26 state-of-the-art bằng Ultralytics API. Workflow chính xác này cũng áp dụng liền mạch cho YOLO11 hoặc YOLOv8, ẩn đi phần boilerplate code thường được các repository cũ yêu cầu.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 nano model for rapid training
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset
# The API handles dataset downloading, augmentation, and hyperparameter configuration
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="cuda:0",  # Automatically utilizes PyTorch GPU acceleration
)

# Run an end-to-end, NMS-free inference on a test image
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for cross-platform deployment
model.export(format="onnx")

Kết luận#

YOLOv6-3.0 và YOLOv7 đã giải quyết thành công các khía cạnh khác nhau của bài toán phát hiện thời gian thực. YOLOv6-3.0 là một powerhouse cho các môi trường GPU công nghiệp chuyên biệt, trong khi YOLOv7 cung cấp độ chính xác cao nhờ tối ưu hóa nghiêm ngặt đường dẫn gradient.

Tuy nhiên, đối với các ứng dụng hiện đại yêu cầu tính linh hoạt vượt trội, ít trở ngại khi triển khai và hiệu năng state-of-the-art, Ultralytics YOLO26 là lựa chọn mang tính quyết định. Kiến trúc không cần NMS, optimizer MuSGD nâng cao và khả năng tích hợp sâu với Ultralytics Platform bảo đảm developer có thể triển khai các giải pháp AI thị giác mạnh mẽ, có khả năng mở rộng nhanh hơn bao giờ hết.

Những người đóng góp

Bình luận