Ultralytics YOLO27:
Get Started

YOLOv7 và YOLOv6-3.0#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các model phát hiện vật thể mới liên tục mở rộng giới hạn về tốc độ và độ chính xác. YOLOv7 và YOLOv6-3.0 là hai cột mốc quan trọng trong quá trình này. Cả hai model đều giới thiệu những cải tiến kiến trúc riêng, được thiết kế để tối đa hóa thông lượng và độ chính xác cho các ứng dụng thực tế. Trang này phân tích kỹ thuật chuyên sâu cả hai kiến trúc, so sánh hiệu năng, phương pháp huấn luyện và các trường hợp sử dụng phù hợp nhất để giúp bạn đưa ra quyết định sáng suốt cho dự án trí tuệ nhân tạo tiếp theo.

YOLOv7: Tiên phong với Bag-of-Freebies#

Ra mắt vào giữa năm 2022, YOLOv7 giới thiệu một số chiến lược đổi mới nhằm tối ưu kiến trúc mạng mà không làm tăng chi phí suy luận. Model tập trung mạnh vào "bag-of-freebies" có thể huấn luyện để cải thiện độ chính xác mà vẫn duy trì hiệu năng thời gian thực.

Điểm nổi bật về kiến trúc#

YOLOv7 được đặc trưng bởi Extended Efficient Layer Aggregation Network (E-ELAN). Kiến trúc này cho phép model học các đặc trưng đa dạng hơn bằng cách kiểm soát đường gradient ngắn nhất và dài nhất. Ngoài ra, YOLOv7 sử dụng các kỹ thuật tái tham số hóa cấu trúc trong quá trình suy luận để hợp nhất các lớp tích chập, qua đó giảm số lượng tham số và thời gian tính toán mà không làm mất các biểu diễn đã học.

Model còn có chiến lược huấn luyện head phụ độc đáo. Bằng cách dùng "head chính" để đưa ra dự đoán cuối cùng và "head phụ" để hướng dẫn quá trình huấn luyện ở các lớp giữa, YOLOv7 đạt khả năng hội tụ tốt hơn và trích xuất đặc trưng phong phú hơn, đặc biệt hữu ích khi xử lý các tác vụ phát hiện vật thể khó.

Tìm hiểu thêm về YOLOv7

YOLOv6-3.0: Thông lượng cấp công nghiệp#

Được phát triển bởi Bộ phận AI Thị giác của Meituan, YOLOv6-3.0 được thiết kế rõ ràng như một "model phát hiện vật thể thế hệ mới cho ứng dụng công nghiệp". Ra mắt vào đầu năm 2023, model tập trung tối đa hóa mức sử dụng phần cứng, đặc biệt trên GPU NVIDIA.

Điểm nổi bật về kiến trúc#

YOLOv6-3.0 sử dụng backbone EfficientRep, được tối ưu mạnh cho xử lý song song trên GPU. Nhờ vậy, model cực kỳ hiệu quả khi xử lý batch quy mô lớn. Phiên bản 3.0 giới thiệu module Bi-directional Concatenation (BiC) trong neck để tăng cường hợp nhất đặc trưng ở các tỷ lệ khác nhau, cải thiện khả năng phát hiện vật thể có kích thước đa dạng.

Ngoài ra, YOLOv6-3.0 sử dụng chiến lược Anchor-Aided Training (AAT). Phương pháp đổi mới này kết hợp ưu điểm của huấn luyện dựa trên anchor với suy luận không dùng anchor, giúp model tận dụng độ ổn định của anchor trong giai đoạn học, đồng thời duy trì tốc độ và sự đơn giản của thiết kế không dùng anchor khi triển khai.

Tìm hiểu thêm về YOLOv6

So sánh hiệu năng#

Khi đánh giá model cho production, việc cân bằng độ chính xác (mAP) với tốc độ suy luận và chi phí tính toán (FLOPs) là yếu tố then chốt. Dưới đây là phần so sánh chi tiết các biến thể tiêu chuẩn của cả hai model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
Các yếu tố cần cân nhắc về phần cứng

YOLOv6-3.0 đặc biệt phù hợp với môi trường GPU thông lượng cao (chẳng hạn như TensorRT), trong khi YOLOv7 mang lại sự cân bằng đáng tin cậy cho các hệ thống ưu tiên cao việc bảo toàn đặc trưng.

Lợi thế của Ultralytics#

Các repository độc lập của YOLOv7 và YOLOv6-3.0 rất mạnh mẽ, nhưng hệ sinh thái Ultralytics thay đổi đáng kể trải nghiệm phát triển. Package Python ultralytics chuẩn hóa nhiều kiến trúc khác nhau trong cùng một framework trực quan.

  • Tính dễ sử dụng: Không còn cần đến các script thiết lập phức tạp. Ultralytics API cho phép bạn xây dựng, huấn luyện và triển khai model YOLOv6 (từ cấu hình YAML của model) hoặc các model hiện đại như YOLO26 chỉ với lượng mã dựng sẵn tối thiểu. YOLOv7 không được hỗ trợ nguyên bản; trước tiên, cần export checkpoint YOLOv7 upstream sang ONNX hoặc TensorRT. Bạn có thể dễ dàng chuyển đổi giữa các kiến trúc chỉ bằng cách thay đổi file model.
  • Hệ sinh thái được duy trì tốt: Ultralytics cung cấp môi trường vững chắc với các bản cập nhật thường xuyên, đảm bảo khả năng tương thích nguyên bản với các bản phân phối PyTorch và phiên bản CUDA mới nhất.
  • Hiệu quả huấn luyện: Các pipeline huấn luyện được tối ưu sâu để sử dụng hiệu quả tài nguyên GPU. Ngoài ra, các model Ultralytics YOLO thường yêu cầu ít bộ nhớ hơn trong quá trình huấn luyện so với các model dựa trên Transformer nặng (như RT-DETR), cho phép sử dụng batch size lớn hơn trên phần cứng phổ thông.
  • Tính linh hoạt: Ngoài khả năng phát hiện bounding box tiêu chuẩn, framework Ultralytics còn hỗ trợ liền mạch các tác vụ nâng cao như ước lượng tư thế và phân đoạn instance trên các dòng model tương thích; đây là tính năng thường không có trong các repository nghiên cứu độc lập.

Ví dụ mã: Huấn luyện và suy luận#

Việc tích hợp các model này vào pipeline Python rất đơn giản. Hãy đảm bảo tập dữ liệu được định dạng chính xác (ví dụ: theo chuẩn COCO) rồi chạy lệnh sau:

from ultralytics import YOLO

# Tạo model YOLOv6n từ cấu hình YAML (không có trọng số YOLOv6 pretrained)
model = YOLO("yolov6n.yaml")

# Huấn luyện model với tính năng quản lý siêu tham số tích hợp sẵn
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Chạy suy luận trên URL ảnh hoặc đường dẫn cục bộ
predictions = model("https://ultralytics.com/images/bus.jpg")

# Trực quan hóa kết quả phát hiện
predictions[0].show()

Các trường hợp sử dụng phù hợp nhất#

Khi nào nên chọn YOLOv7#

YOLOv7 phát huy hiệu quả trong các tình huống đòi hỏi độ chính xác cao và khả năng trích xuất đặc trưng dày đặc.

  • Giám sát phức tạp: Khả năng bảo toàn chi tiết tinh vi khiến model phù hợp để giám sát các cảnh đông đúc hoặc phát hiện bất thường nhỏ trong hạ tầng thành phố thông minh.
  • Đối chuẩn học thuật: Thường được dùng làm baseline mạnh trong nghiên cứu nhờ triết lý thiết kế "bag-of-freebies" toàn diện.

Khi nào nên chọn YOLOv6-3.0#

YOLOv6-3.0 là lựa chọn chủ lực cho các pipeline thông lượng cao, tăng tốc bằng GPU.

  • Tự động hóa công nghiệp: Lý tưởng cho dây chuyền nhà máy và phát hiện lỗi sản xuất, nơi GPU cấp máy chủ xử lý đồng thời nhiều luồng video.
  • Phân tích thông lượng cao: Rất phù hợp để xử lý kho lưu trữ video ngoại tuyến khi mục tiêu chính là tối đa hóa số khung hình mỗi giây.

Tương lai: YOLO26#

YOLOv7 và YOLOv6-3.0 có năng lực vượt trội, nhưng tốc độ đổi mới nhanh chóng của trí tuệ nhân tạo đòi hỏi hiệu quả cao hơn nữa. Ra mắt vào tháng 1 năm 2026, Ultralytics YOLO26 đánh dấu bước nhảy thế hệ trong thị giác máy tính, giải quyết một cách có hệ thống các hạn chế của kiến trúc cũ.

Nếu bắt đầu dự án mới, bạn nên ưu tiên YOLO26 hơn các thế hệ trước. Model giới thiệu một số tính năng đột phá:

  • Thiết kế end-to-end không cần NMS: Dựa trên nền tảng do YOLOv10 xây dựng, head one-to-one tùy chọn (nms=False) của YOLO26 loại bỏ Non-Maximum Suppression (NMS). Điều này giảm chi phí hậu xử lý, đơn giản hóa việc triển khai lên ứng dụng di động và đảm bảo suy luận có tính xác định cao, độ trễ thấp.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM tiên tiến (chẳng hạn như kỹ thuật được dùng trong Kimi K2 của Moonshot AI), YOLO26 sử dụng optimizer kết hợp SGD và Muon. Cách này đảm bảo động lực huấn luyện ổn định hơn và tăng tốc hội tụ đáng kể.
  • Suy luận trên CPU nhanh hơn tới 43%: Bằng cách loại bỏ Distribution Focal Loss (DFL) một cách có chủ đích, YOLO26 đạt mức tăng tốc vượt trội trên CPU. Điều này khiến model trở thành lựa chọn hàng đầu không thể tranh cãi cho môi trường biên như Raspberry Pi và cảm biến IoT ở vùng xa.
  • ProgLoss + STAL: Các hàm loss tiên tiến được thiết kế riêng để cải thiện khả năng nhận diện vật thể nhỏ, vốn là điểm yếu lâu nay của các detector một giai đoạn.

Kết hợp những cải tiến này với Ultralytics Platform mạnh mẽ, YOLO26 mang lại hiệu năng, tính linh hoạt và sự dễ dàng triển khai vượt trội cho kỹ sư machine learning hiện đại.

Người đóng góp

Bình luận