Ultralytics YOLO27:

YOLOv7 so với YOLOv6-3.0#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các model phát hiện đối tượng mới liên tục mở rộng giới hạn về tốc độ và độ chính xác. Hai cột mốc quan trọng trong hành trình này là YOLOv7 và YOLOv6-3.0. Cả hai model đều giới thiệu những cải tiến kiến trúc độc đáo nhằm tối đa hóa thông lượng và độ chính xác cho các ứng dụng thực tế. Trang này cung cấp phân tích kỹ thuật chuyên sâu về cả hai kiến trúc, so sánh hiệu năng, phương pháp training và các trường hợp sử dụng lý tưởng để giúp bạn đưa ra quyết định sáng suốt cho dự án trí tuệ nhân tạo tiếp theo.

YOLOv7: Tiên phong của Bag-of-Freebies#

Được phát hành vào giữa năm 2022, YOLOv7 giới thiệu một số chiến lược đổi mới để tối ưu hóa kiến trúc mạng mà không làm tăng chi phí inference. Model tập trung mạnh vào các "bag-of-freebies" có thể train nhằm cải thiện độ chính xác trong khi vẫn duy trì hiệu năng thời gian thực.

Điểm nổi bật về kiến trúc#

YOLOv7 được đặc trưng bởi mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). Kiến trúc này cho phép model học các đặc trưng đa dạng hơn bằng cách kiểm soát các đường dẫn gradient ngắn nhất và dài nhất. Hơn nữa, YOLOv7 tận dụng các kỹ thuật tái tham số hóa cấu trúc trong quá trình suy luận để hợp nhất các lớp tích chập, giúp giảm hiệu quả số lượng tham số và thời gian tính toán mà không hy sinh các biểu diễn đã học.

Model cũng có một chiến lược training auxiliary head độc đáo. Bằng cách sử dụng một "lead head" cho các dự đoán cuối cùng và một "auxiliary head" để định hướng quá trình training ở các lớp giữa, YOLOv7 đạt được khả năng hội tụ tốt hơn và trích xuất đặc trưng phong phú hơn, đặc biệt hữu ích khi xử lý các tác vụ phát hiện đối tượng đầy thách thức.

Tìm hiểu thêm về YOLOv7

YOLOv6-3.0: Thông lượng cấp công nghiệp#

Được phát triển bởi Phòng AI Thị giác Meituan, YOLOv6-3.0 được thiết kế rõ ràng như một "model phát hiện đối tượng thế hệ tiếp theo cho các ứng dụng công nghiệp". Được phát hành vào đầu năm 2023, model tập trung mạnh vào việc tối đa hóa khả năng tận dụng phần cứng, đặc biệt trên GPU NVIDIA.

Điểm nổi bật về kiến trúc#

YOLOv6-3.0 sử dụng backbone EfficientRep, được tối ưu hóa cao cho xử lý song song trên GPU. Điều này giúp model đạt hiệu quả vượt trội trong xử lý batch quy mô lớn. Phiên bản 3.0 giới thiệu module Nối hai chiều (BiC) trong neck để tăng cường việc hợp nhất đặc trưng ở các scale khác nhau, cải thiện khả năng phát hiện các đối tượng có kích thước đa dạng của model.

Ngoài ra, YOLOv6-3.0 sử dụng chiến lược Training có hỗ trợ Anchor (AAT). Phương pháp đổi mới này kết hợp lợi ích của training dựa trên anchor với inference không anchor, cho phép model tận dụng tính ổn định của anchor trong giai đoạn học, đồng thời duy trì tốc độ và sự đơn giản của thiết kế không anchor trong quá trình triển khai.

Tìm hiểu thêm về YOLOv6

So sánh hiệu năng#

Khi đánh giá các model cho môi trường production, việc cân bằng độ chính xác (mAP) với tốc độ inference và chi phí tính toán (FLOPs) là yếu tố then chốt. Dưới đây là phần so sánh chi tiết các biến thể tiêu chuẩn của cả hai model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
Các yếu tố cần cân nhắc về phần cứng

YOLOv6-3.0 đặc biệt phù hợp với các môi trường GPU có thông lượng cao (như TensorRT), trong khi YOLOv7 mang lại sự cân bằng vững chắc cho các hệ thống ưu tiên cao việc duy trì đặc trưng.

Lợi thế của Ultralytics#

Mặc dù các repository độc lập của YOLOv7 và YOLOv6-3.0 rất mạnh mẽ, việc tận dụng chúng trong hệ sinh thái Ultralytics sẽ nâng tầm trải nghiệm developer. Package Python ultralytics chuẩn hóa các kiến trúc đa dạng này trong một framework trực quan duy nhất.

  • Dễ sử dụng: Những ngày phải dùng các script thiết lập phức tạp đã qua. Ultralytics API cho phép bạn load, train và deploy YOLOv7 hoặc YOLOv6 với lượng boilerplate code tối thiểu. Bạn có thể dễ dàng chuyển đổi giữa các kiến trúc chỉ bằng cách thay đổi file trọng số của model.
  • Hệ sinh thái được duy trì tốt: Ultralytics cung cấp một môi trường mạnh mẽ với các bản cập nhật thường xuyên, đảm bảo khả năng tương thích native với các bản phân phối PyTorch và phiên bản CUDA mới nhất.
  • Hiệu quả training: Các pipeline training được tối ưu hóa chuyên sâu để sử dụng hiệu quả tài nguyên GPU. Ngoài ra, các model Ultralytics YOLO nhìn chung có yêu cầu bộ nhớ thấp hơn trong quá trình training so với các model dựa trên Transformer nặng (như RT-DETR), cho phép sử dụng batch size lớn hơn trên phần cứng phổ thông.
  • Tính linh hoạt: Bên cạnh phát hiện bounding box tiêu chuẩn, framework Ultralytics còn hỗ trợ liền mạch các tác vụ nâng cao như ước tính posephân đoạn instance trên các họ model tương thích, một tính năng thường thiếu trong các repository nghiên cứu độc lập.

Ví dụ code: Training và suy luận#

Việc tích hợp các model này vào pipeline Python rất đơn giản. Hãy đảm bảo dataset của bạn được định dạng chính xác (ví dụ: COCO tiêu chuẩn), sau đó chạy lệnh sau:

from ultralytics import YOLO

# Load a pretrained YOLOv7 model (or 'yolov6n.pt' for YOLOv6)
model = YOLO("yolov7.pt")

# Train the model with built-in hyperparameter management
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on an image URL or local path
predictions = model("https://ultralytics.com/images/bus.jpg")

# Visualize the detection results
predictions[0].show()

Các trường hợp sử dụng lý tưởng#

Khi nào nên chọn YOLOv7#

YOLOv7 vượt trội trong các tình huống yêu cầu độ chính xác cao và khả năng trích xuất đặc trưng dày đặc.

  • Giám sát phức tạp: Khả năng duy trì các chi tiết tinh vi giúp model phù hợp để giám sát những cảnh đông người hoặc phát hiện các bất thường nhỏ trong hạ tầng thành phố thông minh.
  • Đánh giá benchmark học thuật: Thường được sử dụng làm baseline mạnh trong nghiên cứu nhờ triết lý thiết kế "bag-of-freebies" toàn diện.

Khi nào nên chọn YOLOv6-3.0#

YOLOv6-3.0 là model chủ lực cho các pipeline khối lượng lớn được tăng tốc bằng GPU.

  • Tự động hóa công nghiệp: Hoàn hảo cho dây chuyền nhà máy và phát hiện lỗi sản xuất, nơi GPU cấp server xử lý đồng thời nhiều luồng video.
  • Phân tích thông lượng cao: Rất phù hợp để xử lý các kho lưu trữ video offline, trong đó tối đa hóa số frame mỗi giây là mục tiêu chính.

Tương lai: YOLO26#

Mặc dù YOLOv7 và YOLOv6-3.0 có năng lực cao, tốc độ đổi mới nhanh chóng của trí tuệ nhân tạo đòi hỏi hiệu quả còn lớn hơn nữa. Được phát hành vào tháng 1 năm 2026, Ultralytics YOLO26 đại diện cho một bước nhảy vọt thế hệ trong lĩnh vực thị giác máy tính, giải quyết một cách có hệ thống những hạn chế của các kiến trúc cũ.

Nếu bạn bắt đầu một dự án mới, YOLO26 được đặc biệt khuyến nghị thay cho các thế hệ trước. Model giới thiệu một số tính năng mang tính đột phá:

  • Thiết kế end-to-end không cần NMS: Dựa trên nền tảng do YOLOv10 xây dựng, YOLO26 loại bỏ tự nhiên phép loại bỏ cực đại không tối đa (NMS). Điều này làm giảm chi phí post-processing, đơn giản hóa việc triển khai vào các ứng dụng mobile và đảm bảo inference có độ trễ thấp, tính xác định cao.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật training LLM tiên tiến (chẳng hạn những kỹ thuật được sử dụng trong Kimi K2 của Moonshot AI), YOLO26 sử dụng một optimizer lai kết hợp SGD và Muon. Điều này đảm bảo động lực training ổn định hơn và khả năng hội tụ nhanh hơn đáng kể.
  • Inference trên CPU nhanh hơn tới 43%: Bằng cách loại bỏ một cách có chiến lược Distribution Focal Loss (DFL), YOLO26 đạt mức tăng tốc rất lớn trên CPU. Điều này khiến model trở thành lựa chọn hàng đầu cho các môi trường edge như Raspberry Pi và các cảm biến IoT từ xa.
  • ProgLoss + STAL: Các hàm loss nâng cao được thiết kế chuyên biệt để cải thiện khả năng nhận diện đối tượng nhỏ, vốn là điểm yếu lâu nay của các detector một giai đoạn.

Bằng cách kết hợp những cải tiến này với Ultralytics Platform mạnh mẽ, YOLO26 mang lại hiệu năng, tính linh hoạt và khả năng triển khai dễ dàng vượt trội cho các kỹ sư machine learning hiện đại.

Những người đóng góp

Bình luận