YOLOv7 so với YOLO11#
Bối cảnh thị giác máy tính đã phát triển nhanh chóng trong vài năm qua. Đối với các nhà phát triển và nhà nghiên cứu lựa chọn framework phát hiện đối tượng phù hợp, việc hiểu rõ các điểm khác biệt về kiến trúc và thực tế giữa các mô hình định hình thế hệ là vô cùng quan trọng. Hướng dẫn này cung cấp một so sánh kỹ thuật chi tiết giữa bước đột phá học thuật của YOLOv7 và Ultralytics YOLO11 đã được tối ưu hóa cao độ, sẵn sàng cho môi trường sản xuất.
Nguồn gốc mô hình và Triết lý kiến trúc#
YOLOv7, ra mắt ngày 6 tháng 7 năm 2022 bởi các tác giả Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao từ Institute of Information Science at Academia Sinica, đã giới thiệu một số khái niệm mới cho lĩnh vực này. Được mô tả chi tiết trong bài báo nghiên cứu YOLOv7 công bố trên arXiv, mô hình tập trung mạnh mẽ vào phương pháp "trainable bag-of-freebies" và Mạng Tổng hợp Lớp Hiệu quả Mở rộng (E-ELAN). Các lựa chọn kiến trúc này được thiết kế đặc biệt nhằm tối đa hóa hiệu quả đường dẫn gradient, biến đây thành một công cụ mạnh mẽ cho việc chuẩn hóa học thuật trên các GPU cao cấp.
YOLO11, được phát triển bởi Glenn Jocher và Jing Qiu tại Ultralytics, phát hành ngày 27 tháng 9 năm 2024. YOLO11 chuyển trọng tâm từ độ phức tạp kiến trúc thuần túy sang một hệ sinh thái toàn diện, đặt nhà phát triển lên hàng đầu. Được lưu trữ trên kho lưu trữ GitHub của Ultralytics, YOLO11 sở hữu thiết kế phi mỏ neo (anchor-free) được tối ưu hóa giúp giảm đáng kể mức tiêu thụ bộ nhớ trong cả quá trình huấn luyện và suy luận. Mô hình này được tích hợp nguyên bản vào Ultralytics Platform, mang lại tính dễ sử dụng chưa từng có từ việc gán nhãn tập dữ liệu cho đến triển khai trên biên.
Trong khi các kho lưu trữ độc lập thường trở nên ngưng hoạt động sau khi một bài báo học thuật được công bố, các mô hình của Ultralytics được hưởng lợi từ các bản cập nhật liên tục, đảm bảo tính tương thích lâu dài với các stack machine learning hiện đại như các bản phát hành PyTorch mới nhất và các bộ tăng tốc phần cứng chuyên dụng.
Các chỉ số hiệu suất và Hiệu quả#
Khi triển khai mô hình vào các ứng dụng thực tế, độ chính xác thô phải được cân bằng với tốc độ suy luận và chi phí tính toán. Dưới đây là bảng so sánh trực tiếp giữa các biến thể YOLOv7 và YOLO11 được đánh giá trên các chuẩn benchmark của tập dữ liệu COCO.
| Mô hình | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Lưu ý: Tốc độ CPU bị thiếu đối với YOLOv7 cho thấy các môi trường thử nghiệm cũ không chuẩn hóa các bài kiểm chuẩn ONNX CPU. Các giá trị tốt nhất trong các cấp tương đương được đánh dấu.
Phân tích kết quả#
Dữ liệu minh họa một sự tiến hóa rõ rệt về hiệu suất. Mô hình YOLO11l (Large) đạt giá trị mAPval vượt trội là 53.4% so với mức 51.4% của YOLOv7l, trong khi sử dụng ít tham số hơn đáng kể (25.3M so với 36.9M) và ít FLOPs hơn rất nhiều (86.9B so với 104.7B). Việc giảm độ phức tạp tính toán này cho phép YOLO11 chạy nhanh hơn trên các thực thi NVIDIA TensorRT và yêu cầu ít VRAM hơn, giúp mô hình phù hợp hơn nhiều cho các môi trường bị giới hạn phần cứng.
Khả năng sử dụng và Quy trình huấn luyện#
Một điểm khác biệt lớn giữa hai khung này là trải nghiệm lập trình viên.
Huấn luyện YOLOv7#
Việc sử dụng mã nguồn mở YOLOv7 nguyên bản thường đòi hỏi phải clone kho lưu trữ, tự tay giải quyết các dependency và dựa vào các tham số dòng lệnh dài dòng. Việc quản lý các tác vụ khác nhau hoặc xuất sang các định dạng di động thường bao gồm việc chỉnh sửa các script nguồn hoặc dựa vào các nhánh mã nguồn của bên thứ ba.
Huấn luyện YOLO11#
YOLO11 được tích hợp sâu vào gói Python ultralytics, giúp đơn giản hóa vòng đời machine learning. Việc huấn luyện một mô hình phát hiện đối tượng chỉ mất vài dòng code, và framework xử lý nguyên bản các thao tác tải dữ liệu, tinh chỉnh siêu tham số và lưu cache.
from ultralytics import YOLO
# Load a pretrained YOLO11 Nano model for maximum speed
model = YOLO("yolo11n.pt")
# Train the model on the COCO8 example dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Export the trained model to ONNX format for deployment
export_path = model.export(format="onnx")Hơn nữa, YOLO11 sở hữu tính đa năng cực kỳ cao. Chỉ bằng cách thay đổi hậu tố của mô hình, các nhà phát triển có thể ngay lập tức chuyển đổi từ phát hiện sang ánh xạ phân đoạn thực thể, theo dõi ước lượng tư thế hoặc nhận diện hộp giới hạn xoay (OBB) — một mức độ hỗ trợ đa nhiệm nguyên bản mà YOLOv7 còn thiếu.
Việc xuất YOLO11 sang các định dạng biên như Apple CoreML hoặc các framework Intel OpenVINO chỉ yêu cầu một lệnh .export() duy nhất, tránh được việc can thiệp đồ thị phức tạp thường thấy ở các mô hình thế hệ cũ.
Các kịch bản triển khai lý tưởng#
Hiểu được thế mạnh của từng mô hình giúp xác định các trường hợp sử dụng tốt nhất của chúng.
- Tái tạo benchmark kế thừa: YOLOv7 vẫn hữu ích cho các nhà nghiên cứu học thuật cần tái tạo các benchmark cụ thể năm 2022 hoặc nghiên cứu ảnh hưởng của các kỹ thuật tái tham số hóa trên các mạng dựa trên mỏ neo.
- Môi trường sản xuất thương mại: YOLO11 là lựa chọn rõ ràng cho các hệ thống doanh nghiệp. Tính ổn định, việc bảo trì tích cực và khả năng tích hợp với giao diện Ultralytics Platform dựa trên đám mây giúp mô hình này trở nên lý tưởng để quản lý phân tích bán lẻ quy mô lớn, giám sát an ninh và kiểm soát chất lượng sản xuất.
- Điện toán biên giới hạn tài nguyên: Biến thể YOLO11n cực kỳ gọn nhẹ được thiết kế đặc biệt cho các thiết bị biên công suất thấp, chạy hiệu quả trên hệ thống Raspberry Pi hoặc các mô-đun NVIDIA Jetson.
Hướng tới tương lai: Sự chuyển dịch mô hình của YOLO26#
Trong khi YOLO11 đại diện cho một giải pháp hiện đại đã được tinh chỉnh cao, lĩnh vực máy học vẫn không ngừng tiến bộ. Đối với những người dùng bắt đầu các dự án thị giác hoàn toàn mới ngay hôm nay, việc khám phá Ultralytics YOLO26 mới được phát hành là điều rất được khuyến khích.
Được phát hành vào tháng 1 năm 2026, YOLO26 giới thiệu một số tính năng đột phá vượt xa cả YOLOv7 và YOLO11:
- Kiến trúc nguyên bản không NMS: YOLO26 loại bỏ nhu cầu xử lý hậu kỳ Non-Maximum Suppression. Thiết kế end-to-end này giúp đơn giản hóa các quy trình triển khai và giảm đáng kể sự thay đổi về độ trễ.
- Suy luận CPU nhanh hơn tới 43%: Bằng cách loại bỏ chiến lược mô-đun Distribution Focal Loss (DFL), YOLO26 được tối ưu hóa mạnh mẽ cho các thiết bị biên và môi trường không có GPU chuyên dụng.
- Tích hợp bộ tối ưu hóa MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM tiên tiến từ Moonshot AI, bộ tối ưu hóa lai này đảm bảo độ ổn định huấn luyện chưa từng có và tốc độ hội tụ nhanh hơn.
- Phát hiện vật thể nhỏ vượt trội: Việc giới thiệu các hàm mất mát ProgLoss và STAL mang lại sự gia tăng độ chính xác quan trọng để nhận diện các chi tiết nhỏ, hoàn hảo cho việc phân tích hình ảnh hàng không từ drone và dữ liệu cảm biến IoT phức tạp.
Đối với người dùng quan tâm đến các kiến trúc dựa trên Transformer hoặc các mô hình thay thế khác, tài liệu của Ultralytics cũng đề cập đến các mô hình như trình phát hiện Transformer RT-DETR và mô hình từ vựng mở YOLO-World.