YOLO11 và YOLOv7#
Lĩnh vực thị giác máy tính tiếp tục phát triển nhanh chóng, trong đó phát hiện đối tượng thời gian thực vẫn giữ vị trí hàng đầu trong các ứng dụng AI. Để chọn kiến trúc phù hợp cho dự án, cần cân nhắc sự đánh đổi phức tạp giữa tốc độ, độ chính xác và khả năng triển khai dễ dàng. Trong hướng dẫn này, chúng tôi so sánh toàn diện về mặt kỹ thuật hai kiến trúc nổi bật: Ultralytics YOLO11 và YOLOv7.
Tổng quan về model và chi tiết kỹ thuật#
Cả hai model đều có tác động đáng kể đến cộng đồng deep learning, nhưng chúng xuất phát từ những triết lý và giai đoạn phát triển khác nhau.
Thông tin YOLO11:
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: https://docs.ultralytics.com/models/yolo11
Chi tiết YOLOv7:
- Tác giả: Chien-Yao Wang, Alexey Bochkovskiy và Hong-Yuan Mark Liao
- Tổ chức: Viện Khoa học Thông tin, Academia Sinica, Đài Loan
- Ngày: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- Tài liệu: https://docs.ultralytics.com/models/yolov7
Khác biệt về kiến trúc#
Khi phân tích cơ chế bên trong, cả hai bộ phát hiện đều sử dụng các khái niệm tiên tiến, nhưng nền tảng cấu trúc của chúng khác nhau.
YOLOv7 giới thiệu khái niệm Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). Kiến trúc này được thiết kế để liên tục cải thiện khả năng học của mạng mà không làm mất đường gradient ban đầu, một đột phá quan trọng được trình bày trong bài báo nghiên cứu của nhóm. YOLOv7 phụ thuộc nhiều vào tái tham số hóa cấu trúc và phương pháp "bag-of-freebies" mạnh mẽ trong quá trình huấn luyện, cải thiện độ chính xác tổng thể trên bộ dữ liệu COCO mà không làm tăng chi phí suy luận.
Ngược lại, YOLO11 được xây dựng trên kiến trúc Ultralytics đã được tối ưu hóa cao. YOLO11 chú trọng pipeline trích xuất đặc trưng tinh gọn hơn với ít tham số hơn, giúp giảm mức sử dụng bộ nhớ trong quá trình huấn luyện. YOLO11 đạt được sự cân bằng hiệu năng rất thuận lợi, sử dụng ít tài nguyên tính toán hơn (FLOPs) nhưng vẫn ngang bằng hoặc vượt độ chính xác phát hiện của các model nặng hơn. Ngoài ra, YOLO11 hỗ trợ sẵn nhiều tác vụ hơn, trở thành lựa chọn linh hoạt cho các ứng dụng thị giác máy tính hiện đại.
Một trong những ưu điểm nổi bật của model Ultralytics YOLO là yêu cầu bộ nhớ khi huấn luyện thấp hơn so với các model tiên tiến khác, cho phép nhà phát triển huấn luyện mạng mạnh mẽ trên phần cứng PyTorch phổ thông.
So sánh hiệu năng và chỉ số#
Để đánh giá chính xác tính khả thi trong thực tế, cần xem xét các chỉ số như độ chính xác trung bình trung bình (mAP), tốc độ suy luận, số tham số của model và độ phức tạp tính toán (FLOPs). Bảng sau cho thấy các biến thể YOLO11 theo quy mô so sánh với những model YOLOv7 lớn hơn như thế nào.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Như có thể thấy, model như YOLO11x đạt 54.7 mAP cao hơn 53.1 mAP của YOLOv7x, đồng thời sử dụng ít tham số hơn đáng kể (56.9M so với 71.3M). Điều này cho thấy hiệu quả kiến trúc vượt trội của YOLO11.
Hiệu quả huấn luyện và tính tiện dụng của hệ sinh thái#
Một trong những điểm khác biệt rõ nét nhất giữa hai kiến trúc này là trải nghiệm dành cho nhà phát triển và hệ sinh thái đi kèm.
YOLOv7 về bản chất là một kho mã nghiên cứu học thuật. Việc huấn luyện model thường đòi hỏi thiết lập môi trường phức tạp, quản lý dependency thủ công và sử dụng các tham số dòng lệnh dài. Dù hỗ trợ thử nghiệm tiên tiến, việc điều chỉnh mã trong kho GitHub YOLOv7 cho môi trường production tùy chỉnh có thể tốn nhiều thời gian.
YOLO11 định nghĩa lại hoàn toàn sự dễ sử dụng. YOLO11 được tích hợp đầy đủ vào Ultralytics Platform, một hệ sinh thái toàn diện, được duy trì tốt và cung cấp quy trình làm việc đầu-cuối liền mạch. Từ gán nhãn dữ liệu, huấn luyện cục bộ đến triển khai, API Python thống nhất và giao diện dòng lệnh đơn giản giúp tối ưu toàn bộ quy trình.
So sánh mã#
Huấn luyện model phát hiện đối tượng bằng YOLO11 chỉ cần vài dòng mã, giúp giảm đáng kể rào cản bắt đầu:
from ultralytics import YOLO
# Tải model YOLO11 cỡ nhỏ đã được huấn luyện trước
model = YOLO("yolo11s.pt")
# Dễ dàng huấn luyện model bằng API thống nhất
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Nhanh chóng xuất sang định dạng ONNX
model.export(format="onnx")Ngược lại, lệnh huấn luyện YOLOv7 điển hình trông như sau và đòi hỏi thiết lập cẩn thận các đường dẫn, file cấu hình và script bash:
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'YOLO11 cũng có tính linh hoạt vượt trội. Trong khi YOLOv7 cần các codebase hoàn toàn khác hoặc sửa đổi lớn để hỗ trợ những tác vụ ngoài phát hiện (như ước tính tư thế hoặc phân đoạn), YOLO11 xử lý phát hiện đối tượng, phân đoạn đối tượng, phân loại ảnh, ước tính tư thế và phát hiện Bounding Box Định hướng (OBB) trong một framework thống nhất, liền mạch.
Ứng dụng thực tế và trường hợp sử dụng phù hợp#
Việc lựa chọn giữa YOLOv7 và YOLO11 hoàn toàn phụ thuộc vào phạm vi dự án và các ràng buộc triển khai.
Khi nào nên cân nhắc YOLOv7:
- Benchmark model cũ: Các nhà nghiên cứu học thuật tìm hiểu thiết kế đường gradient có thể dùng YOLOv7 làm baseline để đánh giá các mạng nơ-ron tích chập mới hơn.
- Pipeline tùy chỉnh hiện có: Các nhóm có pipeline C++ hoặc CUDA được tùy chỉnh sâu, xây dựng riêng cho logic giải mã bounding box đặc thù của YOLOv7.
Khi nào nên chọn YOLO11:
- Production thương mại: Các ứng dụng trong bán lẻ thông minh hoặc chẩn đoán y tế được hưởng lợi đáng kể từ codebase được duy trì tốt và độ ổn định cao của YOLO11.
- Môi trường hạn chế tài nguyên: Dấu chân nhẹ của YOLO11n khiến model đặc biệt phù hợp để triển khai trên thiết bị di động và thiết bị biên thông qua ONNX.
- Dự án đa nhiệm: Nếu một ứng dụng cần nhận diện một người, lập bản đồ bộ xương của người đó (tư thế) và phân đoạn vật thể người đó đang cầm, YOLO11 cung cấp giải pháp thống nhất.
Công nghệ tiên tiến nhất: Tiến bước cùng YOLO26#
Dù YOLO11 là lựa chọn rất đáng tin cậy, đổi mới trong trí tuệ nhân tạo không bao giờ dừng lại. Với các kỹ sư bắt đầu dự án mới hiện nay, chúng tôi đặc biệt khuyến nghị khám phá Ultralytics YOLO26.
Ra mắt vào tháng 1 năm 2026, YOLO26 giới thiệu Thiết kế đầu-cuối không cần NMS (nms=False), loại bỏ các nút thắt độ trễ liên quan đến bước hậu xử lý Non-Maximum Suppression. Ngoài ra, YOLO26 tích hợp Bộ tối ưu MuSGD mang tính đột phá, lấy cảm hứng từ phương pháp huấn luyện LLM để đảm bảo hội tụ nhanh hơn. Với các cải tiến loss có mục tiêu thông qua ProgLoss + STAL và tốc độ suy luận CPU nhanh hơn đến 43% nhờ loại bỏ DFL, YOLO26 được tối ưu chuyên biệt cho điện toán biên và đại diện cho đỉnh cao hiện tại của AI thị giác.
Những người dùng quan tâm đến cấu trúc thay thế chuyên biệt cũng có thể khám phá model RT-DETR dựa trên Transformer hoặc model YOLO-World có từ vựng mở linh hoạt, để đạt kết quả tốt hơn trong nhiều môi trường triển khai thị giác máy tính.