YOLO11 so với YOLOv10#
Lĩnh vực thị giác máy tính thời gian thực không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn của những gì có thể thực hiện trên cả thiết bị edge lẫn hạ tầng cloud. Trong phân tích kỹ thuật chi tiết này, chúng tôi tìm hiểu những điểm khác biệt giữa hai model tiêu biểu trong lĩnh vực: Ultralytics YOLO11 và YOLOv10. Cả hai đều tạo ra bước tiến đáng kể trong khả năng phát hiện đối tượng, nhưng áp dụng những triết lý kiến trúc khác biệt căn bản để đạt được hiệu năng.
Tìm hiểu kiến trúc YOLO11#
Thông tin YOLO11:
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Tài liệu: https://docs.ultralytics.com/models/yolo11
Được giới thiệu như một model đa năng mạnh mẽ, YOLO11 kế thừa nhiều năm nghiên cứu nền tảng về thị giác máy tính và AI. Triết lý thiết kế cốt lõi của YOLO11 xoay quanh sự phong phú về đặc trưng và tính linh hoạt vượt trội trên nhiều tác vụ thị giác máy tính.
Một trong những cải tiến nổi bật của YOLO11 là triển khai khối C3k2. Module nút thắt cổ chai được tinh chỉnh này tối ưu luồng gradient trên toàn mạng, cải thiện đáng kể hiệu quả sử dụng tham số mà vẫn duy trì độ chính xác cao. Ngoài ra, YOLO11 sử dụng cơ chế chú ý không gian được cải tiến, rất quan trọng để nhận diện các đối tượng nhỏ hoặc bị che khuất một phần. Nhờ đó, YOLO11 là lựa chọn xuất sắc cho các trường hợp sử dụng ảnh hàng không và phân tích ảnh y tế chi tiết.
YOLO11 sử dụng thiết kế không anchor, giúp giảm độ phức tạp khi tinh chỉnh siêu tham số và cho phép khái quát hóa mạnh mẽ trên nhiều bộ dữ liệu tùy chỉnh. Ngoài ra, yêu cầu bộ nhớ trong quá trình huấn luyện thấp hơn đáng kể so với các kiến trúc dựa trên Transformer, cho phép nhà nghiên cứu huấn luyện model lớn hiệu quả trên phần cứng phổ thông.
Tìm hiểu kiến trúc YOLOv10#
Thông tin về YOLOv10:
- Tác giả: Ao Wang, Hui Chen, Lihao Liu và cộng sự
- Tổ chức: Đại học Thanh Hoa
- Ngày: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- Tài liệu: https://docs.ultralytics.com/models/yolov10
Được phát triển bởi các nhà nghiên cứu tại Đại học Thanh Hoa, YOLOv10 đã tạo dấu ấn với vai trò tiên phong trong dòng YOLO theo hướng end-to-end. Điểm nổi bật của YOLOv10 là phương pháp Huấn luyện không cần NMS. Bằng cách sử dụng cơ chế gán kép nhất quán trong giai đoạn huấn luyện, model tự nhiên dự đoán chính xác một bounding box cho mỗi đối tượng. Đột phá này loại bỏ hoàn toàn nhu cầu dùng Non-Maximum Suppression (NMS) trong quá trình inference — một bước hậu xử lý vốn thường gây ra nút thắt độ trễ trong các pipeline triển khai.
Kiến trúc này cũng đưa ra chiến lược thiết kế toàn diện nhằm cân bằng hiệu quả và độ chính xác. Kiến trúc kết hợp phương pháp downsampling tách biệt không gian-kênh và các thiết kế block có định hướng theo thứ hạng để giảm có chọn lọc sự dư thừa trong các giai đoạn của mạng. Nhờ đó, số lượng FLOPs và chi phí tính toán giảm xuống mà không làm suy giảm đáng kể độ chính xác trung bình (mAP). Với các ứng dụng thời gian thực, nơi mỗi mili giây đều quan trọng, việc loại bỏ NMS tạo ra đồ thị inference tất định, rất phù hợp với thiết bị AI biên.
Chỉ số hiệu năng và benchmark#
Khi đánh giá hai model này, chúng ta xem xét sự cân bằng giữa độ chính xác, số lượng tham số và tốc độ. Bảng sau so sánh hai model ở nhiều kích thước khác nhau trên dataset COCO.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
Như thể hiện trong các chỉ số hiệu năng YOLO, YOLO11 đạt điểm mAP cao hơn một chút ở tất cả các biến thể. Thiết kế không cần NMS của YOLOv10 đảm bảo thời gian inference end-to-end rất ổn định, nhưng YOLO11 vẫn đạt thông lượng vượt trội khi được tối ưu bằng TensorRT trên phần cứng NVIDIA.
Khi chuẩn bị model để triển khai, việc xuất sang các định dạng đã tối ưu là rất quan trọng. Có thể dễ dàng xuất cả YOLO11 và YOLOv10 sang các định dạng như ONNX và TensorRT bằng framework Ultralytics. Xem hướng dẫn về các tùy chọn triển khai model để biết các bước thực hiện chi tiết.
Lợi thế của hệ sinh thái Ultralytics#
Mặc dù các chỉ số hiệu năng độc lập rất quan trọng, framework xung quanh mới quyết định thành công thực tế của một dự án machine learning. Đây chính là điểm giúp YOLO11, với tư cách là thành phần gốc trong hệ sinh thái Ultralytics, thực sự nổi bật.
Nền tảng Ultralytics mang đến trải nghiệm người dùng cực kỳ tinh gọn. Với Python API đơn giản và thống nhất, nhà phát triển có thể xử lý các tác vụ vượt xa việc tạo hộp giới hạn cơ bản. YOLO11 hỗ trợ sẵn phân đoạn đối tượng, ước tính tư thế, phân loại ảnh và phát hiện hộp bao định hướng (OBB) ngay khi sử dụng. Mức độ linh hoạt vượt trội này thường thiếu trong các kho nghiên cứu chuyên biệt.
Ngoài ra, hệ sinh thái còn được hỗ trợ bởi tài liệu phong phú và cộng đồng tích cực. Các tích hợp với công cụ như Weights & Biases để theo dõi thí nghiệm và OpenVINO để tối ưu hóa phần cứng Intel được tích hợp trực tiếp vào thư viện. Việc huấn luyện model chỉ cần rất ít mã boilerplate và tận dụng quy trình huấn luyện hiệu quả cao, tiêu thụ ít bộ nhớ CUDA hơn các model Transformer cồng kềnh như RT-DETR.
Ví dụ code thực hành#
Ultralytics được thiết kế để giúp việc huấn luyện và chạy inference trực quan nhất có thể. Cùng một API xử lý dễ dàng cả YOLO11 lẫn YOLOv10.
from ultralytics import YOLO
# Khởi tạo model (YOLO11n hoặc YOLOv10n)
model = YOLO("yolo11n.pt")
# Huấn luyện model hiệu quả trên dataset tùy chỉnh
# Ultralytics tự động xử lý hyperparameter và tối ưu hóa bộ nhớ
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Chạy suy luận trên một ảnh
inference_results = model("https://ultralytics.com/images/bus.jpg")
# Hiển thị các đối tượng được phát hiện
inference_results[0].show()Trường hợp sử dụng và khuyến nghị#
Việc chọn YOLO11 hay YOLOv10 tùy thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và lựa chọn hệ sinh thái của bạn.
Khi nào nên chọn YOLO11#
YOLO11 là lựa chọn phù hợp cho:
- Triển khai biên trong môi trường production: Các ứng dụng thương mại trên thiết bị như Raspberry Pi hoặc NVIDIA Jetson, nơi độ tin cậy và hoạt động bảo trì liên tục là ưu tiên hàng đầu.
- Ứng dụng thị giác đa nhiệm: Các dự án cần phát hiện, phân đoạn, ước tính tư thế và OBB trong một framework thống nhất.
- Tạo mẫu và triển khai nhanh: Các nhóm cần nhanh chóng chuyển từ thu thập dữ liệu sang production bằng Ultralytics Python API tinh gọn.
Khi nào nên chọn YOLOv10#
YOLOv10 được khuyến nghị cho:
- Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện end-to-end không cần Non-Maximum Suppression, giúp giảm độ phức tạp khi triển khai.
- Cân bằng giữa tốc độ và độ chính xác: Các dự án cần sự cân bằng tốt giữa tốc độ inference và độ chính xác phát hiện trên nhiều quy mô model.
- Ứng dụng cần độ trễ ổn định: Các tình huống triển khai yêu cầu thời gian inference có thể dự đoán, chẳng hạn như robotics hoặc hệ thống tự hành.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Thế hệ tiếp theo: YOLO26#
YOLOv10 mở ra mô hình không cần NMS mang tính đột phá, còn YOLO11 hoàn thiện tính linh hoạt đa nhiệm; tuy nhiên, lĩnh vực AI phát triển rất nhanh. Với các nhà phát triển đang bắt đầu triển khai production mới hiện nay, chúng tôi đặc biệt khuyến nghị tìm hiểu Ultralytics YOLO26.
Ra mắt vào tháng 1 năm 2026, YOLO26 kết hợp ưu điểm của cả hai thế hệ. Model cung cấp Thiết kế end-to-end không cần NMS tiên phong trên YOLOv10 dưới dạng head one-to-one tùy chọn (nms=False), giúp đơn giản hóa đáng kể pipeline triển khai và đảm bảo độ trễ nhất quán. Ngoài ra, YOLO26 tích hợp các tối ưu hóa chuyên biệt cho điện toán biên. Bằng cách thực hiện Loại bỏ DFL (loại bỏ Distribution Focal Loss), kiến trúc đảm bảo khả năng xuất model dễ dàng hơn và đạt inference CPU nhanh hơn tới 43% so với các model thế hệ cũ, trở thành lựa chọn hàng đầu cho thiết bị IoT công suất thấp và ứng dụng di động.
YOLO26 cũng đưa độ ổn định khi huấn luyện Large Language Model (LLM) vào thị giác máy tính thông qua MuSGD Optimizer sáng tạo, một phương pháp lai lấy cảm hứng từ nghiên cứu AI tiên tiến. Kết hợp với các hàm loss ProgLoss + STAL, YOLO26 mang lại độ chính xác vượt trội trên các đối tượng nhỏ, yếu tố thiết yếu cho phát hiện giao thông qua video chi tiết và tự động hóa robot phức tạp.
Kết luận#
Việc chọn model thị giác phù hợp tùy thuộc vào các ràng buộc vận hành cụ thể. YOLOv10 là một cột mốc quan trọng trong giới học thuật, chứng minh rằng có thể loại bỏ hiệu quả NMS khỏi pipeline phát hiện. Tuy nhiên, để có được sự cân bằng vượt trội giữa hiệu năng, tính linh hoạt toàn diện về tác vụ và công cụ triển khai liền mạch, YOLO11 là giải pháp mạnh mẽ, sẵn sàng cho doanh nghiệp.
Với các kỹ sư muốn sử dụng công nghệ tiên tiến nhất — kết hợp sự đơn giản của end-to-end với hiệu năng biên cực nhanh — lựa chọn tối ưu là chuyển sang phiên bản mới nhất YOLO26. Tận dụng Nền tảng Ultralytics toàn diện giúp đảm bảo dự án của bạn được xây dựng trên nền tảng được bảo trì tốt, hiệu quả cao và sẵn sàng cho tương lai.