YOLO11 và RTDETRv2#
Lĩnh vực thị giác máy tính đã mở rộng nhanh chóng, mang đến cho developer vô số lựa chọn để xây dựng ứng dụng dựa trên thị giác mạnh mẽ. Trong lĩnh vực phát hiện vật thể thời gian thực, cuộc tranh luận giữa Mạng nơ-ron tích chập (CNN) và Vision Transformer (ViT) ngày càng nổi bật. Phần so sánh kỹ thuật này đi sâu vào hai kiến trúc hàng đầu: YOLO11, đại diện cho đỉnh cao của các framework CNN được tối ưu hóa cao, và RTDETRv2, phiên bản cải tiến mạnh mẽ thuộc họ Detection Transformer.
Bằng cách phân tích kiến trúc, chỉ số hiệu năng và tình huống triển khai lý tưởng, hướng dẫn này nhằm giúp kỹ sư machine learning đưa ra quyết định sáng suốt. Dù cả hai model đều mở rộng giới hạn về độ chính xác, các model Ultralytics YOLO thường mang lại sự cân bằng tốt hơn về tốc độ, hỗ trợ hệ sinh thái và tính dễ sử dụng trong môi trường sản xuất thực tế.
YOLO11: Chuẩn mực về tính linh hoạt trong thực tế#
Do Ultralytics giới thiệu, YOLO11 kế thừa nhiều năm nghiên cứu nền tảng để tạo ra một model nhanh, chính xác và cực kỳ linh hoạt. Model được thiết kế để xử lý liền mạch phát hiện vật thể, phân đoạn instance, phân loại ảnh, ước lượng tư thế và trích xuất hộp giới hạn định hướng (OBB) ngay từ đầu.
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2024-09-27
- GitHub: Kho lưu trữ Ultralytics
- Tài liệu: Tài liệu YOLO11
Kiến trúc và ưu điểm#
YOLO11 có backbone CNN được tinh chỉnh và các kim tự tháp đặc trưng không gian tiên tiến, giúp model sử dụng tài nguyên đặc biệt hiệu quả. Model hoạt động tốt trong môi trường có giới hạn phần cứng nghiêm ngặt, với mức sử dụng bộ nhớ tối thiểu trong cả huấn luyện lẫn suy luận. Ultralytics Platform hỗ trợ YOLO11 nguyên bản, cho phép tinh gọn việc giám sát model, gắn nhãn dữ liệu và huấn luyện trên đám mây mà không cần ghép nối các công cụ MLOps rời rạc.
Dành cho developer nhắm đến điện toán biên, YOLO11 có độ trễ cực thấp. Thiết kế gọn nhẹ giúp model chạy hiệu quả trên nhiều loại thiết bị, từ Raspberry Pi đến điện thoại di động phổ thông, khiến model trở thành lựa chọn tiêu chuẩn cho bán lẻ thông minh, kiểm soát chất lượng trong sản xuất và quản lý giao thông tự động.
RTDETRv2: Transformer thời gian thực của Baidu#
RTDETRv2 (Detection Transformer thời gian thực phiên bản 2) thể hiện nỗ lực của Baidu nhằm đưa kiến trúc dựa trên Transformer vào các tác vụ thời gian thực. Model kế thừa RT-DETR ban đầu và tích hợp phương pháp "bag-of-freebies" để cải thiện độ chính xác baseline mà không làm tăng độ trễ suy luận.
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Kho lưu trữ RTDETRv2
- Tài liệu: README của RTDETRv2
Kiến trúc và ưu điểm#
Khác với CNN truyền thống, RTDETRv2 sử dụng kiến trúc encoder-decoder với cơ chế self-attention, cho phép nắm bắt ngữ cảnh toàn cục trên toàn ảnh. Điều này đặc biệt hữu ích trong các cảnh đông đúc, nơi hiện tượng che khuất thường xuyên xảy ra. RTDETRv2 loại bỏ nhu cầu dùng Non-Maximum Suppression (NMS) trong hậu xử lý, thay vào đó dựa vào phép ghép cặp Hungarian trong quá trình huấn luyện để thực hiện ghép cặp hai phía một-một.
Tuy nhiên, model Transformer nổi tiếng là tiêu tốn nhiều VRAM và bộ nhớ CUDA. Việc huấn luyện RTDETRv2 từ đầu hoặc fine-tune trên dataset tùy chỉnh thường đòi hỏi các cụm GPU cao cấp với tài nguyên đáng kể, có thể là rào cản với các nhóm nhỏ, linh hoạt so với mức sử dụng tài nguyên huấn luyện thấp của model Ultralytics.
Phân tích hiệu năng và chỉ số#
Khi đánh giá các model này trên dataset COCO tiêu chuẩn, ta nhận thấy sự đánh đổi rõ rệt giữa số lượng tham số, FLOPs và độ chính xác thuần.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Phân tích kết quả#
Như thể hiện trong bảng, YOLO11 có tỷ lệ hiệu năng trên kích thước rất ấn tượng. YOLO11x đạt mAPval cao hơn (54.7) so với RTDETRv2-x (54.3), đồng thời sử dụng ít tham số hơn đáng kể (56.9M so với 76M) và ít FLOPs tính toán hơn rất nhiều (195.3B so với 259B).
Ngoài ra, tốc độ suy luận của YOLO11 trên TensorRT T4 đặc biệt nhanh. YOLO11s hoàn tất suy luận chỉ trong 2.5ms, trong khi RTDETRv2-s nhỏ nhất cần 5.03ms. Nhờ đó, YOLO11 là lựa chọn hàng đầu cho các luồng phân tích video thời gian thực tốc độ cao, nơi thời gian xử lý mỗi khung hình là nút thắt chính.
Dù RTDETRv2 đạt độ chính xác cao nhờ các lớp attention, những cơ chế này có độ phức tạp tăng theo bình phương độ phân giải ảnh, dẫn đến mức tiêu thụ VRAM cao hơn trong cả huấn luyện lẫn suy luận. YOLO11 tránh được vấn đề này bằng các khối tích chập cực kỳ hiệu quả.
Hệ sinh thái huấn luyện và tính dễ sử dụng#
Ưu điểm cốt lõi của việc sử dụng model Ultralytics nằm ở hệ sinh thái đi kèm. Việc huấn luyện RTDETRv2 thường đòi hỏi phải xử lý các kho mã phức tạp theo chuẩn nghiên cứu, điều chỉnh trọng số loss ghép cặp hai phía phức tạp và quản lý mức sử dụng bộ nhớ đáng kể.
Ngược lại, Ultralytics chú trọng nhiều đến trải nghiệm developer. Python API hợp nhất loại bỏ phần lớn mã boilerplate, tích hợp liền mạch với các công cụ như Weights & Biases để theo dõi thí nghiệm và tự động xử lý các phép tăng cường dữ liệu.
Sau đây là cách đơn giản để huấn luyện và xuất model bằng package ultralytics:
from ultralytics import YOLO
# Khởi tạo model YOLO11 với trọng số được huấn luyện trước
model = YOLO("yolo11n.pt")
# Huấn luyện model hiệu quả trên GPU cục bộ hoặc instance đám mây
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Sử dụng GPU CUDA
)
# Xuất model đã huấn luyện sang ONNX để triển khai rộng rãi
export_path = model.export(format="onnx")Sau khi huấn luyện, việc xuất model YOLO11 sang các định dạng như ONNX, OpenVINO hoặc CoreML chỉ cần một lệnh duy nhất, đảm bảo pipeline thị giác của bạn có thể dễ dàng mở rộng trên nhiều backend phần cứng khác nhau.
Lưu ý rằng RTDETRv2 chỉ tập trung vào phát hiện hộp giới hạn, trong khi kiến trúc YOLO11 hỗ trợ sẵn phân đoạn instance và ước lượng tư thế, cho phép bạn hợp nhất nhiều tác vụ thị giác vào một họ model duy nhất.
Trường hợp sử dụng và khuyến nghị#
Việc chọn YOLO11 hay RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, giới hạn triển khai và lựa chọn hệ sinh thái của bạn.
Khi nào nên chọn YOLO11#
YOLO11 là lựa chọn phù hợp cho:
- Triển khai biên trong môi trường production: Các ứng dụng thương mại trên thiết bị như Raspberry Pi hoặc NVIDIA Jetson, nơi độ tin cậy và hoạt động bảo trì liên tục là ưu tiên hàng đầu.
- Ứng dụng thị giác đa nhiệm: Các dự án cần phát hiện, phân đoạn, ước tính tư thế và OBB trong một framework thống nhất.
- Tạo mẫu và triển khai nhanh: Các nhóm cần nhanh chóng chuyển từ thu thập dữ liệu sang production bằng Ultralytics Python API tinh gọn.
Khi nào nên chọn RT-DETR#
RT-DETR được khuyến nghị cho:
- Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
- Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
- Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Nhìn về phía trước: Sức mạnh của YOLO26#
Dù YOLO11 là lựa chọn xuất sắc cho môi trường sản xuất, các nhóm muốn sử dụng công nghệ tiên tiến nhất nên cân nhắc nghiêm túc YOLO26. Ra mắt vào tháng 1 năm 2026, YOLO26 thu hẹp khoảng cách kiến trúc bằng cách tích hợp trực tiếp vào lõi một head end-to-end không cần NMS tùy chọn (nms=False, lần đầu được tiên phong trong YOLOv10), loại bỏ độ trễ hậu xử lý NMS và sự phức tạp trong logic triển khai.
YOLO26 còn giới thiệu một số tính năng mang tính cách mạng:
- Optimizer MuSGD: Lấy cảm hứng từ kỹ thuật huấn luyện LLM của Kimi K2 thuộc Moonshot AI, phương pháp lai giữa SGD và Muon này đảm bảo quá trình huấn luyện cực kỳ ổn định và hội tụ nhanh hơn đáng kể.
- Loại bỏ DFL: Distribution Focal Loss đã được loại bỏ để quy trình xuất model gọn và đơn giản hơn, đồng thời cải thiện đáng kể khả năng tương thích với thiết bị biên công suất thấp.
- ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yêu cầu quan trọng đối với giám sát bằng drone, giám sát nông nghiệp và cảm biến biên IoT.
- Suy luận trên CPU nhanh hơn tới 43%: Với các triển khai không có GPU chuyên dụng, YOLO26 được tối ưu hóa riêng cho CPU và vượt trội đáng kể so với các thế hệ trước.
Đối với những ai muốn tìm hiểu nhiều kiến trúc hơn, tài liệu Ultralytics cũng cung cấp thông tin về YOLOv8, YOLOv5 được sử dụng rộng rãi và các model chuyên biệt như YOLO-World dành cho ứng dụng phát hiện với bộ từ vựng mở. Dù ưu tiên độ ổn định đã được kiểm chứng của YOLO11 hay các đổi mới đột phá của YOLO26, hệ sinh thái Ultralytics đều cung cấp các công cụ vượt trội để hiện thực hóa giải pháp thị giác máy tính của bạn.