YOLOv10 và RTDETRv2#
Lĩnh vực computer vision phát triển với tốc độ chóng mặt, các kiến trúc mới liên tục định nghĩa lại công nghệ tiên tiến nhất trong object detection thời gian thực. Hai cột mốc quan trọng trong quá trình phát triển này là YOLOv10 và RTDETRv2. Cả hai model đều hướng đến giải quyết nút thắt cơ bản trong các pipeline detection truyền thống bằng cách loại bỏ nhu cầu hậu xử lý Non-Maximum Suppression (NMS), nhưng tiếp cận thách thức này theo những mô hình kiến trúc hoàn toàn khác nhau.
Phần so sánh kỹ thuật này phân tích chuyên sâu về kiến trúc, phương pháp huấn luyện và các kịch bản triển khai lý tưởng của chúng, giúp các nhà phát triển và nhà nghiên cứu chọn công cụ phù hợp cho dự án AI thị giác tiếp theo.
YOLOv10: Tiên phong không cần NMS#
Được phát triển bởi các nhà nghiên cứu tại Đại học Thanh Hoa, YOLOv10 tập trung mạnh vào hiệu quả kiến trúc và loại bỏ các nút thắt hậu xử lý. Bằng cách đưa vào phương pháp gán kép nhất quán để huấn luyện không cần NMS, model đạt hiệu năng cạnh tranh đồng thời giảm đáng kể độ trễ suy luận.
Thông số kỹ thuật#
- Tác giả: Ao Wang, Hui Chen, Lihao Liu và cộng sự
- Tổ chức: Đại học Thanh Hoa
- Ngày: 2024-05-23
- ArXiv: Bài báo YOLOv10
- GitHub: THU-MIG/yolov10
- Tài liệu: Tài liệu YOLOv10
Kiến trúc và phương pháp#
Đột phá cốt lõi của YOLOv10 là thiết kế model toàn diện hướng đến hiệu quả và độ chính xác. Model tối ưu nhiều thành phần theo cả hai khía cạnh, giảm đáng kể chi phí tính toán. Chiến lược gán kép nhất quán cho phép model huấn luyện mà không cần dựa vào NMS, từ đó tạo ra pipeline triển khai end-to-end tinh gọn. Điều này đặc biệt hữu ích khi export model sang các định dạng edge như ONNX hoặc TensorRT, nơi các thao tác hậu xử lý có thể gây ra độ trễ ngoài dự kiến.
Ưu điểm và nhược điểm#
Model có sự cân bằng tốc độ và độ chính xác vượt trội, đặc biệt ở các biến thể nhỏ hơn (N và S). Độ trễ tối thiểu giúp model trở nên lý tưởng cho các môi trường edge tốc độ cao. Tuy nhiên, dù YOLOv10 nổi bật về tốc độ detection thuần túy, model vẫn chỉ chuyên biệt cho detection. Các nhóm cần phân đoạn đối tượng hoặc ước lượng tư thế sẽ cần tìm đến các framework linh hoạt hơn.
RTDETRv2: Hoàn thiện Detection Transformer#
Dựa trên Real-Time Detection Transformer ban đầu, RTDETRv2 bổ sung một "bộ mẹo miễn phí" để cải thiện phiên bản nền, cho thấy Transformer có thể cạnh tranh với CNN trong các kịch bản thời gian thực.
Thông số kỹ thuật#
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- ArXiv: Bài báo RTDETRv2
- GitHub: lyuwenyu/RT-DETR
- Tài liệu: README của RTDETRv2
Kiến trúc và phương pháp#
RTDETRv2 sử dụng kiến trúc hybrid, kết hợp backbone Mạng nơ-ron tích chập (CNN) để trích xuất đặc trưng hình ảnh với encoder-decoder Transformer nhằm hiểu toàn diện cảnh vật. Cơ chế self-attention của Transformer cho phép model quan sát toàn cục hình ảnh, giúp model xử lý hiệu quả các cảnh phức tạp, đối tượng chồng lấp và đám đông dày đặc.
Ưu điểm và nhược điểm#
Kiến trúc Transformer mang lại độ chính xác vượt trội, đặc biệt ở các quy mô tham số lớn, đồng thời xuất trực tiếp các detection cuối cùng mà không cần NMS. Tuy nhiên, điều này đi kèm với một cái giá. Theo truyền thống, các model Transformer cần nhiều CUDA memory hơn đáng kể trong quá trình training và có thể hội tụ chậm hơn so với các kiến trúc CNN thuần. Mặc dù RTDETRv2 đã cải thiện tốc độ inference, model này thường tiêu thụ nhiều memory hơn các biến thể YOLO gọn nhẹ.
So sánh hiệu năng#
Đánh giá các chỉ số hiệu năng giúp làm rõ hơn điểm mạnh của từng model. Bảng sau đây nêu bật các khả năng của chúng trên bộ dữ liệu COCO:
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Khi phân tích dữ liệu, YOLOv10 duy trì lợi thế rõ rệt về hiệu quả tham số và tốc độ inference TensorRT ở các kích thước tương đương. RTDETRv2-x đạt độ chính xác ngang bằng YOLOv10x nhưng cần số tham số nhiều hơn 2.5 lần (76M so với 29.5M) và FLOPs cao hơn đáng kể.
Trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLOv10 và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và hệ sinh thái bạn ưu tiên.
Khi nào nên chọn YOLOv10#
YOLOv10 là lựa chọn phù hợp cho:
- Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện end-to-end không cần Non-Maximum Suppression, giúp giảm độ phức tạp khi triển khai.
- Cân bằng giữa tốc độ và độ chính xác: Các dự án cần sự cân bằng tốt giữa tốc độ inference và độ chính xác phát hiện trên nhiều quy mô model.
- Ứng dụng cần độ trễ ổn định: Các tình huống triển khai yêu cầu thời gian inference có thể dự đoán, chẳng hạn như robotics hoặc hệ thống tự hành.
Khi nào nên chọn RT-DETR#
RT-DETR được khuyến nghị cho:
- Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
- Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
- Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.
Khi nào nên chọn Ultralytics (YOLO26)#
Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:
- Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
- Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
- Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.
Lợi thế của Ultralytics: Hệ sinh thái và đổi mới#
Mặc dù YOLOv10 và RTDETRv2 cung cấp khả năng detection mạnh mẽ, việc chọn model thường còn phụ thuộc vào hệ sinh thái phần mềm xung quanh. Ultralytics Platform cung cấp giao diện thống nhất, liền mạch, giúp trừu tượng hóa sự phức tạp của deep learning.
Tiêu chuẩn mới: Ultralytics YOLO26#
Đối với các developer muốn đạt hiệu năng tốt nhất, Ultralytics YOLO26 hội tụ những tiến bộ kiến trúc gần đây. Ra mắt vào đầu năm 2026, YOLO26 kế thừa Thiết kế end-to-end không cần NMS do YOLOv10 tiên phong dưới dạng một head tùy chọn (nms=False), loại bỏ bước hậu xử lý NMS để triển khai nhanh hơn và đơn giản hơn.
YOLO26 đưa các cải tiến trong training LLM vào thị giác máy tính thông qua Optimizer MuSGD (kết hợp giữa SGD và Muon), giúp training ổn định hơn và hội tụ nhanh hơn. Model này cũng đạt inference CPU nhanh hơn tới 43%, trở thành lựa chọn hàng đầu cho điện toán biên.
Ngoài ra, YOLO26 giới thiệu ProgLoss + STAL để cải thiện đáng kể khả năng nhận diện vật thể nhỏ; khác với YOLOv10 chuyên biệt, model này có tính linh hoạt vượt trội. Model hỗ trợ trực tiếp detection vật thể, phân đoạn, pose và bounding box định hướng (OBB), cùng các cải tiến theo từng tác vụ như loss phân đoạn ngữ nghĩa và Ước lượng Khả năng xảy ra Log-Hợp phần dư (RLE) cho pose. Ngoài ra, việc loại bỏ Distribution Focal Loss (DFL) giúp đơn giản hóa quá trình export và tăng khả năng tương thích với thiết bị công suất thấp.
Tính dễ sử dụng và hiệu quả huấn luyện#
Dù bạn đang thử nghiệm các model thế hệ trước như Ultralytics YOLO11 hay YOLO26 tiên tiến nhất, Python API được tinh gọn giúp giảm mức sử dụng memory khi training và tăng tốc đáng kể quy trình làm việc.
from ultralytics import RTDETR, YOLO
# Training model YOLOv10 end-to-end
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Hoặc đánh giá RTDETR trong cùng API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")Hệ sinh thái được duy trì tốt cung cấp các công cụ để tinh chỉnh hyperparameter dễ dàng, đồng thời tích hợp liền mạch với các giải pháp tracking toàn diện và tùy chọn triển khai model.
Kết luận#
YOLOv10 và RTDETRv2 đều là những cột mốc nổi bật trong nỗ lực phát triển detection vật thể không cần NMS. RTDETRv2 chứng minh rằng Transformer có thể đạt độ trễ thời gian thực với khả năng nắm bắt ngữ cảnh toàn cục vượt trội, dù cần nhiều memory hơn. YOLOv10 cung cấp một giải pháp CNN thay thế hiệu quả cao, nhanh chóng và được thiết kế cho các tác vụ detection bị giới hạn tài nguyên.
Tuy nhiên, để đạt hiệu năng cân bằng, tính linh hoạt đa tác vụ và tận dụng hệ sinh thái hoàn thiện nhất, các developer được khuyến khích sử dụng Ultralytics YOLO26. Model này kết hợp khéo léo các đổi mới kiến trúc từ những thế hệ trước với bộ công cụ mạnh mẽ, dễ dùng, giúp việc triển khai AI thị giác trở nên liền mạch.