YOLO Vision 2026:

RTDETRv2 so với YOLOv7#

Bối cảnh của computer vision đã mở rộng đáng kể trong vài năm qua, được thúc đẩy bởi những đổi mới liên tục trong cả Convolutional Neural Networks (CNNs) và Vision Transformers (ViTs). Việc lựa chọn kiến trúc phù hợp cho quá trình triển khai đòi hỏi sự hiểu biết về những đánh đổi tinh tế giữa tốc độ, độ chính xác và chi phí tính toán. Hướng dẫn này khám phá sự khác biệt kỹ thuật giữa hai kiến trúc được đánh giá cao: RTDETRv2 và YOLOv7, đồng thời làm nổi bật các cải tiến hiện đại có sẵn trong YOLO26 mới của Ultralytics.

RTDETRv2: Cách tiếp cận Transformer cho phát hiện thời gian thực#

RTDETRv2 (Real-Time Detection Transformer phiên bản 2) xây dựng dựa trên nền tảng của phiên bản tiền nhiệm để chứng minh rằng các kiến trúc dựa trên Transformer có thể cạnh tranh hiệu quả trong các tình huống thời gian thực mà không cần dựa vào các bước hậu xử lý truyền thống.

Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, và Yi Liu
Tổ chức: Baidu Ngày: 2024-07-24 Arxiv: https://arxiv.org/abs/2407.17140
GitHub: RTDETRv2 Repository

Điểm nổi bật về kiến trúc#

RTDETRv2 sử dụng bộ mã hóa kết hợp (hybrid encoder) và kiến trúc transformer decoder. Bằng cách tận dụng cơ chế tự chú ý (self-attention), model xử lý toàn bộ hình ảnh một cách tổng thể, cho phép model hiểu các mối quan hệ không gian phức tạp tốt hơn so với các kernel tích chập vốn bị giới hạn cục bộ. Một trong những đặc điểm nổi bật nhất của RTDETRv2 là thiết kế hoàn toàn không dùng NMS (NMS-free). Bằng cách loại bỏ Non-Maximum Suppression (NMS), RTDETRv2 đã khắc phục được một điểm nghẽn phổ biến gây ra độ trễ suy luận biến đổi (inference latency) trong quá trình triển khai.

Điểm mạnh và hạn chế#

Thế mạnh chính của RTDETRv2 nằm ở khả năng xử lý các vật thể dày đặc, chồng chéo trong các cảnh phức tạp. Bối cảnh toàn cục được cung cấp bởi các lớp attention của Transformer giúp nó đạt độ chính xác cao, đặc biệt là trong các tình huống thường xuyên xảy ra tình trạng che khuất.

Tuy nhiên, điều này đi kèm với chi phí tính toán. Các model Transformer theo truyền thống đòi hỏi dung lượng bộ nhớ lớn hơn trong quá trình huấn luyện và suy luận so với các CNN. Hơn nữa, RTDETRv2 thường cần nhiều epoch hơn để hội tụ trong quá trình distributed training, dẫn đến vòng lặp lặp lại kéo dài hơn cho các developer khi tinh chỉnh các tập dữ liệu tùy chỉnh.

Tìm hiểu thêm về RTDETRv2

YOLOv7: Baseline CNN cho tốc độ#

Ra mắt một năm trước RTDETRv2, YOLOv7 đã giới thiệu một số tối ưu hóa cấu trúc cho framework YOLO cổ điển, thiết lập một benchmark mạnh mẽ cho các bộ phát hiện thời gian thực dựa trên CNN tại thời điểm xuất bản.

Tác giả: Chien-Yao Wang, Alexey Bochkovskiy, và Hong-Yuan Mark Liao
Tổ chức: Institute of Information Science, Academia Sinica, Taiwan
Ngày: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: YOLOv7 Repository

Điểm nổi bật về kiến trúc#

Kiến trúc của YOLOv7 được xây dựng dựa trên khái niệm Extended Efficient Layer Aggregation Network (E-ELAN). Phương pháp này tối ưu hóa đường dẫn gradient, cho phép model học hiệu quả hơn mà không làm tăng đáng kể độ phức tạp tính toán. Các tác giả cũng giới thiệu "trainable bag-of-freebies", tập hợp các phương pháp giúp cải thiện độ chính xác của model (model accuracy) trong quá trình huấn luyện mà không ảnh hưởng đến tốc độ suy luận trên các thiết bị biên.

Điểm mạnh và hạn chế#

YOLOv7 vẫn là một model rất mạnh mẽ cho các tác vụ object detection tiêu chuẩn, mang lại tốc độ xử lý tuyệt vời trên các GPU tiêu dùng. Bản chất CNN của nó có nghĩa là nó thường yêu cầu ít bộ nhớ CUDA hơn trong quá trình đào tạo so với các model dựa trên Transformer như RTDETRv2.

Bất chấp những ưu điểm này, YOLOv7 vẫn dựa vào NMS để hậu xử lý. Trong các môi trường có mật độ dự đoán cao, bước NMS có thể gây ra biến động về thời gian xử lý, khiến việc đảm bảo tính thời gian thực nghiêm ngặt trở nên khó khăn. Ngoài ra, so với các framework hiện đại, quá trình xử lý các tác vụ đa dạng như instance segmentationpose estimation có thể bị phân mảnh.

Tìm hiểu thêm về YOLOv7

So sánh hiệu năng#

Việc đánh giá các model này đòi hỏi phải xem xét sự cân bằng tinh tế giữa mean Average Precision (mAP), số lượng tham số và tốc độ suy luận.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Bối cảnh hiệu suất

Mặc dù RTDETRv2-x đạt được mAP cao nhất, nhưng nó cũng mang số lượng tham số và FLOPs lớn nhất. Các biến thể nhỏ hơn như RTDETRv2-s mang lại tốc độ cạnh tranh trên TensorRT, nhưng người dùng nhắm đến môi trường công suất thấp không có GPU chuyên dụng cần đánh giá cẩn thận khả năng inference trên CPU.

Giải pháp hiện đại: Bước tiến YOLO26#

Trong khi RTDETRv2 và YOLOv7 đóng vai trò then chốt trong việc thúc đẩy ranh giới của computer vision applications, bối cảnh AI phát triển rất nhanh chóng. Ra mắt vào tháng 1 năm 2026, YOLO26 tổng hợp các khía cạnh tốt nhất của cả hiệu suất CNN và các kiến trúc không cần NMS giống như Transformer.

Đối với các nhà phát triển và nhà nghiên cứu đang xây dựng các hệ thống mới, Ultralytics Platform tích hợp và hệ sinh thái Python cung cấp một trải nghiệm thống nhất giúp giảm thiểu đáng kể nợ kỹ thuật.

Những cải tiến chính trong YOLO26#

  • Thiết kế End-to-End NMS-Free: YOLO26 là thiết kế end-to-end tự nhiên, loại bỏ hậu xử lý NMS để triển khai nhanh hơn và đơn giản hơn. Cách tiếp cận đột phá này lần đầu tiên được tiên phong trong YOLOv10, đảm bảo độ trễ ổn định bất kể mật độ vật thể.
  • Tốc độ suy luận CPU nhanh hơn tới 43%: Được tối ưu hóa đặc biệt cho edge computing và các thiết bị không có GPU, giúp model linh hoạt hơn nhiều cho việc triển khai thực tế so với các model transformer cồng kềnh.
  • MuSGD Optimizer: Sự kết hợp giữa SGD và Muon (lấy cảm hứng từ Kimi K2 của Moonshot AI), mang những đổi mới trong đào tạo LLM vào thị giác máy tính để đào tạo ổn định hơn và hội tụ nhanh hơn.
  • Loại bỏ DFL: Distribution Focal Loss đã bị loại bỏ, dẫn đến biểu đồ tính toán được đơn giản hóa để xuất mượt mà hơn sang các NPU nhúng và môi trường TensorRT.
  • ProgLoss + STAL: Các hàm mất mát được cải tiến mang lại những bước tiến đáng kể trong việc nhận diện vật thể nhỏ, điều rất quan trọng đối với các ứng dụng robotics, IoT và phân tích hình ảnh trên không.
  • Cải tiến theo tác vụ: YOLO26 không chỉ dành cho phát hiện. Nó có các nguyên mẫu đa quy mô cho phân đoạn, Residual Log-Likelihood Estimation (RLE) cho theo dõi tư thế và loss góc chuyên biệt giải quyết các vấn đề biên oriented bounding box (OBB).

Trải nghiệm nhà phát triển hợp lý hóa#

Lợi thế thực sự của việc chọn một model Ultralytics như YOLO26 (hoặc YOLO11 rất phổ biến) là hệ sinh thái được duy trì tốt. Việc đào tạo một tập dữ liệu tùy chỉnh đòi hỏi rất ít boilerplate code:

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)

Tìm hiểu thêm về YOLO26

Các trường hợp sử dụng và ứng dụng lý tưởng#

Việc lựa chọn giữa các kiến trúc này phụ thuộc phần lớn vào phần cứng mục tiêu và các yêu cầu vận hành cụ thể.

Khi nào nên xem xét RTDETRv2#

RTDETRv2 cực kỳ hiệu quả trong các môi trường server-side processing được trang bị GPU mạnh mẽ. Cơ chế chú ý toàn cục (global attention mechanism) làm cho nó phù hợp để hiểu các cảnh phức tạp, chẳng hạn như giám sát sự kiện đông đúc hoặc chẩn đoán hình ảnh y tế chuyên sâu, nơi các đặc điểm chồng chéo đòi hỏi phân tích bối cảnh sâu sắc.

Khi nào nên cân nhắc YOLOv7#

YOLOv7 thường được duy trì trong nghiên cứu học thuật cũ như một model so sánh baseline. Nó cũng được tìm thấy trong các triển khai công nghiệp cũ, nơi các đường ống (pipelines) hiện có được mã hóa cứng cho các phiên bản PyTorch cụ thể và không yêu cầu sự linh hoạt đa tác vụ của các framework mới hơn.

Tại sao YOLO26 là tiêu chuẩn được khuyến nghị#

Đối với cơ sở hạ tầng smart city hiện đại, drone navigation và sản xuất tốc độ cao, YOLO26 mang lại sự cân bằng chưa từng có. Yêu cầu bộ nhớ thấp hơn giúp việc hyperparameter tuning và huấn luyện trở nên khả thi trên phần cứng tiêu dùng, trong khi khả năng suy luận không cần NMS đảm bảo thực thi nhanh chóng trên các thiết bị biên bị giới hạn tài nguyên như Raspberry Pi hoặc NVIDIA Jetson.

Khám phá thêm các so sánh

Bạn quan tâm đến việc các model này so sánh với các kiến trúc khác như thế nào? Hãy xem hướng dẫn chi tiết của chúng tôi về YOLO11 vs. RTDETRYOLOv8 vs. YOLOv7 để tìm sự phù hợp hoàn hảo cho dự án AI thị giác của bạn.

Những người đóng góp

Bình luận