YOLO Vision 2026:

RTDETRv2 so với YOLOv10#

Sự tiến hóa của computer vision phần lớn được thúc đẩy bởi nỗ lực không ngừng nhằm cân bằng giữa tốc độ và độ chính xác. Theo truyền thống, các pipeline object detection thời gian thực phụ thuộc vào Non-Maximum Suppression (NMS) như một bước hậu xử lý để lọc các hộp giới hạn chồng chéo. Tuy nhiên, NMS gây ra các điểm nghẽn về độ trễ và việc tinh chỉnh siêu tham số phức tạp. Gần đây, hai phương pháp kiến trúc khác nhau đã xuất hiện để giải quyết vấn đề này một cách nguyên bản: các mô hình dựa trên Transformer như RTDETRv2 và các mô hình dựa trên CNN như YOLOv10.

Hướng dẫn này cung cấp một so sánh kỹ thuật toàn diện về hai mô hình này, phân tích kiến trúc, các chỉ số hiệu suất và các trường hợp sử dụng lý tưởng, đồng thời nêu bật cách các đổi mới mới nhất trong Ultralytics ecosystem mang lại giải pháp tối ưu cho việc triển khai hiện đại.

RTDETRv2: Transformer phát hiện thời gian thực#

RTDETRv2 được xây dựng dựa trên kiến trúc RT-DETR gốc, nhằm mục đích kết hợp khả năng hiểu ngữ cảnh toàn cục của Vision Transformers với các yêu cầu về tốc độ thời gian thực vốn thường do các mô hình YOLO thống trị.

Đặc điểm chính:

Kiến trúc và phương pháp huấn luyện#

RTDETRv2 tận dụng kiến trúc transformer đầu cuối giúp tránh NMS một cách tự nhiên. Nó cải tiến từ phiên bản tiền nhiệm bằng cách giới thiệu phương tiếp cận "Bag-of-Freebies", tối ưu hóa chiến lược huấn luyện và tích hợp các khả năng phát hiện đa tỷ lệ. Mô hình sử dụng một backbone CNN để trích xuất feature maps (các chi tiết trực quan như cạnh và kết cấu), sau đó được xử lý bởi cấu trúc encoder-decoder của transformer. Điều này cho phép mô hình phân tích toàn bộ ngữ cảnh hình ảnh cùng một lúc, giúp nó đạt hiệu quả cao trong việc hiểu các cảnh phức tạp nơi các đối tượng được đóng gói dày đặc hoặc chồng chéo.

Điểm mạnh và điểm yếu#

Điểm mạnh:

  • Global Context: attention mechanism cho phép mô hình vượt trội trong các môi trường phức tạp, lộn xộn.
  • Không NMS: Dự đoán trực tiếp tọa độ đối tượng, giúp đơn giản hóa pipeline triển khai.
  • High Accuracy: Đạt được mean average precision (mAP) xuất sắc trên tập dữ liệu COCO.

Điểm yếu:

  • Resource Intensive: Các kiến trúc Transformer thường yêu cầu bộ nhớ CUDA đáng kể hơn trong quá trình huấn luyện so với CNN, khiến việc tinh chỉnh trở nên tốn kém trên phần cứng tiêu chuẩn.
  • Inference Speed Variability: Mặc dù nhanh, các phép tính attention nặng có thể dẫn đến FPS in computer vision thấp hơn trên các thiết bị biên thiếu các bộ tăng tốc AI chuyên dụng.

Tìm hiểu thêm về RTDETRv2

YOLOv10: Phát hiện vật thể End-to-End thời gian thực#

YOLOv10 thể hiện một bước chuyển lớn trong dòng YOLO object detection bằng cách giải quyết trực tiếp điểm nghẽn NMS lâu đời ngay trong một framework CNN.

Đặc điểm chính:

Kiến trúc và phương pháp huấn luyện#

Đổi mới cốt lõi của YOLOv10 là các gán ghép kép nhất quán cho việc huấn luyện không cần NMS. Nó sử dụng hai đầu phát hiện trong quá trình huấn luyện: một đầu với gán ghép một-nhiều (như các YOLO truyền thống) để cung cấp tín hiệu giám sát phong phú, và đầu kia với gán ghép một-một để loại bỏ nhu cầu sử dụng NMS. Trong quá trình suy luận, chỉ có đầu một-một được sử dụng, dẫn đến một quy trình end-to-end. Hơn nữa, các tác giả đã áp dụng chiến lược thiết kế mô hình dựa trên hiệu quả-độ chính xác toàn diện, tối ưu hóa triệt để nhiều thành phần để giảm bớt sự dư thừa tính toán.

Điểm mạnh và điểm yếu#

Điểm mạnh:

  • Extreme Speed: Bằng cách loại bỏ NMS và tối ưu hóa kiến trúc, YOLOv10 đạt được inference latency cực kỳ thấp.
  • Efficiency: Yêu cầu ít tham số hơn và FLOPs để đạt độ chính xác tương đương với các mô hình khác, giúp nó rất phù hợp cho các môi trường bị giới hạn.
  • NMS-Free Deployments: Đơn giản hóa việc tích hợp vào các ứng dụng biên như smart surveillance.

Điểm yếu:

  • First-Generation Concept: Là mô hình YOLO đầu tiên triển khai kiến trúc không dùng NMS cụ thể này, nó đã đặt nền móng nhưng vẫn để lại dư địa cho tính đa nhiệm và tối ưu hóa được thấy ở các mô hình tiếp theo như YOLO11 và YOLO26.

Tìm hiểu thêm về YOLOv10

So sánh hiệu năng#

Khi đánh giá các mô hình cho sản xuất, việc cân bằng giữa độ chính xác và chi phí tính toán là rất quan trọng. Bảng dưới đây làm nổi bật các sự đánh đổi hiệu suất giữa các kích thước khác nhau của RTDETRv2 và YOLOv10.

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Trong khi RTDETRv2 cung cấp độ chính xác vững chắc, YOLOv10 thể hiện lợi thế đáng chú ý về độ trễ và hiệu quả tham số, đặc biệt là ở các biến thể nhỏ hơn của nó (Nano và Small), khiến nó rất hấp dẫn đối với các ứng dụng edge computing and AIoT.

Lựa chọn quy mô phù hợp

Nếu bạn đang triển khai trên các GPU cấp máy chủ nơi batch size và VRAM ít bị giới hạn hơn, các mô hình lớn hơn (như -x hoặc -l) sẽ tối đa hóa độ chính xác. Đối với các thiết bị biên như Raspberry Pi hoặc điện thoại di động, ưu tiên các biến thể nano (-n) hoặc small (-s) để duy trì tốc độ khung hình thời gian thực.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa RT-DETR và YOLOv10 phụ thuộc vào yêu cầu dự án cụ thể, các hạn chế triển khai và tùy chọn hệ sinh thái của bạn.

Khi nào nên chọn RT-DETR#

RT-DETR là lựa chọn mạnh mẽ cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án khám phá cơ chế chú ý và kiến trúc transformer cho phát hiện vật thể end-to-end không cần NMS.
  • Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng mà độ chính xác phát hiện là ưu tiên hàng đầu và độ trễ suy luận cao hơn một chút là có thể chấp nhận được.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể từ trung bình đến lớn, nơi cơ chế chú ý toàn cục của các transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn YOLOv10#

YOLOv10 được khuyến nghị cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ việc phát hiện đầu cuối (end-to-end) mà không cần NMS, giúp giảm độ phức tạp khi triển khai.
  • Sự cân bằng giữa tốc độ và độ chính xác: Các dự án yêu cầu sự cân bằng mạnh mẽ giữa tốc độ suy luận và độ chính xác của phát hiện trên nhiều quy mô model khác nhau.
  • Các ứng dụng có độ trễ nhất quán: Các kịch bản triển khai nơi thời gian suy luận có thể dự đoán được là tối quan trọng, chẳng hạn như robot hoặc các hệ thống tự hành.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Lợi thế của Ultralytics: Giới thiệu YOLO26#

Mặc dù cả RTDETRv2 và YOLOv10 đều mang lại những tiến bộ học thuật hấp dẫn, việc triển khai chúng trong các kịch bản thực tế đòi hỏi một hệ sinh thái phần mềm mạnh mẽ, được duy trì tốt. Ultralytics Platform cung cấp trải nghiệm cho nhà phát triển chưa từng có, kết hợp sự dễ sử dụng, tài liệu phong phú và các công cụ mạnh mẽ cho data annotation và triển khai.

Đối với các nhà phát triển tìm kiếm công nghệ tối tân nhất vào năm 2026, Ultralytics YOLO26 là khuyến nghị cuối cùng. Nó tổng hợp những ý tưởng hay nhất từ cả hai kiến trúc đồng thời giới thiệu những cải tiến mang tính đột phá:

  • Thiết kế End-to-End không NMS: Xây dựng dựa trên khái niệm được tiên phong bởi YOLOv10, YOLO26 loại bỏ hoàn toàn hậu xử lý NMS, dẫn đến logic triển khai nhanh hơn, đơn giản hơn và không có độ trễ thay đổi.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss, YOLO26 đơn giản hóa việc xuất mô hình và cải thiện đáng kể khả năng tương thích với các thiết bị biên và thiết bị tiêu thụ điện năng thấp.
  • Bộ tối ưu hóa MuSGD: Là sự kết hợp giữa SGD và Muon (lấy cảm hứng từ những cải tiến trong huấn luyện LLM), bộ tối ưu hóa mới lạ này cung cấp quá trình huấn luyện ổn định hơn và hội tụ nhanh hơn đáng kể so với các phương pháp truyền thống.
  • Suy luận CPU nhanh hơn tới 43%: Được tối ưu hóa cẩn thận cho các môi trường không có GPU chuyên dụng, giúp phổ cập AI thị giác hiệu năng cao.
  • ProgLoss + STAL: Các hàm mất mát nâng cao này mang lại những cải tiến đáng chú ý trong việc nhận diện đối tượng nhỏ, điều rất quan trọng đối với applications using drones và các cảm biến IoT.
  • Unmatched Versatility: Không giống như các mô hình bị giới hạn ở các hộp giới hạn, YOLO26 hỗ trợ toàn bộ các tác vụ bao gồm instance segmentation, pose estimation, image classification, và OBB detection, hoàn chỉnh với các cải tiến dành riêng cho tác vụ như Residual Log-Likelihood Estimation (RLE) cho Pose.

Tìm hiểu thêm về YOLO26

Triển khai liền mạch với Python#

Việc huấn luyện và triển khai các mô hình này sử dụng Ultralytics Python API được thiết kế để không có ma sát. Yêu cầu về bộ nhớ thấp hơn đáng kể trong quá trình huấn luyện so với các kiến trúc nặng transformer, cho phép bạn huấn luyện các mô hình mạnh mẽ trên phần cứng tiêu chuẩn.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 model (recommended)
# Alternatively, load a YOLOv10 model using YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Easily export to various formats for edge deployment
model.export(format="onnx", simplify=True)

Cho dù bạn đang thực hiện security alarm systems hay tiến hành medical image analysis, việc lựa chọn một mô hình được hỗ trợ bởi cộng đồng Ultralytics năng động đảm bảo bạn có các công cụ, hướng dẫn hyperparameter tuning và các bản cập nhật liên tục cần thiết để thành công. Trong khi YOLOv10 và RTDETRv2 dọn đường cho các kiến trúc không dùng NMS, YOLO26 hoàn thiện công thức đó, mang lại sự cân bằng tốt nhất về hiệu suất, tính linh hoạt và độ sẵn sàng cho sản xuất.

Những người đóng góp

Bình luận