YOLO Vision 2026:

YOLOv10 so với RTDETRv2#

Bối cảnh của computer vision đang phát triển với tốc độ chóng mặt, với các kiến trúc mới liên tục định nghĩa lại trạng thái nghệ thuật trong phát hiện đối tượng thời gian thực. Hai cột mốc quan trọng trong sự tiến hóa này là YOLOv10 và RTDETRv2. Cả hai model đều nhằm mục đích giải quyết nút thắt cổ chai cơ bản trong các pipeline phát hiện truyền thống bằng cách loại bỏ nhu cầu xử lý hậu kỳ Non-Maximum Suppression (NMS), tuy nhiên chúng tiếp cận thách thức này từ các mô hình kiến trúc hoàn toàn khác nhau.

So sánh kỹ thuật này cung cấp một phân tích chi tiết về kiến trúc, phương pháp huấn luyện và các kịch bản triển khai lý tưởng của chúng để giúp các lập trình viên và nhà nghiên cứu chọn công cụ phù hợp cho dự án vision AI tiếp theo của họ.

YOLOv10: Người tiên phong không cần NMS#

Được phát triển bởi các nhà nghiên cứu tại Đại học Thanh Hoa, YOLOv10 tập trung mạnh mẽ vào hiệu quả kiến trúc và loại bỏ các điểm nghẽn hậu xử lý. Bằng cách giới thiệu cơ chế gán kép nhất quán (consistent dual assignments) cho huấn luyện không cần NMS, model đạt được hiệu suất cạnh tranh trong khi giảm đáng kể độ trễ suy luận.

Thông số kỹ thuật#

Kiến trúc và phương pháp luận#

Bước đột phá chính của YOLOv10 là thiết kế model hướng đến hiệu suất và độ chính xác tổng thể. Nó tối ưu hóa các thành phần khác nhau từ cả hai góc độ, giúp giảm đáng kể chi phí tính toán. Chiến lược phân công kép nhất quán cho phép model huấn luyện mà không phụ thuộc vào NMS, điều này chuyển hóa thành một pipeline triển khai end-to-end tinh gọn. Điều này đặc biệt có lợi khi xuất model sang các định dạng edge như ONNX hoặc TensorRT, nơi các thao tác xử lý hậu kỳ có thể tạo ra độ trễ bất ngờ.

Điểm mạnh và điểm yếu#

Model này tự hào có sự đánh đổi tốc độ - độ chính xác đặc biệt, đặc biệt là ở các biến thể nhỏ hơn (N và S). Độ trễ tối thiểu của nó làm cho nó lý tưởng cho môi trường edge tốc độ cao. Tuy nhiên, mặc dù YOLOv10 xuất sắc về tốc độ phát hiện thô, nó vẫn là một model chuyên dụng chỉ dùng để phát hiện. Các nhóm yêu cầu instance segmentation hoặc pose estimation sẽ cần tìm kiếm các framework linh hoạt hơn.

Tìm hiểu thêm về YOLOv10

RTDETRv2: Cải tiến Detection Transformer#

Dựa trên Real-Time Detection Transformer gốc, RTDETRv2 kết hợp một "túi quà tặng" (bag of freebies) để cải thiện hiệu năng baseline, chứng minh rằng các Transformer có thể cạnh tranh với CNN trong các kịch bản thời gian thực.

Thông số kỹ thuật#

Kiến trúc và phương pháp luận#

RTDETRv2 sử dụng kiến trúc lai, kết hợp backbone mạng thần kinh tích chập (CNN) để trích xuất đặc trưng hình ảnh với một bộ encoder-decoder Transformer để hiểu bối cảnh toàn diện. Cơ chế self-attention của Transformer cho phép model quan sát hình ảnh một cách tổng thể, giúp nó đạt hiệu quả cao trong việc xử lý các cảnh phức tạp, đối tượng chồng lấp và đám đông dày đặc.

Điểm mạnh và điểm yếu#

Kiến trúc Transformer cung cấp độ chính xác tuyệt vời, đặc biệt ở các quy mô tham số lớn hơn, và xuất kết quả phát hiện cuối cùng mà không cần NMS. Tuy nhiên, điều này đi kèm với cái giá phải trả. Các model Transformer truyền thống thường yêu cầu bộ nhớ CUDA đáng kể hơn trong quá trình huấn luyện và có thể hội tụ chậm hơn so với các kiến trúc CNN thuần túy. Mặc dù RTDETRv2 đã cải thiện tốc độ suy luận, nhưng nhìn chung nó tiêu tốn nhiều bộ nhớ hơn so với các biến thể YOLO nhẹ.

Tìm hiểu thêm về RTDETRv2

So sánh hiệu năng#

Đánh giá các chỉ số hiệu suất cung cấp cái nhìn rõ ràng hơn về nơi mỗi model vượt trội. Bảng sau đây nêu bật các khả năng của chúng trên COCO dataset:

Mô hìnhkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Khi phân tích dữ liệu, YOLOv10 duy trì ưu thế rõ rệt về hiệu quả tham số và tốc độ suy luận trên TensorRT ở các kích thước tương đương. RTDETRv2-x khớp với YOLOv10x khổng lồ về độ chính xác nhưng yêu cầu nhiều hơn gần 20 triệu tham số và FLOPs cao hơn đáng kể.

Các trường hợp sử dụng và Khuyến nghị#

Việc lựa chọn giữa YOLOv10 và RT-DETR phụ thuộc vào yêu cầu dự án cụ thể, hạn chế triển khai và sở thích về hệ sinh thái của bạn.

Khi nào nên chọn YOLOv10#

YOLOv10 là một lựa chọn mạnh mẽ cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ việc phát hiện đầu cuối (end-to-end) mà không cần NMS, giúp giảm độ phức tạp khi triển khai.
  • Sự cân bằng giữa tốc độ và độ chính xác: Các dự án yêu cầu sự cân bằng mạnh mẽ giữa tốc độ suy luận và độ chính xác của phát hiện trên nhiều quy mô model khác nhau.
  • Các ứng dụng có độ trễ nhất quán: Các kịch bản triển khai nơi thời gian suy luận có thể dự đoán được là tối quan trọng, chẳng hạn như robot hoặc các hệ thống tự hành.

Khi nào nên chọn RT-DETR#

RT-DETR được khuyên dùng cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án khám phá cơ chế chú ý và kiến trúc transformer cho phát hiện vật thể end-to-end không cần NMS.
  • Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng mà độ chính xác phát hiện là ưu tiên hàng đầu và độ trễ suy luận cao hơn một chút là có thể chấp nhận được.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể từ trung bình đến lớn, nơi cơ chế chú ý toàn cục của các transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết các dự án mới, Ultralytics YOLO26 mang lại sự kết hợp tốt nhất giữa hiệu suất và trải nghiệm của nhà phát triển:

  • Triển khai Edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của hậu xử lý Non-Maximum Suppression.
  • Môi trường chỉ dùng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi suy luận CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện Vật thể Nhỏ: Các kịch bản thử thách như aerial drone imagery hoặc phân tích cảm biến IoT nơi ProgLoss và STAL cải thiện đáng kể độ chính xác trên các vật thể nhỏ xíu.

Lợi thế của Ultralytics: Hệ sinh thái và Đổi mới#

Mặc dù YOLOv10 và RTDETRv2 cung cấp khả năng phát hiện mạnh mẽ, việc lựa chọn model thường phụ thuộc vào hệ sinh thái phần mềm xung quanh. Ultralytics Platform cung cấp một giao diện liền mạch, thống nhất giúp trừu tượng hóa các độ phức tạp của deep learning.

Tiêu chuẩn mới: Ultralytics YOLO26#

Đối với các lập trình viên tìm kiếm hiệu suất tuyệt đối tốt nhất, Ultralytics YOLO26 đại diện cho đỉnh cao của những tiến bộ kiến trúc gần đây. Được phát hành vào đầu năm 2026, YOLO26 kế thừa End-to-End NMS-Free Design được tiên phong bởi YOLOv10, loại bỏ hoàn toàn việc xử lý hậu kỳ NMS để triển khai nhanh hơn và đơn giản hơn.

Tại sao chọn YOLO26?

YOLO26 mang các cải tiến huấn luyện LLM vào computer vision thông qua trình tối ưu hóa MuSGD (sự kết hợp giữa SGD và Muon), giúp huấn luyện ổn định hơn và hội tụ nhanh hơn. Nó cũng đạt tốc độ suy luận trên CPU nhanh hơn tới 43%, biến nó thành lựa chọn hàng đầu cho điện toán biên.

Hơn nữa, YOLO26 giới thiệu ProgLoss + STAL mang lại những cải tiến đáng kể trong việc nhận diện đối tượng nhỏ, và không giống như YOLOv10 chuyên dụng, nó mang lại tính linh hoạt cực cao. Nó hỗ trợ nguyên bản object detection, segmentation, pose, và oriented bounding boxes (OBB) với các cải tiến dành riêng cho từng tác vụ như mất mát phân đoạn ngữ nghĩa và Residual Log-Likelihood Estimation (RLE) cho pose. Hơn nữa, việc loại bỏ Distribution Focal Loss (DFL) đảm bảo việc xuất đơn giản hơn và khả năng tương thích với thiết bị công suất thấp tốt hơn.

Tìm hiểu thêm về YOLO26

Dễ sử dụng và hiệu quả huấn luyện#

Cho dù bạn đang thử nghiệm các model thế hệ cũ như Ultralytics YOLO11 hay YOLO26 tiên tiến, Python API tinh gọn đảm bảo mức sử dụng bộ nhớ thấp hơn trong quá trình huấn luyện và các workflow cực kỳ nhanh chóng.

from ultralytics import RTDETR, YOLO

# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

Hệ sinh thái được duy trì tốt cung cấp các công cụ để dễ dàng hyperparameter tuning và tích hợp hoàn hảo với các giải pháp theo dõi rộng rãi và model deployment options.

Kết luận#

Cả YOLOv10 và RTDETRv2 đều đại diện cho những cột mốc đáng gờm trong hành trình tìm kiếm phát hiện đối tượng không cần NMS. RTDETRv2 chứng minh rằng các Transformer có thể đạt được độ trễ thời gian thực với khả năng hiểu bối cảnh toàn cầu xuất sắc, mặc dù yêu cầu bộ nhớ cao hơn. YOLOv10 cung cấp một giải pháp thay thế CNN hiệu quả, nhanh chóng, được thiết kế riêng cho các tác vụ phát hiện bị hạn chế về tài nguyên.

Tuy nhiên, để đạt được hiệu suất cân bằng, tính linh hoạt đa tác vụ và hệ sinh thái trưởng thành nhất, các nhà phát triển rất được khuyến khích tận dụng Ultralytics YOLO26. Nó kết hợp một cách tuyệt vời các đổi mới kiến trúc của những người tiền nhiệm với các công cụ mạnh mẽ, thân thiện với người dùng, giúp hiện thực hóa việc triển khai vision AI một cách liền mạch.

Người đóng góp

Bình luận