Ultralytics YOLO27:

So sánh YOLOv10 và RTDETRv2#

Lĩnh vực thị giác máy tính phát triển với tốc độ chóng mặt, khi các kiến trúc mới liên tục định nghĩa lại chuẩn mực hiện đại trong phát hiện đối tượng theo thời gian thực. Hai cột mốc quan trọng trong quá trình này là YOLOv10 và RTDETRv2. Cả hai model đều hướng đến việc giải quyết một nút thắt cơ bản trong các pipeline phát hiện truyền thống bằng cách loại bỏ nhu cầu hậu xử lý NMS, nhưng tiếp cận thách thức này từ những mô hình kiến trúc hoàn toàn khác nhau.

Bài so sánh kỹ thuật này cung cấp phân tích chuyên sâu về kiến trúc, phương pháp training và các kịch bản triển khai lý tưởng của chúng, giúp developer và researcher lựa chọn công cụ phù hợp cho dự án AI thị giác tiếp theo.

YOLOv10: Tiên phong phát hiện không cần NMS#

Được phát triển bởi các nhà nghiên cứu tại Tsinghua University, YOLOv10 tập trung mạnh vào hiệu quả kiến trúc và loại bỏ các nút thắt trong hậu xử lý. Bằng cách đưa vào chiến lược gán kép nhất quán cho quá trình training không cần NMS, model đạt hiệu năng cạnh tranh đồng thời giảm đáng kể latency khi inference.

Thông số kỹ thuật#

Kiến trúc và phương pháp#

Đột phá chính của YOLOv10 là thiết kế model tổng thể dựa trên sự cân bằng giữa hiệu quả và độ chính xác. Model tối ưu nhiều thành phần từ cả hai khía cạnh, giúp giảm đáng kể chi phí tính toán. Chiến lược gán kép nhất quán cho phép model training mà không phụ thuộc vào NMS, từ đó tạo ra một pipeline triển khai end-to-end tinh gọn. Điều này đặc biệt hữu ích khi export model sang các định dạng edge như ONNX hoặc TensorRT, nơi các thao tác hậu xử lý có thể gây ra latency ngoài dự kiến.

Ưu điểm và nhược điểm#

Model có sự cân bằng nổi bật giữa tốc độ và độ chính xác, đặc biệt ở các biến thể nhỏ hơn (N và S). Latency tối thiểu khiến model lý tưởng cho các môi trường edge tốc độ cao. Tuy nhiên, dù YOLOv10 nổi bật về tốc độ phát hiện thuần túy, đây vẫn là một model chuyên biệt chỉ dành cho tác vụ detection. Các team cần instance segmentation hoặc ước lượng pose sẽ cần tìm đến các framework linh hoạt hơn.

Tìm hiểu thêm về YOLOv10

RTDETRv2: Tinh chỉnh Detection Transformer#

Dựa trên Real-Time Detection Transformer ban đầu, RTDETRv2 tích hợp một "túi thủ thuật miễn phí" để cải thiện baseline, cho thấy Transformer có thể cạnh tranh với CNN trong các kịch bản thời gian thực.

Thông số kỹ thuật#

Kiến trúc và phương pháp#

RTDETRv2 sử dụng kiến trúc hybrid, kết hợp backbone Mạng nơ-ron tích chập (CNN) để trích xuất đặc trưng thị giác với encoder-decoder Transformer nhằm hiểu toàn diện cảnh. Cơ chế self-attention của Transformer cho phép model quan sát toàn cục hình ảnh, giúp model đặc biệt hiệu quả trong việc xử lý các cảnh phức tạp, đối tượng chồng lấn và đám đông dày đặc.

Ưu điểm và nhược điểm#

Kiến trúc Transformer mang lại độ chính xác xuất sắc, đặc biệt ở các quy mô lớn hơn về số lượng tham số, đồng thời tự nhiên xuất ra các detection cuối cùng mà không cần NMS. Tuy nhiên, điều này đi kèm với một cái giá. Theo truyền thống, model Transformer yêu cầu nhiều bộ nhớ CUDA hơn đáng kể trong quá trình training và có thể hội tụ chậm hơn so với các kiến trúc CNN thuần túy. Dù RTDETRv2 đã cải thiện tốc độ inference, model nhìn chung vẫn tiêu thụ nhiều bộ nhớ hơn các biến thể YOLO nhẹ.

Tìm hiểu thêm về RTDETRv2

So sánh hiệu năng#

Đánh giá các chỉ số hiệu năng cho thấy rõ hơn điểm mạnh của từng model. Bảng sau làm nổi bật khả năng của chúng trên dataset COCO:

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Khi phân tích dữ liệu, YOLOv10 duy trì lợi thế rõ rệt về hiệu quả tham số và tốc độ inference TensorRT ở các kích thước tương đương. RTDETRv2-x đạt độ chính xác ngang với YOLOv10x có quy mô rất lớn, nhưng yêu cầu nhiều hơn gần 20 triệu tham số và FLOPs cao hơn đáng kể.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv10 và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.

Khi nào nên chọn YOLOv10#

YOLOv10 là lựa chọn phù hợp cho:

  • Phát hiện thời gian thực không cần NMS: Các ứng dụng hưởng lợi từ khả năng phát hiện đầu cuối mà không cần triệt tiêu cực đại, giúp giảm độ phức tạp khi triển khai.
  • Cân bằng giữa tốc độ và độ chính xác: Các project yêu cầu sự cân bằng tốt giữa tốc độ suy luận và độ chính xác phát hiện trên nhiều quy mô model khác nhau.
  • Ứng dụng có độ trễ nhất quán: Các kịch bản triển khai mà thời gian suy luận có thể dự đoán là yếu tố quan trọng, chẳng hạn như robotics hoặc các hệ thống tự hành.

Khi nào nên chọn RT-DETR#

RT-DETR được khuyến nghị cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc transformer cho bài toán phát hiện đối tượng end-to-end không cần NMS.
  • Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng trong đó độ chính xác phát hiện là ưu tiên hàng đầu và có thể chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện đối tượng lớn: Các cảnh chủ yếu chứa đối tượng cỡ vừa đến lớn, trong đó cơ chế attention toàn cục của transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Lợi thế của Ultralytics: Hệ sinh thái và đổi mới#

Mặc dù YOLOv10 và RTDETRv2 cung cấp khả năng detection mạnh mẽ, việc lựa chọn model thường phụ thuộc vào hệ sinh thái phần mềm xung quanh. Ultralytics Platform cung cấp một interface hợp nhất, liền mạch, loại bỏ sự phức tạp của deep learning.

Tiêu chuẩn mới: Ultralytics YOLO26#

Đối với developer tìm kiếm hiệu năng tốt nhất, Ultralytics YOLO26 là kết tinh của những tiến bộ kiến trúc gần đây. Được phát hành vào đầu năm 2026, YOLO26 kế thừa Thiết kế end-to-end không cần NMS do YOLOv10 tiên phong, loại bỏ hoàn toàn hậu xử lý NMS để triển khai nhanh hơn và đơn giản hơn.

Tại sao nên chọn YOLO26?

YOLO26 đưa các đổi mới trong training LLM vào thị giác máy tính thông qua Optimizer MuSGD (hybrid của SGD và Muon), mang lại quá trình training ổn định hơn và hội tụ nhanh hơn. Model cũng đạt Inference trên CPU nhanh hơn 43%, trở thành lựa chọn hàng đầu cho edge computing.

Hơn nữa, YOLO26 giới thiệu ProgLoss + STAL để cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, đồng thời, không giống YOLOv10 chuyên biệt, model mang lại tính linh hoạt vượt trội. Model hỗ trợ tự nhiên object detection, segmentation, pose và bounding box định hướng (OBB), cùng các cải tiến riêng cho từng tác vụ như loss semantic segmentation và Ước lượng Log-Likelihood Phần dư (RLE) cho pose. Ngoài ra, việc loại bỏ Distribution Focal Loss (DFL) giúp đơn giản hóa quá trình export và tăng khả năng tương thích với các thiết bị công suất thấp.

Tính dễ sử dụng và hiệu quả huấn luyện#

Dù bạn đang thử nghiệm các model thế hệ cũ hơn như Ultralytics YOLO11 hay YOLO26 tiên tiến, Python API tinh gọn vẫn đảm bảo mức sử dụng bộ nhớ thấp hơn trong quá trình training và workflow cực kỳ nhanh.

from ultralytics import RTDETR, YOLO

# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

Hệ sinh thái được duy trì tốt cung cấp các công cụ để tuning hyperparameter dễ dàng và tích hợp mượt mà với các giải pháp tracking mở rộng cùng tùy chọn triển khai model.

Kết luận#

YOLOv10 và RTDETRv2 đều là những cột mốc đáng kể trong nỗ lực phát hiện đối tượng không cần NMS. RTDETRv2 chứng minh rằng Transformer có thể đạt latency thời gian thực với khả năng nắm bắt ngữ cảnh toàn cục xuất sắc, dù yêu cầu nhiều bộ nhớ hơn. YOLOv10 cung cấp một lựa chọn CNN nhanh, hiệu quả cao, được thiết kế riêng cho các tác vụ detection bị giới hạn tài nguyên.

Tuy nhiên, để đạt hiệu năng cân bằng, tính linh hoạt đa tác vụ và hệ sinh thái trưởng thành nhất, developer được khuyến nghị mạnh mẽ sử dụng Ultralytics YOLO26. Model kết hợp hài hòa những đổi mới kiến trúc từ các thế hệ tiền nhiệm với bộ công cụ mạnh mẽ, thân thiện với người dùng, giúp việc triển khai AI thị giác trở nên liền mạch.

Những người đóng góp

Bình luận