Ultralytics YOLO27:
Get Started

YOLOv8 so với RTDETRv2#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn của những gì có thể thực hiện trong phát hiện đối tượng thời gian thực. Hai model nổi bật thu hút nhiều sự chú ý là Ultralytics YOLOv8 và RTDETRv2 của Baidu. Hướng dẫn này cung cấp bài so sánh kỹ thuật toàn diện giữa hai model mạnh mẽ, phân tích kiến trúc, chỉ số hiệu năng và các kịch bản triển khai lý tưởng.

Tổng quan về YOLOv8#

Ultralytics YOLOv8 là một cột mốc lớn trong dòng model YOLO (You Only Look Once). Model kế thừa nhiều năm nghiên cứu nền tảng để mang lại tốc độ, độ chính xác và tính dễ sử dụng vượt trội cho nhiều tác vụ.

Đặc điểm chính:

Kiến trúc và ưu điểm#

YOLOv8 giới thiệu kiến trúc tinh gọn, tối ưu cả quá trình trích xuất đặc trưng lẫn hồi quy bounding box. Đây là detector không dùng anchor, giúp đơn giản hóa head dự đoán và giảm số lần cần tinh chỉnh siêu tham số trong quá trình huấn luyện. Kiến trúc này đảm bảo sự cân bằng hiệu năng tuyệt vời giữa tốc độ suy luận và độ chính xác trung bình trung bình (mAP), nhờ đó rất phù hợp để triển khai thực tế trên cả thiết bị biên lẫn máy chủ đám mây.

Ngoài ra, YOLOv8 cần ít bộ nhớ hơn đáng kể trong quá trình huấn luyện so với các kiến trúc dựa trên Transformer. Nhờ đó, nhà phát triển có thể huấn luyện model trên GPU phổ thông mà không gặp lỗi hết bộ nhớ.

Tính linh hoạt#

Một trong những thế mạnh nổi bật của YOLOv8 là tính linh hoạt vốn có. Trong khi nhiều model chỉ tập trung vào bounding box, YOLOv8 hỗ trợ sẵn phát hiện đối tượng, phân đoạn instance, phân loại ảnh, ước tính pose và phát hiện bounding box có hướng (OBB).

Tổng quan về RTDETRv2#

RTDETRv2 (Transformer phát hiện thời gian thực phiên bản 2) phát triển dựa trên RT-DETR ban đầu, với mục tiêu đưa các cơ chế attention mạnh mẽ của Vision Transformer vào các ứng dụng phát hiện đối tượng thời gian thực.

Đặc điểm chính:

Kiến trúc và ưu điểm#

RTDETRv2 tận dụng kiến trúc lai, kết hợp backbone Mạng nơ-ron tích chập (CNN) với cấu trúc encoder-decoder Transformer. Nhờ đó, model có thể nắm bắt các mối quan hệ không gian phức tạp và ngữ cảnh toàn cục thông qua cơ chế self-attention. Bằng cách sử dụng một tập hợp chiến lược huấn luyện "bag-of-freebies", RTDETRv2 đạt điểm mAP cạnh tranh trên các dataset benchmark tiêu chuẩn như dataset COCO.

Điểm yếu#

Dù có độ chính xác cao, bản chất dựa trên Transformer của RTDETRv2 dẫn đến mức tiêu thụ bộ nhớ cao hơn và thời gian huấn luyện lâu hơn so với các kiến trúc CNN thuần. Transformer vốn cần nhiều VRAM hơn, khiến việc huấn luyện trên phần cứng hạn chế tài nguyên trở nên khó khăn. Ngoài ra, dù RTDETRv2 mạnh về phát hiện, model thiếu tính linh hoạt đa nhiệm (như pose và phân đoạn) vốn có trong hệ sinh thái Ultralytics.

Tìm hiểu thêm về RTDETRv2

So sánh hiệu năng#

Khi đánh giá model để đưa vào production, sự đánh đổi giữa kích thước model, tốc độ suy luận và độ chính xác là tối quan trọng. Bảng dưới đây so sánh trực tiếp các biến thể YOLOv8 và RTDETRv2.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Phần cứng và chỉ số

Suy luận trên CPU tận dụng ONNX, trong khi tốc độ GPU được kiểm thử bằng TensorRT trên GPU NVIDIA T4.

Trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv8 và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc khi triển khai và hệ sinh thái bạn ưu tiên.

Khi nào nên chọn YOLOv8#

YOLOv8 là lựa chọn phù hợp cho:

  • Triển khai đa tác vụ linh hoạt: Các dự án cần một model đã được kiểm chứng cho phát hiện, phân đoạn, phân loại và ước lượng tư thế trong hệ sinh thái Ultralytics.
  • Hệ thống sản xuất đã thiết lập: Các môi trường sản xuất hiện có được xây dựng trên kiến trúc YOLOv8 với quy trình triển khai ổn định, đã được kiểm thử kỹ lưỡng.
  • Hỗ trợ cộng đồng và hệ sinh thái rộng rãi: Các ứng dụng hưởng lợi từ kho hướng dẫn phong phú, tích hợp bên thứ ba và tài nguyên cộng đồng tích cực của YOLOv8.

Khi nào nên chọn RT-DETR#

RT-DETR được khuyến nghị cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc Transformer để phát hiện vật thể đầu cuối mà không cần NMS.
  • Tình huống cần độ chính xác cao với độ trễ linh hoạt: Các ứng dụng đặt độ chính xác phát hiện lên hàng đầu và chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện vật thể lớn: Các cảnh chủ yếu có vật thể cỡ trung bình đến lớn, trong đó cơ chế attention toàn cục của Transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Lợi thế của Ultralytics#

Lựa chọn model không chỉ dựa vào các chỉ số thô; hệ sinh thái phần mềm xung quanh đóng vai trò thiết yếu đối với năng suất của developer. Hệ sinh thái Ultralytics nổi tiếng nhờ tính dễ sử dụng, cung cấp API Python thống nhất giúp đơn giản hóa toàn bộ vòng đời machine learning.

Từ quản lý dataset đến huấn luyện phân tán, Ultralytics trừu tượng hóa phần lớn mã boilerplate phức tạp. Developer được hưởng lợi từ các trọng số đã huấn luyện sẵn, dễ dàng sử dụng và khả năng tích hợp liền mạch với các nền tảng như Hugging Face cùng các công cụ giám sát. Hệ sinh thái được duy trì tốt này đảm bảo phát triển tích cực, cập nhật thường xuyên và hỗ trợ cộng đồng vững chắc.

Ngoài ra, hiệu quả huấn luyện là đặc điểm nổi bật của các model Ultralytics YOLO. Các model này được tối ưu hóa cao để hội tụ nhanh và giảm mức sử dụng bộ nhớ trong quá trình huấn luyện, qua đó tăng tốc đáng kể các chu kỳ thử nghiệm so với những bộ phát hiện dựa trên Transformer như RTDETRv2.

Nhìn về phía trước: Sức mạnh của YOLO26#

YOLOv8 vẫn là một model mạnh mẽ, nhưng developer muốn sử dụng công nghệ tiên tiến nhất nên cân nhắc nâng cấp lên YOLO26, được phát hành vào tháng 1 năm 2026. YOLO26 định nghĩa lại công nghệ tiên tiến nhất với một số đổi mới mang tính đột phá:

  • Thiết kế đầu-cuối không cần NMS: Nhánh one-to-one tùy chọn của YOLO26 (nms=False) loại bỏ bước hậu xử lý Non-Maximum Suppression (NMS), giúp quy trình triển khai nhanh hơn và có tính xác định cao hơn.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp tinh gọn model, tăng khả năng tương thích với thiết bị biên và thiết bị công suất thấp.
  • Optimizer MuSGD: Tích hợp các đổi mới trong huấn luyện LLM, optimizer MuSGD đảm bảo quá trình huấn luyện ổn định hơn và hội tụ nhanh hơn.
  • Suy luận CPU nhanh hơn tới 43%: Được tối ưu hóa mạnh mẽ cho các môi trường không có GPU chuyên dụng.
  • ProgLoss + STAL: Progressive Loss và Small-Target-Aware Label Assignment cải thiện đáng kể khả năng nhận diện vật thể nhỏ, yếu tố quan trọng đối với ảnh hàng không và robot.

Các lựa chọn hiện đại khác đáng cân nhắc trong bộ sản phẩm Ultralytics gồm YOLO11, model mang lại hiệu năng ổn định cho các dự án hiện hữu, dù YOLO26 được khuyến nghị cho mọi triển khai mới.

Ví dụ mã: Huấn luyện và suy luận#

API đơn giản của Ultralytics cho phép bạn tải, huấn luyện và triển khai model chỉ với vài dòng mã Python. Hãy cài đặt PyTorch trước khi chạy ví dụ sau.

from ultralytics import YOLO

# Tải model YOLOv8 small đã được huấn luyện trước
model = YOLO("yolov8s.pt")

# Huấn luyện model trên dataset tùy chỉnh của bạn
# Huấn luyện tiết kiệm bộ nhớ cho phép sử dụng batch size lớn hơn
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)

# Chạy inference trên ảnh kiểm thử
results = model("https://ultralytics.com/images/bus.jpg")

# Hiển thị kết quả
results[0].show()

# Xuất model liền mạch để triển khai trên thiết bị biên
export_path = model.export(format="onnx")
Sẵn sàng triển khai

Ultralytics hỗ trợ xuất chỉ với một cú nhấp chuột sang nhiều định dạng, bao gồm ONNX, TensorRT và CoreML, giúp đơn giản hóa các tùy chọn triển khai model trên các kiến trúc phần cứng đa dạng.

Kết luận#

Cả YOLOv8 và RTDETRv2 đều có những tính năng nổi bật cho phát hiện vật thể theo thời gian thực. RTDETRv2 cho thấy sức mạnh của Transformer trong việc nắm bắt ngữ cảnh toàn cục, phù hợp với các tác vụ suy luận không gian phức tạp mà tốc độ suy luận và chi phí bộ nhớ không phải là những ràng buộc hàng đầu.

Tuy nhiên, với developer ưu tiên sự cân bằng vượt trội giữa tốc độ, độ chính xác và hiệu quả sử dụng tài nguyên, các model Ultralytics YOLO vẫn là lựa chọn tốt hơn. Thiết kế nhẹ của YOLOv8, cùng với tính dễ sử dụng vượt trội, khả năng linh hoạt trên nhiều tác vụ thị giác và hệ sinh thái mã nguồn mở phát triển mạnh, khiến model trở thành giải pháp phù hợp cho môi trường production có khả năng mở rộng. Với những ai muốn đạt hiệu năng biên cao nhất, YOLO26 mới ra mắt cung cấp hiệu quả không cần NMS vượt trội, tiếp tục dẫn đầu ngành.

Bình luận