Ultralytics YOLO27:

YOLOv8 và RTDETRv2#

Lĩnh vực thị giác máy tính không ngừng phát triển, với các kiến trúc mới liên tục mở rộng giới hạn của khả năng phát hiện đối tượng theo thời gian thực. Hai model nổi bật nhận được nhiều sự chú ý là Ultralytics YOLOv8 và RTDETRv2 của Baidu. Hướng dẫn này cung cấp một so sánh kỹ thuật toàn diện giữa hai model mạnh mẽ này, khám phá kiến trúc, các chỉ số hiệu năng và những kịch bản triển khai lý tưởng của chúng.

Tổng quan về YOLOv8#

Ultralytics YOLOv8 đánh dấu một cột mốc quan trọng trong dòng model YOLO (Bạn Chỉ Nhìn Một Lần). Model này kế thừa nhiều năm nghiên cứu nền tảng để mang lại tốc độ, độ chính xác và tính dễ sử dụng vượt trội cho nhiều tác vụ khác nhau.

Đặc điểm chính:

Kiến trúc và ưu điểm#

YOLOv8 giới thiệu một kiến trúc tinh gọn, tối ưu hóa cả quá trình trích xuất đặc trưng và hồi quy bounding box. Đây là một detector không sử dụng anchor, giúp đơn giản hóa prediction head và giảm số lượng điều chỉnh hyperparameter cần thiết trong quá trình huấn luyện. Kiến trúc này đảm bảo sự cân bằng hiệu năng tuyệt vời giữa tốc độ suy luận và độ chính xác trung bình (mAP), khiến model đặc biệt phù hợp để triển khai thực tế trên cả thiết bị edge và server đám mây.

Ngoài ra, YOLOv8 yêu cầu dung lượng bộ nhớ trong quá trình huấn luyện thấp hơn đáng kể so với các kiến trúc dựa trên Transformer. Điều này cho phép developer huấn luyện model trên GPU phổ thông dành cho người dùng mà không gặp lỗi hết bộ nhớ.

Tính linh hoạt#

Một trong những thế mạnh nổi bật của YOLOv8 là tính linh hoạt vốn có. Trong khi nhiều model chỉ tập trung vào bounding box, YOLOv8 hỗ trợ sẵn phát hiện đối tượng, phân đoạn instance, phân loại ảnh, ước lượng pose và phát hiện bounding box định hướng (OBB).

Tổng quan về RTDETRv2#

RTDETRv2 (Transformer phát hiện thời gian thực phiên bản 2) được xây dựng dựa trên RT-DETR nguyên bản, hướng đến việc đưa các cơ chế attention mạnh mẽ của Vision Transformer vào các ứng dụng phát hiện đối tượng theo thời gian thực.

Đặc điểm chính:

Kiến trúc và ưu điểm#

RTDETRv2 tận dụng kiến trúc lai kết hợp backbone Mạng nơ-ron tích chập (CNN) với cấu trúc encoder-decoder dựa trên Transformer. Điều này cho phép model nắm bắt các mối quan hệ không gian phức tạp và ngữ cảnh toàn cục thông qua các cơ chế self-attention. Bằng cách sử dụng một tập hợp chiến lược huấn luyện "bag-of-freebies", RTDETRv2 đạt được điểm mAP cạnh tranh trên các bộ dữ liệu benchmark tiêu chuẩn như bộ dữ liệu COCO.

Điểm yếu#

Mặc dù có độ chính xác cao, bản chất dựa trên Transformer của RTDETRv2 dẫn đến mức tiêu thụ bộ nhớ cao hơn và thời gian huấn luyện lâu hơn so với các kiến trúc CNN thuần túy. Transformer vốn yêu cầu nhiều VRAM hơn, khiến việc huấn luyện trên phần cứng hạn chế tài nguyên trở nên khó khăn. Ngoài ra, dù RTDETRv2 mạnh về phát hiện, model này thiếu tính linh hoạt đa tác vụ (chẳng hạn như pose và phân đoạn) vốn có trong hệ sinh thái Ultralytics.

Tìm hiểu thêm về RTDETRv2

So sánh hiệu năng#

Khi đánh giá model cho môi trường production, sự cân bằng giữa kích thước model, tốc độ suy luận và độ chính xác là yếu tố tối quan trọng. Bảng dưới đây cung cấp so sánh trực tiếp giữa các biến thể YOLOv8 và RTDETRv2.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Phần cứng và chỉ số

Tốc độ được đo bằng một instance Amazon EC2 P4d. Suy luận trên CPU sử dụng ONNX, trong khi tốc độ trên GPU được kiểm thử bằng TensorRT.

Các trường hợp sử dụng và khuyến nghị#

Việc lựa chọn giữa YOLOv8 và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.

Khi nào nên chọn YOLOv8#

YOLOv8 là lựa chọn phù hợp cho:

  • Triển khai đa tác vụ linh hoạt: Các dự án yêu cầu một model đã được kiểm chứng cho detection, segmentation, classificationpose estimation trong hệ sinh thái Ultralytics.
  • Hệ thống production đã ổn định: Các môi trường production hiện có đã được xây dựng trên kiến trúc YOLOv8 với pipeline triển khai ổn định và được kiểm thử kỹ lưỡng.
  • Hỗ trợ cộng đồng và hệ sinh thái rộng: Các ứng dụng hưởng lợi từ hệ thống tutorial phong phú, tích hợp bên thứ ba và nguồn tài nguyên cộng đồng tích cực của YOLOv8.

Khi nào nên chọn RT-DETR#

RT-DETR được khuyến nghị cho:

  • Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc transformer cho bài toán phát hiện đối tượng end-to-end không cần NMS.
  • Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng trong đó độ chính xác phát hiện là ưu tiên hàng đầu và có thể chấp nhận độ trễ suy luận cao hơn đôi chút.
  • Phát hiện đối tượng lớn: Các cảnh chủ yếu chứa đối tượng cỡ vừa đến lớn, trong đó cơ chế attention toàn cục của transformer mang lại lợi thế tự nhiên.

Khi nào nên chọn Ultralytics (YOLO26)#

Đối với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm developer:

  • Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
  • Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
  • Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.

Lợi thế của Ultralytics#

Việc lựa chọn model không chỉ dựa trên các chỉ số thô; hệ sinh thái phần mềm đi kèm đóng vai trò quan trọng đối với năng suất của developer. Hệ sinh thái Ultralytics nổi tiếng nhờ tính dễ sử dụng, cung cấp một API Python thống nhất giúp đơn giản hóa toàn bộ vòng đời machine learning.

Từ quản lý dataset đến huấn luyện phân tán, Ultralytics ẩn đi phần code boilerplate phức tạp. Developer được hưởng lợi từ các pretrained weight có sẵn và khả năng tích hợp liền mạch với những nền tảng như Hugging Face cùng các công cụ giám sát. Hệ sinh thái được duy trì tốt này đảm bảo quá trình phát triển tích cực, các bản cập nhật thường xuyên và sự hỗ trợ vững chắc từ cộng đồng.

Ngoài ra, hiệu quả huấn luyện là một đặc điểm nổi bật của các model YOLO của Ultralytics. Chúng được tối ưu cao để hội tụ nhanh và có footprint bộ nhớ thấp hơn trong quá trình huấn luyện, qua đó tăng tốc đáng kể các chu kỳ thử nghiệm so với những detector dựa trên Transformer như RTDETRv2.

Định hướng tương lai: Sức mạnh của YOLO26#

Mặc dù YOLOv8 vẫn là một model mạnh mẽ, các developer muốn tiếp cận công nghệ tiên tiến nhất nên cân nhắc nâng cấp lên YOLO26, được phát hành vào tháng 1 năm 2026. YOLO26 định nghĩa lại trạng thái tiên tiến nhất với một số cải tiến đột phá:

  • Thiết kế end-to-end không cần NMS: YOLO26 loại bỏ bước hậu xử lý Non-Maximum Suppression (NMS), mang lại quy trình triển khai nhanh hơn và có tính tất định cao hơn.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss giúp tinh gọn model để tăng khả năng tương thích với thiết bị edge và thiết bị công suất thấp.
  • Optimizer MuSGD: Tích hợp các cải tiến trong huấn luyện LLM, optimizer MuSGD đảm bảo các phiên huấn luyện ổn định hơn và hội tụ nhanh hơn.
  • Suy luận trên CPU nhanh hơn tới 43%: Được tối ưu mạnh cho các môi trường không có GPU chuyên dụng.
  • ProgLoss + STAL: Các hàm loss nâng cao này mang lại cải thiện đáng kể trong việc nhận diện đối tượng nhỏ, yếu tố quan trọng đối với ảnh chụp từ trên không và robotics.

Các lựa chọn hiện đại khác đáng khám phá trong bộ sản phẩm Ultralytics bao gồm YOLO11, cung cấp hiệu năng vững chắc cho các dự án legacy, dù YOLO26 được khuyến nghị cho mọi triển khai mới.

Ví dụ code: Training và suy luận#

Tính đơn giản của API Ultralytics đồng nghĩa với việc bạn có thể load, huấn luyện và deploy model chỉ bằng vài dòng code Python. Hãy đảm bảo bạn đã cài đặt PyTorch trước khi chạy ví dụ sau.

from ultralytics import YOLO

# Load a pretrained YOLOv8 small model
model = YOLO("yolov8s.pt")

# Train the model on your custom dataset
# Memory efficient training allows for larger batch sizes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)

# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")

# Display the results
results[0].show()

# Export seamlessly for edge deployment
export_path = model.export(format="onnx")
Sẵn sàng triển khai

Ultralytics hỗ trợ export một click sang nhiều format, bao gồm ONNX, TensorRT và CoreML, giúp đơn giản hóa các tùy chọn triển khai model trên nhiều kiến trúc phần cứng khác nhau.

Kết luận#

Cả YOLOv8 và RTDETRv2 đều cung cấp các khả năng hấp dẫn cho việc phát hiện đối tượng theo thời gian thực. RTDETRv2 cho thấy sức mạnh của Transformer trong việc nắm bắt ngữ cảnh toàn cục, khiến model phù hợp với các tác vụ suy luận không gian phức tạp, trong đó tốc độ suy luận và overhead bộ nhớ không phải là các ràng buộc chính.

Tuy nhiên, đối với các developer ưu tiên sự cân bằng xuất sắc giữa tốc độ, độ chính xác và hiệu quả tài nguyên, các model YOLO của Ultralytics vẫn là lựa chọn vượt trội. Bản chất nhẹ của YOLOv8, kết hợp với tính dễ sử dụng vượt trội, khả năng linh hoạt trên nhiều tác vụ thị giác và hệ sinh thái mã nguồn mở phát triển mạnh, khiến model trở thành giải pháp được ưu tiên cho các môi trường production có khả năng mở rộng. Với những ai tìm kiếm hiệu năng edge đỉnh cao, YOLO26 mới phát hành mang lại hiệu quả không cần NMS vượt trội, tiếp tục dẫn đầu ngành.

Bình luận