Ultralytics YOLO27:
Get Started

YOLOv7 so với RTDETRv2#

Lĩnh vực thị giác máy tính tiếp tục phát triển nhanh chóng, chịu ảnh hưởng lớn từ sự cạnh tranh giữa Mạng nơ-ron tích chập (CNNs) và Vision Transformer (ViTs). Bài so sánh kỹ thuật này đi sâu vào hai kiến trúc nổi bật: YOLOv7, model phát hiện đối tượng dựa trên CNN được tối ưu hóa cao, và RTDETRv2, Transformer phát hiện thời gian thực tiên tiến nhất.

Bằng cách phân tích khác biệt về kiến trúc, các chỉ số hiệu năng và kịch bản triển khai lý tưởng, developer có thể đưa ra quyết định sáng suốt khi tích hợp các model AI thị giác này vào pipeline production.

YOLOv7: Kiến trúc CNN với Bag-of-Freebies#

YOLOv7 giới thiệu một số tối ưu hóa cấu trúc mang tính đột phá cho họ YOLO truyền thống, đẩy giới hạn phát hiện đối tượng thời gian thực thông qua một loạt "bag-of-freebies" có thể huấn luyện.

Đặc điểm chính:

Kiến trúc và ưu điểm#

YOLOv7 phát huy hiệu quả nhờ kiến trúc Mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN). Thiết kế cấu trúc này cho phép model học các đặc trưng đa dạng hơn mà không phá vỡ đường gradient ban đầu. Ngoài ra, model tích hợp các phép tích chập tái tham số hóa được lên kế hoạch, giúp tối ưu tốc độ inference mà không làm giảm độ chính xác. Phương pháp bag-of-freebies có thể huấn luyện giúp đạt được sự đánh đổi ấn tượng giữa tốc độ và độ chính xác, khiến YOLOv7 rất phù hợp cho các tác vụ phát hiện đối tượng thời gian thực trên GPU cấp máy chủ.

YOLOv7 cũng rất linh hoạt. Ngoài phát hiện bbox tiêu chuẩn, kho lưu trữ còn có các nhánh dành cho ước lượng pose và phân đoạn instance, cho thấy khả năng thích ứng của model.

Hạn chế#

Giống nhiều model CNN đời cũ, YOLOv7 dựa vào Non-Maximum Suppression (NMS) để hậu xử lý. NMS gây ra độ trễ biến thiên, đặc biệt trong các cảnh đông đúc, khiến việc đảm bảo thời gian thực nghiêm ngặt trên thiết bị edge trở nên phức tạp.

Tìm hiểu thêm về YOLOv7

RTDETRv2: Thúc đẩy Transformer thời gian thực#

RTDETRv2 được phát triển dựa trên framework RT-DETR ban đầu, tiếp tục khẳng định rằng Transformer có thể cạnh tranh với kiến trúc YOLO về độ trễ thời gian thực mà vẫn duy trì độ chính xác không gian cao.

Đặc điểm chính:

Kiến trúc và ưu điểm#

RTDETRv2 đánh dấu bước tiến đáng kể cho Vision Transformer. Model tận dụng quy trình chọn query linh hoạt và encoder lai hiệu quả để xử lý nhanh các đặc trưng đa tỷ lệ. Bằng cách giới thiệu một "bag-of-freebies" mới được thiết kế riêng cho Transformer phát hiện (DETR), model đẩy khả năng suy luận không gian đến giới hạn. Do không cần NMS ngay từ đầu, model cung cấp thời gian inference xác định, một tính năng thiết yếu cho các ứng dụng thành phố thông minh và xe tự hành đòi hỏi độ tin cậy cao.

Hạn chế#

Bất chấp những tiến bộ, RTDETRv2 vẫn mang theo các hạn chế truyền thống của kiến trúc dựa trên Transformer. Model đòi hỏi nhiều bộ nhớ CUDA hơn đáng kể trong cả quá trình huấn luyện lẫn inference so với CNN. Ngoài ra, thời gian hội tụ khi huấn luyện dài hơn rõ rệt, đòi hỏi lượng lớn dữ liệu gán nhãn chất lượng cao (chẳng hạn dataset COCO) cùng tài nguyên tính toán mạnh.

Tìm hiểu thêm về RTDETRv2

So sánh hiệu năng#

Khi benchmark các model này, cần xem xét tổng thể độ chính xác, tốc độ inference thực tế và mức tiêu thụ tài nguyên tính toán. Dưới đây là bảng so sánh trực tiếp.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Diễn giải kết quả benchmark

RTDETRv2-x tuyên bố đạt mAPval cao nhất tuyệt đối ở mức 54.3%, nhưng cần tới 259 tỷ FLOPs. Ngược lại, kiến trúc YOLOv7 cung cấp baseline xuất sắc nhưng chịu ảnh hưởng từ overhead NMS của thế hệ cũ, vốn không được phản ánh đầy đủ trong các chỉ số độ trễ thuần của mạng.

Lợi thế Ultralytics: Hệ sinh thái và sự phát triển#

Dù YOLOv7 và RTDETRv2 có năng lực mạnh mẽ, việc triển khai chúng trong môi trường production thường bộc lộ những trở ngại về vận hành. Đây là điểm mạnh của hệ sinh thái Ultralytics. Được thiết kế để tích hợp end-to-end liền mạch, framework Ultralytics cung cấp cho developer một API thống nhất, giúp loại bỏ các phức tạp thường gặp trong pipeline thị giác máy tính.

Tính linh hoạt vượt trội và hiệu quả bộ nhớ#

Không giống các model Transformer cứng nhắc tiêu thụ lượng VRAM khổng lồ, model Ultralytics YOLO duy trì hiệu quả bộ nhớ nghiêm ngặt. Điều này cho phép huấn luyện model nhanh chóng trên phần cứng phổ biến. Hệ sinh thái vốn hỗ trợ nhiều tác vụ thị giác máy tính từ một codebase duy nhất, bao gồm phân loại ảnh và phát hiện hộp giới hạn xoay (OBB), mang lại sự linh hoạt mà RTDETRv2 hiện chưa có.

Triển khai liền mạch#

Đưa nghiên cứu vào production đòi hỏi các tùy chọn triển khai mạnh mẽ. API Ultralytics hỗ trợ xuất model chỉ bằng một cú nhấp sang các định dạng tiêu chuẩn ngành. Dù bạn nhắm đến ONNX để đảm bảo tương thích đa nền tảng hay TensorRT để tối đa hóa khả năng tăng tốc GPU, pipeline đều được tự động hóa hoàn toàn và đáng tin cậy.

Bản nâng cấp tối ưu: Ultralytics YOLO26#

Với developer đang cân nhắc giữa YOLOv7 và RTDETRv2, hướng đi tối ưu thực chất là tiêu chuẩn mới trong AI thị giác: Ultralytics YOLO26. Được phát hành vào tháng 1 năm 2026, YOLO26 thu hẹp khoảng cách giữa tốc độ của CNN và khả năng suy luận tinh vi của Transformer, đồng thời loại bỏ hoàn toàn các điểm yếu tương ứng.

YOLO26 giới thiệu những cải tiến đột phá, phù hợp cho cả triển khai trên máy chủ lẫn thiết bị edge:

  • Thiết kế end-to-end không cần NMS: Được tiên phong lần đầu trong YOLOv10, YOLO26 cung cấp head gốc không cần NMS (nms=False), loại bỏ bước hậu xử lý NMS. Điều này đảm bảo độ trễ xác định như RTDETRv2 mà không phải chịu overhead tính toán nặng nề của Transformer.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện mô hình ngôn ngữ lớn (chẳng hạn Kimi K2 của Moonshot AI), YOLO26 sử dụng phương pháp lai giữa SGD và Muon. Phương pháp này mang lại độ ổn định huấn luyện chưa từng có và thời gian hội tụ nhanh hơn đáng kể so với các cách triển khai AdamW tiêu chuẩn được ViT sử dụng.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, cạnh tranh trực tiếp với lợi thế đặc trưng đa tỷ lệ của RTDETRv2, yếu tố quan trọng đối với tự động hóa robot.
  • Tối ưu edge và loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss (DFL), YOLO26 tinh gọn head đầu ra, giúp inference CPU nhanh hơn tới 43%—từ đó dễ triển khai trên thiết bị edge hơn rất nhiều so với các model Transformer nặng.

Ví dụ huấn luyện với Ultralytics#

Python API đơn giản của Ultralytics cho phép bạn huấn luyện model YOLO26 tiên tiến nhất chỉ với vài dòng code:

from ultralytics import YOLO

# Tải model YOLO26 cỡ nhỏ có hiệu quả cao
model = YOLO("yolo26s.pt")

# Huấn luyện model trên bộ dữ liệu COCO8
# Framework tự động quản lý tăng cường dữ liệu và lựa chọn optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Dễ dàng xuất sang TensorRT để triển khai
model.export(format="engine", dynamic=True)

Các trường hợp sử dụng phù hợp nhất#

Việc chọn kiến trúc phù hợp phụ thuộc nhiều vào các ràng buộc triển khai và khả năng tiếp cận phần cứng:

Khi nào nên cân nhắc YOLOv7:

  • Các dự án nghiên cứu cũ sử dụng YOLOv7 làm baseline đã được xác lập.
  • Môi trường có sẵn khả năng tăng tốc GPU mạnh và chấp nhận được độ dao động độ trễ NMS.

Khi nào nên cân nhắc RTDETRv2:

  • Triển khai trên máy chủ cao cấp cần mAP tối đa tuyệt đối.
  • Các tình huống bắt buộc phải có độ trễ inference xác định (không cần NMS), với điều kiện bạn có đủ VRAM để hỗ trợ backbone Transformer.

Khi nào nên chọn Ultralytics YOLO26:

  • Gần như luôn luôn. Model mang lại khả năng xác định độ trễ không cần NMS của RTDETRv2, vượt qua YOLOv7 về tốc độ và độ chính xác, sử dụng ít VRAM hơn đáng kể, đồng thời được tích hợp đầy đủ vào Ultralytics Platform để quản lý dataset, huấn luyện và triển khai dễ dàng.
Khám phá thêm các model

Bạn muốn biết các kiến trúc khác so sánh ra sao? Hãy xem các bài phân tích chuyên sâu về những thế hệ trước như YOLO11 và YOLOv8, hoặc tìm hiểu cách tận dụng tinh chỉnh siêu tham số để tối đa hóa độ chính xác cho dự án.

Bình luận