YOLO26 so với RTDETRv2#
Lĩnh vực thị giác máy tính không ngừng phát triển, đặt ra cho các kỹ sư một lựa chọn quan trọng: nên tận dụng Mạng nơ-ron tích chập (CNNs) được tối ưu hóa cao hay áp dụng các kiến trúc dựa trên Transformer mới hơn? Hai ứng viên nổi bật trong lĩnh vực này là Ultralytics YOLO26 tiên tiến và RTDETRv2 của Baidu. Cả hai model đều thúc đẩy giới hạn của bài toán phát hiện đối tượng theo thời gian thực, nhưng dựa trên những triết lý kiến trúc hoàn toàn khác nhau.
Hướng dẫn này phân tích chuyên sâu cả hai model, so sánh cấu trúc, các chỉ số hiệu năng và trường hợp sử dụng lý tưởng để giúp bạn chọn nền tảng phù hợp nhất cho dự án thị giác máy tính tiếp theo.
Ultralytics YOLO26: Đỉnh cao của AI thị giác ưu tiên edge#
Được phát triển bởi Ultralytics, YOLO26 đại diện cho một bước tiến thế hệ vượt bậc của dòng YOLO. Ra mắt vào tháng 1 năm 2026, model này được thiết kế chuyên biệt cho tốc độ, độ chính xác và khả năng triển khai liền mạch trên môi trường cloud và edge.
- Tác giả: Glenn Jocher và Jing Qiu
- Tổ chức: Ultralytics
- Ngày: 2026-01-14
- GitHub: Kho lưu trữ Ultralytics
- Tài liệu: Tài liệu chính thức về YOLO26
Đổi mới và ưu điểm về kiến trúc#
YOLO26 giới thiệu một số tính năng đột phá giúp model khác biệt không chỉ với các model Transformer mà còn với những phiên bản trước như YOLO11:
- Thiết kế end-to-end không cần NMS: YOLO26 loại bỏ bước Loại bỏ cực đại không tối đa (NMS) truyền thống trong quá trình hậu xử lý. Cách tiếp cận end-to-end nguyên bản này, tiên phong trong các model như YOLOv10, làm giảm biến thiên độ trễ suy luận và đơn giản hóa logic triển khai, đặc biệt trên phần cứng edge.
- Suy luận CPU nhanh hơn tới 43%: Nhận thấy nhu cầu ngày càng tăng đối với AI phi tập trung, YOLO26 được tối ưu hóa cao cho các thiết bị không có GPU chuyên dụng, chẳng hạn như Raspberry Pi.
- Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss (DFL), YOLO26 cung cấp quy trình export đơn giản hơn và khả năng tương thích được cải thiện đáng kể với các thiết bị edge công suất thấp và vi điều khiển.
- Optimizer MuSGD: Thu hẹp khoảng cách giữa quá trình huấn luyện Mô hình ngôn ngữ lớn (LLM) và thị giác máy tính, YOLO26 sử dụng optimizer MuSGD. Sự kết hợp giữa SGD và Muon — lấy cảm hứng từ Kimi K2 của Moonshot AI — đảm bảo quá trình huấn luyện ổn định và hội tụ nhanh hơn.
- ProgLoss + STAL: Các hàm loss nâng cao mang lại cải thiện đáng kể trong nhận dạng đối tượng nhỏ. Đây là yếu tố quan trọng đối với các ngành dựa vào phân tích ảnh chụp từ trên không và cảm biến Internet vạn vật (IoT).
Tính đa dụng trên các tác vụ thị giác#
Khác với các model bị giới hạn nghiêm ngặt ở bounding box, YOLO26 là một nền tảng đa năng mạnh mẽ. Model này tích hợp các cải tiến theo từng task, chẳng hạn như loss phân đoạn ngữ nghĩa và proto đa tỷ lệ cho phân đoạn instance, Residual Log-Likelihood Estimation (RLE) cho ước tính tư thế, cùng angle loss chuyên biệt để giải quyết các vấn đề ở ranh giới trong các task Hộp giới hạn định hướng (OBB).
RTDETRv2: Nâng cao các Transformer phát hiện theo thời gian thực#
RTDETRv2, được phát triển bởi các nhà nghiên cứu tại Baidu, xây dựng dựa trên framework RT-DETR ban đầu. Model này hướng tới việc chứng minh rằng các Transformer phát hiện (DETRs) có thể cạnh tranh, và đôi khi vượt qua, tốc độ cũng như độ chính xác của các CNN được tối ưu hóa cao trong các kịch bản thời gian thực.
- Tác giả: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang và Yi Liu
- Tổ chức: Baidu
- Ngày: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Triển khai PyTorch của RTDETRv2
- Tài liệu: README RTDETRv2
Kiến trúc và khả năng#
RTDETRv2 sử dụng kiến trúc dựa trên Transformer, vốn xử lý hình ảnh khác biệt về bản chất so với CNN bằng cách tận dụng các cơ chế self-attention để nắm bắt ngữ cảnh toàn cục.
- Bag-of-Freebies: Phiên bản v2 giới thiệu một loạt kỹ thuật huấn luyện được tối ưu hóa (bag-of-freebies), giúp cải thiện hiệu năng cơ sở mà không làm tăng chi phí suy luận.
- Nhận biết ngữ cảnh toàn cục: Nhờ các layer attention của Transformer, RTDETRv2 vốn có khả năng nắm bắt các cảnh phức tạp, trong đó ngữ cảnh toàn cục là yếu tố cần thiết để phân biệt các đối tượng chồng lấn hoặc bị che khuất.
Hạn chế của các model Transformer#
Mặc dù mạnh mẽ, các model phát hiện dựa trên Transformer như RTDETRv2 thường gặp thách thức khi triển khai thực tế. Nhìn chung, chúng yêu cầu nhiều bộ nhớ CUDA hơn trong quá trình huấn luyện so với các CNN hiệu quả. Ngoài ra, việc tích hợp chúng vào các môi trường edge đa dạng có thể phức tạp do các phép toán phức tạp mà các layer attention yêu cầu, khiến những model như YOLO26 hấp dẫn hơn nhiều đối với các bài toán triển khai bị giới hạn tài nguyên.
So sánh hiệu năng#
Đánh giá trực tiếp các model này cho thấy những lợi ích rõ rệt của các tối ưu hóa CNN mới nhất. Bảng dưới đây trình bày hiệu năng của chúng trên các benchmark tiêu chuẩn.
| Model | kích thước (pixel) | mAPval 50-95 | Tốc độ CPU ONNX (ms) | Tốc độ T4 TensorRT10 (ms) | tham số (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Như đã thể hiện, YOLO26 luôn vượt trội hơn RTDETRv2 trên tất cả biến thể kích thước. YOLO26x đạt 57.5 mAP ấn tượng với độ trễ thấp hơn (11.8 ms trên TensorRT) và số lượng parameter ít hơn đáng kể (55.7M) so với RTDETRv2-x (54.3 mAP, 15.03 ms, 76M parameter).
Các trường hợp sử dụng và khuyến nghị#
Việc lựa chọn giữa YOLO26 và RT-DETR phụ thuộc vào yêu cầu cụ thể của dự án, các ràng buộc triển khai và ưu tiên về hệ sinh thái của bạn.
Khi nào nên chọn YOLO26#
YOLO26 là lựa chọn phù hợp cho:
- Triển khai edge không cần NMS: Các ứng dụng yêu cầu suy luận nhất quán, độ trễ thấp mà không có sự phức tạp của bước hậu xử lý triệt tiêu cực đại.
- Môi trường chỉ sử dụng CPU: Các thiết bị không có tăng tốc GPU chuyên dụng, nơi khả năng suy luận trên CPU nhanh hơn tới 43% của YOLO26 mang lại lợi thế quyết định.
- Phát hiện đối tượng nhỏ: Các kịch bản đầy thách thức như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác trên các đối tượng rất nhỏ.
Khi nào nên chọn RT-DETR#
RT-DETR được khuyến nghị cho:
- Nghiên cứu phát hiện dựa trên Transformer: Các dự án nghiên cứu cơ chế attention và kiến trúc transformer cho bài toán phát hiện đối tượng end-to-end không cần NMS.
- Các kịch bản độ chính xác cao với độ trễ linh hoạt: Các ứng dụng trong đó độ chính xác phát hiện là ưu tiên hàng đầu và có thể chấp nhận độ trễ suy luận cao hơn đôi chút.
- Phát hiện đối tượng lớn: Các cảnh chủ yếu chứa đối tượng cỡ vừa đến lớn, trong đó cơ chế attention toàn cục của transformer mang lại lợi thế tự nhiên.
Lợi thế của Ultralytics#
Lựa chọn đúng kiến trúc machine learning chỉ là một phần của bài toán; hệ sinh thái xung quanh quyết định tốc độ một team có thể chuyển từ giai đoạn thử nghiệm nguyên mẫu sang production.
Tính dễ sử dụng và hiệu quả huấn luyện#
Ultralytics Python API mang đến trải nghiệm được tinh gọn đáng kể. Việc huấn luyện các model phức tạp không còn đòi hỏi nhiều boilerplate code. Hơn nữa, hiệu quả huấn luyện của YOLO26 tốt hơn đáng kể, sử dụng ít GPU VRAM hơn nhiều so với các cơ chế attention tiêu tốn bộ nhớ của RTDETRv2, cho phép sử dụng batch size lớn hơn ngay cả trên phần cứng phổ thông.
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX for seamless deployment
model.export(format="onnx")Hệ sinh thái được duy trì tốt#
Bằng cách sử dụng các model Ultralytics, developer có quyền truy cập vào một framework được duy trì tích cực, tích hợp nguyên bản với các công cụ tracking hiện đại như Weights & Biases và Comet ML. Đối với những người ưu tiên phương pháp không cần code, Ultralytics Platform hỗ trợ huấn luyện trên cloud, quản lý dataset và triển khai chỉ với một cú nhấp chuột.
Cân bằng hiệu năng#
YOLO26 đạt được sự cân bằng vượt trội giữa tốc độ suy luận và độ chính xác. Việc loại bỏ NMS kết hợp với optimizer MuSGD đảm bảo bạn triển khai một model vừa có độ chính xác cao trên các đối tượng nhỏ (nhờ ProgLoss + STAL), vừa cực kỳ nhanh trong production, khiến đây trở thành lựa chọn tốt hơn cho hầu hết ứng dụng thị giác máy tính hiện đại.
Các model khác trong hệ sinh thái#
Mặc dù YOLO26 và RTDETRv2 đại diện cho công nghệ tiên tiến trong lĩnh vực phát hiện thời gian thực, các developer duy trì pipeline legacy hoặc khám phá những mức cân bằng hiệu quả khác nhau cũng có thể cân nhắc YOLOv8 cho các môi trường enterprise đã được thiết lập, hoặc khám phá các kiến trúc khác như EfficientDet. Tuy nhiên, đối với mọi sáng kiến mới, YOLO26 là khuyến nghị hàng đầu.