Ultralytics YOLO27:

YOLOv7 so với DAMO-YOLO#

Lĩnh vực phát hiện đối tượng theo thời gian thực không ngừng phát triển, khi các nhà nghiên cứu và kỹ sư nỗ lực tìm ra sự cân bằng tối ưu giữa tốc độ và độ chính xác. Trong phần so sánh kỹ thuật này, chúng ta sẽ phân tích chuyên sâu hai kiến trúc đáng chú ý từ năm 2022: YOLOv7DAMO-YOLO. Cả hai model đều giới thiệu những khái niệm mới cho cộng đồng thị giác máy tính, giải quyết các thách thức khác nhau trong huấn luyện model, thiết kế kiến trúc và triển khai.

Bối cảnh và Chi tiết Kỹ thuật của Model#

Trước khi đi sâu vào kiến trúc của chúng, việc hiểu rõ nguồn gốc của hai model này là rất cần thiết. Cả hai đều được phát triển bởi các nhóm nghiên cứu hàng đầu và giới thiệu những phương pháp tiên tiến nhằm mở rộng giới hạn của khả năng phát hiện đối tượng theo thời gian thực.

Chi tiết YOLOv7#

Được phát triển như một phần tiếp nối của dòng YOLO, YOLOv7 giới thiệu khái niệm "bag-of-freebies" có thể huấn luyện để cải thiện đáng kể độ chính xác mà không làm tăng chi phí suy luận.

Tìm hiểu thêm về YOLOv7

Chi tiết về DAMO-YOLO#

Được tạo ra bởi các nhà nghiên cứu tại Alibaba Group, DAMO-YOLO tập trung mạnh vào Tìm kiếm Kiến trúc Neural (NAS) và chưng cất tri thức nâng cao để xây dựng các model có hiệu suất cao trên nhiều loại phần cứng.

Tìm hiểu thêm về DAMO-YOLO

Các cải tiến về kiến trúc#

YOLOv7: Phân tích Đường dẫn Gradient và Tái tham số hóa#

YOLOv7 tập trung mạnh vào Mạng Tổng hợp Lớp Hiệu quả Mở rộng (E-ELAN). Các tác giả thiết kế E-ELAN bằng cách phân tích các đường dẫn gradient của mạng, đảm bảo mạng có thể liên tục học mà không làm suy giảm đường dẫn gradient ban đầu. Ngoài ra, YOLOv7 tận dụng hiệu quả việc tái tham số hóa model trong quá trình suy luận, hợp nhất liền mạch các lớp để giảm FLOPs và tăng tốc thời gian thực thi. Điều này giúp model có năng lực cao khi suy luận theo thời gian thực trên các GPU hiện đại.

DAMO-YOLO: Tìm kiếm Kiến trúc Neural và RepGFPN#

DAMO-YOLO khác biệt bằng cách tận dụng tối đa Neural Architecture Search (NAS) trong các ràng buộc về độ trễ. Phương pháp này sử dụng một framework gọi là MAE-NAS để khám phá các backbone tối ưu được thiết kế riêng cho phần cứng cụ thể, chẳng hạn như thiết bị di động hoặc các bộ gia tốc biên cụ thể. Đối với phần neck, phương pháp này giới thiệu một RepGFPN (Re-parameterized Generalized Feature Pyramid Network) hiệu quả và sử dụng thiết kế ZeroHead để giảm thiểu gánh nặng tính toán trong các head dự đoán.

Khác biệt trong Chưng cất Tri thức

Trong khi YOLOv7 dựa vào các tối ưu hóa kiến trúc nội tại mạnh mẽ, DAMO-YOLO phụ thuộc nhiều vào quy trình chưng cất tri thức đa giai đoạn phức tạp. Quy trình này yêu cầu huấn luyện một model teacher lớn để chưng cất tri thức vào một model student nhỏ hơn, có thể tốn nhiều tài nguyên tính toán trong giai đoạn huấn luyện.

So sánh hiệu năng và các chỉ số#

Khi so sánh các model này, điều quan trọng là phải xem xét mAP (Độ chính xác trung bình), tốc độ suy luận và độ phức tạp của model.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Bảng trên cho thấy YOLOv7 mở rộng tốt trong các bài toán yêu cầu độ chính xác cao (YOLOv7x), trong khi DAMO-YOLO cung cấp các model tiny được tối ưu hóa cao cho những môi trường bị giới hạn tài nguyên.

Hiệu quả training và yêu cầu bộ nhớ#

Một khác biệt lớn giữa hai kiến trúc nằm ở phương pháp huấn luyện. Việc DAMO-YOLO phụ thuộc vào chưng cất khiến quá trình huấn luyện model mới từ đầu hoặc fine-tune trên dataset thị giác máy tính tùy chỉnh thường đòi hỏi nhiều VRAM và thời gian tính toán GPU hơn đáng kể.

Ngược lại, các model được tích hợp trong hệ sinh thái Ultralytics, chẳng hạn như YOLOv7 và các phiên bản mới hơn, được tối ưu hóa mạnh cho yêu cầu bộ nhớ. Chúng cho phép developer sử dụng batch size lớn hơn trên phần cứng phổ thông mà không gặp lỗi hết bộ nhớ, từ đó đơn giản hóa quá trình theo dõi thí nghiệm và lặp.

Lợi thế của Ultralytics#

Mặc dù cả YOLOv7 và DAMO-YOLO đều cung cấp những tính năng hấp dẫn, việc triển khai model trong hệ sinh thái Ultralytics mang lại trải nghiệm developer vượt trội.

  • Dễ sử dụng: Package Python của Ultralytics cung cấp một API thống nhất và đơn giản. Bạn có thể nhanh chóng chuyển đổi giữa các kiến trúc model, bắt đầu vòng lặp huấn luyện hoặc chạy suy luận chỉ với vài dòng code.
  • Hệ sinh thái được duy trì tốt: Ultralytics thường xuyên cập nhật, đảm bảo khả năng tương thích native với các bản phát hành PyTorch mới nhất và driver CUDA. Hệ sinh thái này cũng đơn giản hóa việc export model sang các format như ONNX, TensorRTOpenVINO.
  • Tính linh hoạt: Không giống DAMO-YOLO, vốn chỉ là một model phát hiện đối tượng, hệ sinh thái Ultralytics hỗ trợ native nhiều tác vụ khác nhau. Các model thuộc dòng Ultralytics có thể thực hiện phát hiện bounding box tiêu chuẩn, ước tính tư thế, phân đoạn instanceBounding Box Định hướng (OBB).

Ví dụ Code: Bắt đầu Nhanh chóng#

Sau đây là cách bạn có thể dễ dàng load, huấn luyện và chạy suy luận bằng các model Ultralytics:

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model (or newer models like yolo26n.pt)
model = YOLO("yolov7.pt")

# Train the model on the COCO8 dataset with automated hyperparameter handling
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX format for deployment
model.export(format="onnx")
Export Model

Với Ultralytics, việc export các weight đã huấn luyện sang nhiều format được tăng tốc bằng phần cứng (như TensorRT hoặc CoreML) được thực hiện thông qua một argument duy nhất trong lệnh export, giúp tiết kiệm hàng giờ cấu hình script phức tạp.

Thế hệ tiếp theo: YOLO26#

Mặc dù YOLOv7 vẫn là một kiến trúc legacy mạnh mẽ, lĩnh vực này đã tiến bộ nhanh chóng. Đối với các triển khai mới, Ultralytics YOLO26 (phát hành vào tháng 1 năm 2026) là tiêu chuẩn được khuyến nghị, vượt trội hơn các thế hệ trước ở gần như mọi chỉ số.

  • Thiết kế End-to-End không cần NMS: Được tiên phong lần đầu trong YOLOv10, YOLO26 loại bỏ native bước hậu xử lý Triệt tiêu Cực đại Không tối đa (NMS). Điều này đảm bảo suy luận có tính quyết định với độ trễ cực thấp, yếu tố thiết yếu đối với robot và công nghệ xe tự lái.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật huấn luyện LLM tiên tiến (như Kimi K2 của Moonshot AI), optimizer lai này kết hợp SGD và Muon để mang lại quá trình huấn luyện ổn định cao và hội tụ nhanh hơn trên nhiều dataset.
  • Suy luận CPU nhanh hơn tới 43%: Bằng cách loại bỏ có chiến lược Distribution Focal Loss (DFL), YOLO26 cải thiện đáng kể hiệu suất trên các nền tảng edge computing và CPU.
  • ProgLoss + STAL: Các hàm loss tiên tiến này mang lại cải thiện đáng kể trong việc phát hiện các đối tượng nhỏ, khiến YOLO26 đặc biệt phù hợp với ảnh chụp từ trên không và hoạt động giám sát chi tiết.

Các trường hợp sử dụng lý tưởng#

Khi nào nên chọn DAMO-YOLO#

  • Nghiên cứu học thuật về NAS: Nếu tổ chức của bạn đầu tư mạnh vào việc nghiên cứu các phương pháp Tìm kiếm Kiến trúc Neural.
  • Độ trễ bị ràng buộc nghiêm ngặt trên phần cứng cụ thể: Nếu bạn có đủ tài nguyên để chạy các lượt tìm kiếm NAS toàn diện nhằm tìm ra backbone phù hợp cho một chip bộ tăng tốc AI tùy chỉnh.

Khi nào nên chọn YOLOv7#

  • Pipeline GPU hiện có: Dành cho các team đang duy trì pipeline production legacy được tối ưu sâu quanh kiến trúc E-ELAN cụ thể của YOLOv7 trên phần cứng NVIDIA cao cấp.

Tại sao nên Chuyển sang các Model Ultralytics Hiện đại (YOLO11 / YOLO26)#

Đối với phần lớn ứng dụng doanh nghiệp—từ phân tích bán lẻsản xuất thông minh đến y tế—các model Ultralytics hiện đại là lựa chọn không đối thủ. Việc tích hợp với Ultralytics Platform cung cấp một pipeline ML hoàn chỉnh, mang lại tính dễ sử dụng, tài liệu vượt trội, hỗ trợ cộng đồng vững chắc và tính linh hoạt đa tác vụ. Dù bạn đang theo dõi hàng tồn kho trên Raspberry Pi hay chạy các tác vụ phân tích nặng trên cloud, những model như YOLO26 đều mang lại sự cân bằng hiệu suất lý tưởng cho tương lai của thị giác máy tính.

Những người đóng góp

Bình luận