Ultralytics YOLO27:
Get Started

DAMO-YOLO và YOLO11#

Khi chọn kiến trúc phát hiện đối tượng theo thời gian thực cho dự án thị giác máy tính tiếp theo, việc hiểu rõ những khác biệt tinh tế giữa các model hàng đầu là rất quan trọng. Hướng dẫn toàn diện này cung cấp phân tích kỹ thuật chuyên sâu, so sánh DAMO-YOLO với Ultralytics YOLO11, đồng thời tìm hiểu kiến trúc, chỉ số hiệu năng, phương pháp huấn luyện và các kịch bản triển khai thực tế phù hợp.

Thông tin về DAMO-YOLO:

Thông tin YOLO11:

Triết lý thiết kế kiến trúc#

Kiến trúc nền tảng của một model phát hiện đối tượng quyết định tốc độ suy luận, độ chính xác và khả năng thích ứng trên nhiều môi trường phần cứng.

DAMO-YOLO giới thiệu một số cải tiến học thuật, chủ yếu dựa vào Tìm kiếm kiến trúc mạng (NAS) để tự động thiết kế backbone. Model sử dụng RepGFPN (Mạng tháp đặc trưng tổng quát được tái tham số hóa) hiệu quả nhằm tăng cường hợp nhất đặc trưng, cùng thiết kế ZeroHead giúp giảm đáng kể quy mô của head dự đoán nặng thường thấy ở các kiến trúc trước đây. Dù phương pháp dựa trên NAS này giúp DAMO-YOLO đạt hiệu quả nhất định trên một số GPU được chọn, các kiến trúc tạo ra đôi khi thiếu tính linh hoạt cần thiết để tổng quát hóa liền mạch trên nhiều thiết bị edge khác nhau.

Ngược lại, YOLO11 kế thừa nhiều năm nghiên cứu nền tảng để mang lại kiến trúc được thiết kế thủ công và tối ưu cao. Model tập trung vào backbone tinh gọn và neck hiệu quả cao, giúp giảm các phép tính dư thừa. Một trong những ưu điểm chính của YOLO11 là hiệu quả tham số được cải thiện; model đạt khả năng biểu diễn đặc trưng cao mà không cần dung lượng VRAM lớn như các model dựa trên Transformer, chẳng hạn RT-DETR. Nhờ vậy, YOLO11 cực kỳ linh hoạt, có thể chạy mượt mà trên GPU phổ thông, thiết bị di động và bộ tăng tốc edge chuyên dụng.

Hiệu năng và các chỉ số#

Đánh giá hiệu năng cần xem xét nhiều hơn độ chính xác tổng thể, bao gồm sự cân bằng giữa tốc độ, kích thước model và tải tính toán (FLOPs).

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Như bảng cho thấy, YOLO11 đạt được sự cân bằng hiệu năng rất thuận lợi. Chẳng hạn, biến thể YOLO11s có độ chính xác cao hơn DAMO-YOLOs trong khi số lượng tham số nhỏ hơn đáng kể. Việc giảm yêu cầu bộ nhớ này trực tiếp giúp giảm chi phí triển khai và cải thiện hiệu năng linh hoạt hơn trên các thiết bị edge.

Phương pháp huấn luyện và tính dễ sử dụng#

Nhà phát triển dành phần lớn thời gian cho pipeline huấn luyện, vì vậy hiệu quả huấn luyện là mối quan tâm hàng đầu.

DAMO-YOLO sử dụng quy trình huấn luyện nhiều giai đoạn, phụ thuộc nhiều vào chưng cất tri thức. Model dùng AlignedOTA (Gán nhãn bằng vận chuyển tối ưu) để gán nhãn và thường yêu cầu huấn luyện một model "teacher" lớn hơn để chắt lọc tri thức sang các model "student" nhỏ hơn. Phương pháp này làm tăng đáng kể mức sử dụng bộ nhớ CUDA và tổng thời gian tính toán cần thiết để đạt hội tụ tối ưu.

Ngược lại, hệ sinh thái Ultralytics giúp loại bỏ sự phức tạp trong quá trình huấn luyện model. YOLO11 được thiết kế để dễ sử dụng vượt trội, với Python API tinh gọn và giao diện CLI toàn diện, cho phép kỹ sư bắt đầu huấn luyện trên tập dữ liệu tùy chỉnh chỉ bằng một lệnh. Pipeline huấn luyện vốn tiết kiệm tài nguyên, giảm thiểu các đột biến sử dụng bộ nhớ để ngay cả những model lớn hơn cũng có thể được huấn luyện trên phần cứng tiêu chuẩn.

Tinh gọn quy trình huấn luyện với Ultralytics

Huấn luyện model Ultralytics không cần viết mã khung sườn. Các pipeline tải dữ liệu, tăng cường dữ liệu và tính loss tích hợp đều được tối ưu sẵn.

Sau đây là ví dụ nhanh cho thấy việc huấn luyện và triển khai model Ultralytics đơn giản như thế nào:

from ultralytics import YOLO

# Tải model YOLO11 cỡ nhỏ đã được huấn luyện trước
model = YOLO("yolo11s.pt")

# Huấn luyện model dễ dàng trên tập dữ liệu tùy chỉnh
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Xuất model đã huấn luyện sang ONNX để triển khai liền mạch
model.export(format="onnx")

Tìm hiểu thêm về YOLO11

Ứng dụng thực tế và tính linh hoạt#

Việc lựa chọn giữa các kiến trúc này thường phụ thuộc vào phạm vi tác vụ mà môi trường triển khai yêu cầu.

DAMO-YOLO phù hợp với trường hợp nào#

DAMO-YOLO chỉ là framework phát hiện đối tượng. Model phát huy hiệu quả trong môi trường nghiên cứu học thuật, nơi các nhóm tìm hiểu về tái tham số hóa hoặc tái hiện những thử nghiệm Tìm kiếm kiến trúc mạng cụ thể. Model cũng có thể được triển khai trong các môi trường công nghiệp bị giới hạn chặt chẽ, nơi một bộ tăng tốc GPU cụ thể tương thích hoàn hảo với backbone do NAS tạo ra.

Lợi thế của Ultralytics#

Các model Ultralytics, bao gồm YOLO11, nổi bật trong các ứng dụng thương mại thực tế nhờ tính linh hoạt vượt trội và hệ sinh thái được duy trì tốt. Không giống DAMO-YOLO, framework Ultralytics hỗ trợ sẵn nhiều tác vụ. Từ phân đoạn đối tượng riêng lẻ trong chẩn đoán hình ảnh y tế đến ước tính tư thế để phân tích cơ sinh học trong thể thao, một codebase thống nhất có thể xử lý tất cả.

Các ngành ứng dụng YOLO11 bao gồm:

  • Nông nghiệp thông minh: Sử dụng phát hiện đối tượng để theo dõi sức khỏe cây trồng và tự động hóa máy móc thu hoạch.
  • Phân tích bán lẻ: Triển khai giám sát thông minh để phân tích lưu lượng khách hàng và tự động hóa quản lý hàng tồn kho.
  • Logistics và chuỗi cung ứng: Phát hiện mã vạch và gói hàng tốc độ cao bằng hộp giới hạn định hướng (OBB) trên các băng chuyền chuyển động nhanh.

Trường hợp sử dụng và khuyến nghị#

Việc chọn DAMO-YOLO hay YOLO11 phụ thuộc vào yêu cầu cụ thể của dự án, giới hạn triển khai và lựa chọn hệ sinh thái của bạn.

Khi nào nên chọn DAMO-YOLO#

DAMO-YOLO là lựa chọn phù hợp cho:

  • Phân tích video thông lượng cao: Xử lý luồng video FPS cao trên hạ tầng GPU NVIDIA cố định, trong đó thông lượng batch-1 là chỉ số chính.
  • Dây chuyền sản xuất công nghiệp: Các kịch bản có yêu cầu nghiêm ngặt về độ trễ GPU trên phần cứng chuyên dụng, chẳng hạn như kiểm tra chất lượng thời gian thực trên dây chuyền lắp ráp.
  • Nghiên cứu Neural Architecture Search: Nghiên cứu ảnh hưởng của tìm kiếm kiến trúc tự động (MAE-NAS) và các backbone tái tham số hóa hiệu quả đến hiệu năng phát hiện.

Khi nào nên chọn YOLO11#

YOLO11 được khuyến nghị cho:

  • Triển khai biên trong môi trường production: Các ứng dụng thương mại trên thiết bị như Raspberry Pi hoặc NVIDIA Jetson, nơi độ tin cậy và hoạt động bảo trì liên tục là ưu tiên hàng đầu.
  • Ứng dụng thị giác đa nhiệm: Các dự án cần phát hiện, phân đoạn, ước tính tư thế và OBB trong một framework thống nhất.
  • Tạo mẫu và triển khai nhanh: Các nhóm cần nhanh chóng chuyển từ thu thập dữ liệu sang production bằng Ultralytics Python API tinh gọn.

Khi nào nên chọn Ultralytics (YOLO26)#

Với hầu hết dự án mới, Ultralytics YOLO26 mang đến sự kết hợp tốt nhất giữa hiệu năng và trải nghiệm dành cho nhà phát triển:

  • Triển khai trên thiết bị biên không cần NMS: Các ứng dụng cần inference có độ trễ thấp và ổn định mà không phải xử lý hậu kỳ Non-Maximum Suppression phức tạp.
  • Môi trường chỉ có CPU: Các thiết bị không có GPU tăng tốc chuyên dụng, nơi tốc độ CPU inference nhanh hơn đến 43% của YOLO26 mang lại lợi thế rõ rệt.
  • Phát hiện vật thể nhỏ: Các tình huống khó như ảnh chụp từ drone trên không hoặc phân tích cảm biến IoT, trong đó ProgLoss và STAL cải thiện đáng kể độ chính xác khi phát hiện vật thể rất nhỏ.

Thế hệ tiếp theo: Giới thiệu YOLO26#

Dù YOLO11 vẫn là lựa chọn mạnh mẽ và đáng tin cậy, lĩnh vực thị giác máy tính thay đổi rất nhanh. Với nhà phát triển bắt đầu dự án mới, model YOLO26 mới nhất đại diện cho công nghệ tiên tiến nhất hiện nay.

Ra mắt vào tháng 1 năm 2026, YOLO26 giới thiệu một số cải tiến đột phá:

  • Thiết kế end-to-end không cần NMS: Với head one-to-one tùy chọn (nms=False), YOLO26 bỏ qua bước hậu xử lý Non-Maximum Suppression, đảm bảo thời gian suy luận nhanh hơn, có tính xác định và đơn giản hóa đáng kể các pipeline triển khai.
  • Suy luận CPU nhanh hơn đến 43%: Nhờ loại bỏ Distribution Focal Loss (DFL), model đặc biệt phù hợp với thiết bị edge và thiết bị công suất thấp không có GPU chuyên dụng.
  • Optimizer MuSGD: Kết hợp các cải tiến trong huấn luyện LLM (lấy cảm hứng từ Moonshot AI), optimizer lai này đảm bảo hội tụ ổn định và nhanh chóng trong quá trình huấn luyện.
  • Các hàm loss nâng cao: Sử dụng ProgLoss + STAL, YOLO26 cải thiện đáng kể khả năng nhận diện đối tượng nhỏ, yếu tố thiết yếu trong ảnh chụp từ trên không và robot.

Kết luận#

Cả DAMO-YOLO và YOLO11 đều đóng góp đáng kể vào sự phát triển của thị giác máy tính nhanh và chính xác. DAMO-YOLO mang đến những góc nhìn học thuật thú vị về tìm kiếm kiến trúc và chưng cất, còn Ultralytics YOLO11 (và YOLO26 đột phá) mang lại trải nghiệm phát triển vượt trội.

Với yêu cầu bộ nhớ thấp hơn, tài liệu phong phú, khả năng xử lý nhiều tác vụ và tích hợp với Ultralytics Platform mạnh mẽ, các model Ultralytics vẫn là lựa chọn hàng đầu cho nhà nghiên cứu và kỹ sư doanh nghiệp muốn xây dựng giải pháp AI vững chắc, có khả năng mở rộng. Nếu muốn tìm hiểu các kiến trúc tiên tiến khác, việc so sánh YOLO26 với RT-DETR sẽ cung cấp thêm thông tin về các lựa chọn dựa trên Transformer.

Người đóng góp

Bình luận