Ultralytics YOLO27:
Get Started

YOLOv7 và EfficientDet#

Lựa chọn kiến trúc mạng nơ-ron tối ưu là nền tảng của mọi dự án thị giác máy tính thành công. Hướng dẫn này cung cấp phần so sánh kỹ thuật chi tiết giữa hai model có vai trò quan trọng trong lịch sử kiến trúc phát hiện vật thể: YOLOv7 và EfficientDet. Bằng cách xem xét các cải tiến kiến trúc, phương pháp huấn luyện và kịch bản triển khai lý tưởng, nhà phát triển có thể đưa ra quyết định sáng suốt. Chúng ta cũng sẽ tìm hiểu cách những tiến bộ hiện đại, đặc biệt là Ultralytics YOLO26 mang tính đột phá, đã định hình lại công nghệ tiên tiến nhất hiện nay.

Nguồn gốc model và chi tiết kỹ thuật#

Cả hai model đều được phát triển bởi các nhóm nghiên cứu nổi tiếng và mang đến những tiến bộ đáng kể cho lĩnh vực machine learning.

YOLOv7

Tìm hiểu thêm về YOLOv7

EfficientDet

Tìm hiểu thêm về EfficientDet

Khác biệt kiến trúc và phân tích cân bằng#

Hiểu rõ những khác biệt cấu trúc cơ bản giữa các mạng này là yếu tố then chốt để triển khai model hiệu quả.

EfficientDet: Mở rộng hợp thành và BiFPN#

Được phát triển trong hệ sinh thái TensorFlow, EfficientDet giới thiệu phương pháp mở rộng quy mô model có cơ sở bài bản. Thay vì tùy tiện mở rộng chiều rộng hoặc chiều sâu của mạng, các nhà nghiên cứu Google sử dụng phương pháp mở rộng đồng bộ, điều chỉnh đồng đều độ phân giải, độ sâu và chiều rộng.

Ngoài ra, EfficientDet giới thiệu Mạng kim tự tháp đặc trưng hai chiều (BiFPN). Thành phần kiến trúc này cho phép hợp nhất đặc trưng đa tỷ lệ một cách dễ dàng và nhanh chóng.

Ưu điểm: Hiệu quả cao về số lượng tham số, đạt độ chính xác trung bình (mAP) cao với FLOPs thấp hơn nhiều model cùng thời. Nhược điểm: Phụ thuộc nhiều vào các chiến lược tìm kiếm AutoML cũ. Việc tích hợp vào quy trình làm việc PyTorch hiện đại, linh hoạt có thể phức tạp, và độ trễ trên thiết bị biên thường cao hơn dự kiến dù số FLOPs thấp.

YOLOv7: Tập hợp các thủ thuật miễn phí có thể huấn luyện#

YOLOv7 ưu tiên suy luận thời gian thực và tối ưu hóa huấn luyện. Model này giới thiệu khái niệm mạng tổng hợp lớp hiệu quả mở rộng (E-ELAN), cho phép model liên tục học các đặc trưng đa dạng hơn mà không làm hỏng đường đi gradient ban đầu. YOLOv7 cũng sử dụng kỹ thuật có tên “tập hợp các kỹ thuật miễn phí có thể huấn luyện”, giúp cải thiện đáng kể độ chính xác phát hiện mà không làm tăng chi phí suy luận.

Ưu điểm: Tốc độ xử lý vượt trội và độ trễ suy luận thấp, phù hợp với các luồng video FPS cao. Nhược điểm: Dù có năng lực cao, model vẫn phụ thuộc vào anchor box và cần Non-Maximum Suppression (NMS) trong quá trình hậu xử lý, điều này có thể tạo nút thắt độ trễ trong các cảnh đông đúc.

Lợi thế hệ sinh thái Ultralytics

Khi đánh giá model, hệ sinh thái xung quanh cũng quan trọng không kém kiến trúc. Ultralytics Platform tích hợp cung cấp API thống nhất, tài liệu đầy đủ và hỗ trợ tích cực từ cộng đồng. Môi trường thống nhất này đảm bảo mức sử dụng bộ nhớ khi huấn luyện thấp hơn so với các model Transformer cồng kềnh, hỗ trợ tạo mẫu nhanh và theo dõi thí nghiệm liền mạch.

Chỉ số hiệu năng và benchmark#

Bảng dưới đây đối chiếu các chỉ số hiệu năng chính, giúp nhà phát triển đánh giá sự đánh đổi giữa tốc độ, số lượng tham số và độ chính xác.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Như minh họa, dù EfficientDet-d7 đạt mAP cao, tốc độ TensorRT của model này thấp hơn đáng kể so với các biến thể YOLOv7, cho thấy ưu thế của YOLOv7 trong phát hiện vật thể thời gian thực được tăng tốc bằng GPU.

Quá trình phát triển của phát hiện vật thể: YOLO26#

Dù YOLOv7 và EfficientDet đã đặt nền móng quan trọng, lĩnh vực AI thị giác thay đổi nhanh chóng. Với các ứng dụng hiện đại đòi hỏi hiệu quả và độ chính xác ở mức cao nhất, chúng tôi đặc biệt khuyến nghị nâng cấp lên YOLO26, ra mắt vào tháng 1 năm 2026.

YOLO26 khắc phục những hạn chế vốn có của các thế hệ trước, mang đến tính linh hoạt chưa từng có trong phát hiện vật thể, phân đoạn đối tượng, phân loại ảnh và ước lượng tư thế.

Những cải tiến chính của YOLO26#

  • Thiết kế end-to-end không cần NMS: YOLO26 cung cấp head one-to-one tùy chọn (nms=False) bỏ qua bước hậu xử lý Non-Maximum Suppression (NMS). Kỹ thuật này lần đầu được tiên phong trong YOLOv10, giúp đơn giản hóa logic triển khai và đảm bảo thực thi ổn định với độ trễ thấp bất kể mật độ vật thể.
  • Loại bỏ DFL: Việc loại bỏ Distribution Focal Loss (DFL) giúp đơn giản hóa đáng kể kiến trúc model, tăng khả năng tương thích với các môi trường điện toán biên bị giới hạn tài nguyên nghiêm ngặt.
  • Suy luận CPU nhanh hơn đến 43%: Được tối ưu mạnh mẽ cho các môi trường không có GPU chuyên dụng, model phù hợp với phần cứng gọn nhẹ.
  • Bộ tối ưu MuSGD: Lấy cảm hứng từ các kỹ thuật của mô hình ngôn ngữ lớn (chẳng hạn như Kimi K2 của Moonshot AI), sự kết hợp giữa SGD và Muon này mang lại độ ổn định cấp LLM và khả năng hội tụ nhanh cho huấn luyện thị giác máy tính.
  • ProgLoss + STAL: Các hàm loss tiên tiến này cải thiện đáng kể khả năng nhận diện vật thể nhỏ, một tính năng quan trọng đối với ảnh chụp từ trên không và ứng dụng drone.
  • Cải tiến theo từng tác vụ: Bao gồm loss phân đoạn ngữ nghĩa và proto đa tỷ lệ cho các tác vụ phân đoạn, Ước lượng Log-Likelihood phần dư (RLE) cho tác vụ ước lượng tư thế phức tạp, cùng loss góc chuyên biệt được thiết kế để khắc phục vấn đề biên của Hộp giới hạn định hướng (OBB).

Đối với các nhóm hiện đang sử dụng hệ thống cũ, chuyển sang Ultralytics Platform mở ra quy trình làm việc tinh gọn, giúp dễ dàng huấn luyện và triển khai các model tiên tiến này. Nhà phát triển cũng có thể cân nhắc các phiên bản trước ổn định như YOLO11 và YOLOv8 tùy theo yêu cầu tương thích ngược cụ thể.

Huấn luyện tinh gọn và dễ sử dụng#

Một trong những đặc điểm nổi bật của các model Ultralytics là dễ sử dụng. Khác với quy trình thiết lập phức tạp, phụ thuộc vào nhiều thư viện của môi trường TensorFlow AutoML dành cho EfficientDet, Ultralytics cung cấp API đơn giản, mang phong cách Python.

Môi trường này giảm thiểu mức sử dụng bộ nhớ CUDA trong quá trình huấn luyện, đảm bảo xử lý hiệu quả cả các bộ dữ liệu lớn mà không gặp lỗi hết bộ nhớ (OOM), vốn thường thấy ở các kiến trúc dựa trên Transformer cồng kềnh.

Ví dụ mã: Bắt đầu với Ultralytics#

Đoạn mã sau minh họa cách nhà phát triển có thể tận dụng gói Ultralytics để dễ dàng huấn luyện model YOLO26 tiên tiến ngay sau khi cài đặt.

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model for object detection
model = YOLO("yolo26n.pt")

# Train the model effortlessly using the integrated Ultralytics ecosystem
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # GPU index; use device='cpu' to train on CPU
    batch=16,
)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the model for edge deployment (e.g., OpenVINO for CPU optimization)
model.export(format="openvino")
Xuất model để triển khai thực tế

Các model được huấn luyện qua API Ultralytics có thể được xuất ngay sang nhiều định dạng production như OpenVINO hoặc ONNX, đảm bảo thông lượng cao bất kể phần cứng mục tiêu.

Trường hợp sử dụng lý tưởng và ứng dụng thực tế#

Khi thiết kế giải pháp, việc khớp ưu điểm của model với trường hợp sử dụng cụ thể là điều thiết yếu.

Khi nào nên sử dụng EfficientDet#

EfficientDet vẫn là lựa chọn phù hợp cho nghiên cứu học thuật cũ hoặc các môi trường bị ràng buộc chặt chẽ với hệ sinh thái Google Cloud, nơi các thử nghiệm mở rộng quy mô đồng bộ là trọng tâm chính. Các biến thể nhỏ hơn (d0-d2) hữu ích khi dung lượng ổ đĩa bị giới hạn nghiêm ngặt.

Khi nào nên sử dụng YOLOv7#

YOLOv7 hoạt động xuất sắc trong các thiết lập cũ đòi hỏi hiệu năng cao, đặc biệt khi ưu tiên tích hợp PyTorch thay vì TensorFlow. Model này vẫn được triển khai rộng rãi trong:

  • Phân tích video: Xử lý luồng camera an ninh tốc độ khung hình cao trong môi trường có nhiều GPU tăng tốc.
  • Kiểm tra công nghiệp: Phát hiện lỗi trên dây chuyền lắp ráp sản xuất tốc độ cao.

Khi nào nên chọn YOLO26#

Với mọi lần triển khai mới, YOLO26 là lựa chọn được khuyến nghị hàng đầu. Sự cân bằng hiệu năng vượt trội và hệ sinh thái được duy trì tốt khiến model trở thành lựa chọn tối ưu cho:

  • Thành phố thông minh và quản lý giao thông: Thiết kế không cần NMS đảm bảo độ trễ suy luận ổn định, yếu tố quan trọng để điều phối giao thông theo thời gian thực.
  • Robot và hệ thống tự hành: Mức tăng ấn tượng 43% về tốc độ suy luận CPU đảm bảo các thuật toán điều hướng phản hồi nhanh trên thiết bị nhúng.
  • Giám sát nông nghiệp và trên không: Ứng dụng ProgLoss và STAL để xác định chính xác các vật thể nhỏ như cây trồng cụ thể hoặc động vật hoang dã từ ảnh chụp ở độ cao lớn.

Tóm lại, dù EfficientDet và YOLOv7 có giá trị trong việc cung cấp bối cảnh lịch sử và hữu ích cho một số lĩnh vực chuyên biệt, kỹ sư thị giác máy tính hiện đại sẽ phù hợp nhất với kiến trúc Ultralytics YOLO26, giúp giải quyết hiệu quả các nút thắt trước đây đồng thời mở rộng giới hạn của trí tuệ nhân tạo.

Người đóng góp

Bình luận