Ultralytics YOLO27:

YOLOv7 so với EfficientDet#

Việc lựa chọn kiến trúc neural network tối ưu là nền tảng của mọi dự án thị giác máy tính thành công. Hướng dẫn này cung cấp so sánh kỹ thuật chi tiết giữa hai model quan trọng trong lịch sử kiến trúc phát hiện đối tượng: YOLOv7EfficientDet. Bằng cách xem xét các đổi mới về kiến trúc, phương pháp training và các kịch bản deployment lý tưởng, developer có thể đưa ra quyết định sáng suốt. Chúng ta cũng sẽ tìm hiểu cách những tiến bộ hiện đại, đặc biệt là Ultralytics YOLO26 mang tính đột phá, đã định nghĩa lại trạng thái tiên tiến hiện nay.

Nguồn gốc của Model và Chi tiết Kỹ thuật#

Cả hai model đều được phát triển bởi các nhóm nghiên cứu nổi bật và tạo ra những tiến bộ đáng kể trong lĩnh vực machine learning.

YOLOv7

Tìm hiểu thêm về YOLOv7

EfficientDet

Tìm hiểu thêm về EfficientDet

Khác biệt về Kiến trúc và Phân tích Cân bằng#

Hiểu rõ những khác biệt cấu trúc nền tảng giữa các network này là yếu tố then chốt để deployment model hiệu quả.

EfficientDet: Scaling hợp nhất và BiFPN#

Được phát triển trong hệ sinh thái TensorFlow, EfficientDet đã giới thiệu một phương pháp có cơ sở chặt chẽ để scale model. Thay vì tùy ý mở rộng chiều rộng hoặc chiều sâu của network, các nhà nghiên cứu Google đã sử dụng phương pháp compound scaling để scale đồng đều resolution, depth và width.

Ngoài ra, EfficientDet đã giới thiệu Bi-directional Feature Pyramid Network (BiFPN). Thành phần kiến trúc này cho phép fusion feature đa scale nhanh chóng và dễ dàng.

Ưu điểm: Hiệu quả cao về số lượng parameter, đạt mean Average Precision (mAP) tốt với số FLOPs ít hơn nhiều model cùng thời. Nhược điểm: Phụ thuộc nhiều vào các chiến lược tìm kiếm AutoML legacy. Việc tích hợp vào workflow PyTorch hiện đại, linh hoạt có thể phức tạp, và latency trên các edge device thường cao hơn dự kiến dù số FLOPs thấp.

YOLOv7: Bag-of-Freebies có thể huấn luyện#

YOLOv7 ưu tiên inference thời gian thực và tối ưu hóa training. Model này giới thiệu khái niệm extended efficient layer aggregation network (E-ELAN), cho phép model liên tục học các feature đa dạng hơn mà không phá hủy gradient path ban đầu. YOLOv7 cũng sử dụng kỹ thuật có tên "trainable bag-of-freebies", giúp cải thiện đáng kể độ chính xác detection mà không làm tăng chi phí inference.

Ưu điểm: Tốc độ xử lý vượt trội và inference latency thuận lợi, lý tưởng cho các luồng video có FPS cao. Nhược điểm: Dù có năng lực cao, model vẫn phụ thuộc vào anchor box và yêu cầu Non-Maximum Suppression (NMS) trong quá trình post-processing, điều này có thể tạo bottleneck latency trong các cảnh có mật độ đối tượng rất cao.

Lợi thế từ hệ sinh thái Ultralytics

Khi đánh giá model, hệ sinh thái xung quanh cũng quan trọng không kém kiến trúc. Ultralytics Platform tích hợp cung cấp API thống nhất, tài liệu phong phú và hỗ trợ tích cực từ cộng đồng. Môi trường thống nhất này đảm bảo mức sử dụng memory thấp hơn trong quá trình training so với các model Transformer nặng, đồng thời hỗ trợ prototyping nhanh và theo dõi experiment liền mạch.

Các chỉ số hiệu năng và benchmark#

Bảng dưới đây đối chiếu các metric hiệu năng chính, giúp developer đánh giá sự đánh đổi giữa tốc độ, số lượng parameter và độ chính xác.

Modelkích thước
(pixel)
mAPval
50-95
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Như đã thể hiện, mặc dù EfficientDet-d7 đạt mAP cao, tốc độ TensorRT của model này kém xa các biến thể YOLOv7, cho thấy ưu thế của YOLOv7 trong phát hiện đối tượng thời gian thực được tăng tốc bằng GPU.

Quá trình Tiến hóa của Phát hiện Đối tượng: YOLO26#

Mặc dù YOLOv7 và EfficientDet đã đặt nền móng quan trọng, lĩnh vực AI thị giác đang phát triển nhanh chóng. Đối với các ứng dụng hiện đại yêu cầu hiệu năng và độ chính xác ở mức cao nhất, chúng tôi đặc biệt khuyến nghị nâng cấp lên YOLO26, được phát hành vào tháng 1 năm 2026.

YOLO26 giải quyết các hạn chế vốn có của những thế hệ trước, mang đến tính linh hoạt chưa từng có trong phát hiện đối tượng, phân đoạn instance, phân loại hình ảnhước lượng pose.

Những đổi mới chính của YOLO26#

  • Thiết kế End-to-End không cần NMS: YOLO26 loại bỏ nguyên bản bước post-processing Non-Maximum Suppression (NMS). Được khởi xướng lần đầu trong YOLOv10, thiết kế này đơn giản hóa logic deployment và đảm bảo execution nhất quán với latency thấp bất kể mật độ đối tượng.
  • Loại bỏ DFL: Bằng cách loại bỏ Distribution Focal Loss (DFL), kiến trúc model được đơn giản hóa đáng kể, cải thiện khả năng tương thích với các môi trường edge computing có tài nguyên hạn chế nghiêm ngặt.
  • Inference trên CPU nhanh hơn tới 43%: Được tối ưu hóa mạnh cho các môi trường không có GPU chuyên dụng, giúp nhanh hơn đáng kể so với EfficientDet trên phần cứng nhẹ.
  • Optimizer MuSGD: Lấy cảm hứng từ các kỹ thuật của large language model (chẳng hạn Kimi K2 của Moonshot AI), sự kết hợp giữa SGD và Muon này mang lại độ ổn định cấp LLM và khả năng hội tụ nhanh cho training thị giác máy tính.
  • ProgLoss + STAL: Các loss function nâng cao này mang lại cải thiện đáng kể trong việc nhận diện đối tượng nhỏ, một tính năng quan trọng cho ảnh chụp từ trên khôngứng dụng drone.
  • Cải tiến theo từng Task: Bao gồm loss Semantic segmentation và multi-scale proto cho các task segmentation, Residual Log-Likelihood Estimation (RLE) cho Pose estimation phức tạp, cùng angle loss chuyên biệt để khắc phục các vấn đề về biên của Oriented Bounding Box (OBB).

Đối với các team hiện đang sử dụng system legacy, việc chuyển sang Ultralytics Platform mở khóa một workflow tinh gọn, trong đó các model tiên tiến này có thể được training và deployment dễ dàng. Developer cũng có thể khám phá các phiên bản mạnh mẽ trước đây như YOLO11YOLOv8, tùy theo yêu cầu cụ thể về backward compatibility.

Training Tinh gọn và Dễ sử dụng#

Một trong những đặc điểm nổi bật của các model Ultralytics là Tính dễ sử dụng vượt trội. Không giống môi trường TensorFlow AutoML của EfficientDet, vốn yêu cầu thiết lập phức tạp với nhiều dependency, Ultralytics cung cấp một API đơn giản, mang phong cách Python.

Môi trường này giảm thiểu mức sử dụng memory CUDA trong quá trình training, đảm bảo ngay cả các dataset lớn cũng có thể được xử lý hiệu quả mà không gặp lỗi Out-Of-Memory (OOM) thường thấy trong các kiến trúc dựa trên Transformer cồng kềnh.

Ví dụ Code: Bắt đầu với Ultralytics#

Đoạn code sau minh họa cách developer có thể tận dụng package Ultralytics để training liền mạch một model YOLO26 tiên tiến ngay sau khi cài đặt.

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model for object detection
model = YOLO("yolo26n.pt")

# Train the model effortlessly using the integrated Ultralytics ecosystem
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Auto-selects optimal device
    batch=16,
)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the model for edge deployment (e.g., OpenVINO for CPU optimization)
model.export(format="openvino")
Export cho môi trường production

Các model được training thông qua API Ultralytics có thể ngay lập tức được export sang nhiều format production như OpenVINO hoặc ONNX, đảm bảo throughput cao bất kể phần cứng mục tiêu.

Các trường hợp sử dụng lý tưởng và ứng dụng thực tế#

Khi thiết kế solution, việc kết hợp các điểm mạnh của model với use case cụ thể là điều bắt buộc.

Khi nào nên Sử dụng EfficientDet#

EfficientDet vẫn là một lựa chọn cho nghiên cứu học thuật legacy hoặc các môi trường bị ràng buộc nghiêm ngặt vào hệ sinh thái Google Cloud, nơi các experiment về compound scaling là trọng tâm chính. Các biến thể nhỏ hơn (d0-d2) hữu ích khi dung lượng disk bị giới hạn nghiêm ngặt.

Khi nào nên sử dụng YOLOv7#

YOLOv7 nổi bật trong các thiết lập legacy hiệu năng cao, đặc biệt khi ưu tiên tích hợp PyTorch hơn TensorFlow. Model này vẫn được deployment rộng rãi trong:

  • Video Analytics: Xử lý các luồng bảo mật có frame rate cao trong điều kiện GPU acceleration dồi dào.
  • Kiểm tra Công nghiệp: Phát hiện lỗi trên các dây chuyền lắp ráp sản xuất chuyển động nhanh.

Khi nào nên chọn YOLO26#

Đối với mọi deployment mới, YOLO26 là lựa chọn được khuyến nghị rõ ràng. Cân bằng Hiệu năng vượt trội và hệ sinh thái được duy trì tốt giúp model trở thành lựa chọn tối ưu cho:

  • Smart City và Quản lý Giao thông: Thiết kế không cần NMS đảm bảo inference latency nhất quán, yếu tố quan trọng đối với điều phối giao thông thời gian thực.
  • Robotics và Hệ thống Tự hành: Mức tăng 43% ấn tượng về tốc độ inference trên CPU đảm bảo các thuật toán điều hướng cho embedded device có khả năng phản hồi rất nhanh.
  • Giám sát Nông nghiệp và Trên không: Sử dụng ProgLoss và STAL để xác định chính xác các đối tượng nhỏ như loại cây trồng cụ thể hoặc động vật hoang dã từ ảnh chụp ở độ cao lớn.

Tóm lại, mặc dù EfficientDet và YOLOv7 cung cấp góc nhìn lịch sử giá trị cùng tiện ích trong các niche cụ thể, kỹ sư thị giác máy tính hiện đại nên áp dụng kiến trúc Ultralytics YOLO26, kiến trúc này giải quyết tinh tế các bottleneck trước đây đồng thời mở rộng giới hạn của những gì có thể thực hiện trong trí tuệ nhân tạo.

Những người đóng góp

Bình luận