Vergleichende Analyse der Bereitstellungsoptionen für YOLO26#
YOLO26 unterstützt mehr als 20 Bereitstellungsoptionen, die jeweils auf eine andere Laufzeitumgebung, ein anderes Hardwareziel oder eine andere Plattform abgestimmt sind – von PyTorch und ONNX bis zu TensorRT, OpenVINO, CoreML und speziellen Formaten für Edge-NPUs. Die Wahl der richtigen Option erfordert eine Abwägung zwischen Inferenzgeschwindigkeit, Hardwareeinschränkungen und einfacher Integration. Dieser Leitfaden vergleicht alle Optionen, damit du die beste Lösung für deine Anwendung auswählen und anschließend mit den Best Practices für die Modellbereitstellung fortfahren kannst, um das Modell zuverlässig bereitzustellen.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
Die Bereitstellung ist die Phase im Workflow eines Computer-Vision-Projekts, in der ein trainiertes Modell mit der eigentlichen Arbeit beginnt. Daher wirkt sich das Exportformat direkt auf Geschwindigkeit, Kosten und Portierbarkeit aus.
So wählst du die richtige Bereitstellungsoption für dein YOLO26-Modell aus#
Wenn es Zeit ist, dein YOLO26-Modell bereitzustellen, ist die Auswahl eines geeigneten Exportformats besonders wichtig. Wie in der Exportdokumentation zu Ultralytics YOLO26 beschrieben, wandelt die Funktion model.export() dein trainiertes Modell in verschiedene Formate um, die auf unterschiedliche Umgebungen und Leistungsanforderungen zugeschnitten sind.
Das ideale Format hängt vom vorgesehenen Einsatzkontext deines Modells und von der Hardware ab.
Für eine verwaltete Bereitstellung ohne manuellen Export bietet die Ultralytics Platform sofort einsatzbereite Inferenzendpunkte mit automatischer Skalierung in 42 Regionen weltweit.
Bereitstellungsoptionen für YOLO26#
Hier findest du eine kurze Beschreibung jedes Formats und Hinweise dazu, wann du es einsetzen solltest. Eine vollständige Anleitung zum Export findest du in der Exportdokumentation; die Kriterien im direkten Vergleich enthält die Vergleichstabelle.
- PyTorch (
.pt): Das native Format für Training und Inferenz bietet maximale Flexibilität und GPU-Beschleunigung durch NVIDIA CUDA oder AMD ROCm – ideal für Forschung und Prototyping, da kein Exportschritt erforderlich ist. - TorchScript (
torchscript): Serialisiert das Modell für eine C++-Laufzeitumgebung ohne Python und eignet sich für Produktionssysteme, in denen Python nicht verfügbar ist. - ONNX (
onnx): Ein frameworkunabhängiges Austauschformat mit umfassender plattform- und hardwareübergreifender Unterstützung durch ONNX Runtime. - OpenVINO (
openvino): Intels Toolkit für optimierte Inferenz auf Intel-CPUs, integrierten GPUs und NPUs, das häufig im IoT- und Edge-Computing eingesetzt wird. - TensorRT (
engine): Die Hochleistungs-Laufzeitumgebung von NVIDIA liefert erstklassige GPU-Inferenz mit FP16- und INT8-Optimierung. - CoreML (
coreml): Apples On-Device-Format für iOS, macOS, watchOS und tvOS, das die Apple Neural Engine verwendet. - TF SavedModel (
saved_model): Das Standardformat von TensorFlow für skalierbares serverseitiges Bereitstellen mit TensorFlow Serving. - TF GraphDef (
pb): Ein eingefrorenes statisches TensorFlow-Graphformat für Umgebungen, die einen unveränderlichen Berechnungsgraphen benötigen. - TF Edge TPU (
edgetpu): Kompiliert.tflite-Modelle für Google Coral Edge-TPU-Beschleuniger. - LiteRT (
litert): Googles On-Device-Laufzeitumgebung (früher TensorFlow Lite) für Inferenz auf Mobilgeräten, eingebetteten Systemen und im Browser aus einem einzigen.tflite-Modell, mit FP32- und INT8-Unterstützung sowie Ausführung im Browser über LiteRT.js. - PaddlePaddle (
paddle): Das in China beliebte Deep-Learning-Framework von Baidu mit umfassender Hardwareunterstützung. - MNN (
mnn): Eine schlanke, leistungsstarke Inferenz-Engine, optimiert für mobile und eingebettete ARM- und x86-64-Systeme. - NCNN (
ncnn): Ein leistungsstarkes, schlankes Inferenz-Framework, das auf mobile ARM-Geräte abgestimmt ist. - Sony IMX500 (
imx): Exportiert Modelle für Sonys intelligenten Bildsensor IMX500 mit Verarbeitung auf dem Chip, etwa für die Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Richtet sich an Rockchip-NPUs auf eingebetteten Boards mit FP16- und INT8-Quantisierung. - ExecuTorch (
executorch): PyTorches native On-Device-Laufzeitumgebung für mobile Geräte (iOS und Android) und eingebettete Systeme über XNNPACK. - Axelera AI (
axelera): Kompiliert für Axelera Metis AIPU (bis zu 856 TOPS) über PCIe oder M.2 und ermöglicht eine hochdurchsatzfähige Edge-Inferenz. - DEEPX (
deepx): Richtet sich an DEEPX-NPU-Hardware mit INT8-Quantisierung für eingebettete Edge-Inferenz. - Qualcomm QNN (
qnn): On-Device-Inferenz auf Snapdragon Hexagon NPU, Adreno GPU und CPU über den Qualcomm-AI-Stack. - Core AI (
coreai): Apples neues.aimodel-Format für iOS 27 und macOS 27, geplant für CPU, GPU und Apple Neural Engine; der Export erfordert macOS 26 oder neuer auf Apple Silicon.
Die Hailo-Integration exportiert YOLO-Modelle für Objekterkennung, Segmentierung, semantische Segmentierung, Tiefenschätzung, Klassifizierung, Pose und OBB direkt in Hailo HEF. In der Kompatibilitätstabelle findest du validierte Modelle und Zielplattformen. Die Ambarella-Integration folgt einem ONNX-zentrierten Workflow und kompiliert ONNX-Exporte mit Ambarellas CVflow-Toolchain für CVflow®-SoCs wie den CV72 in das AmbaPB-Format; optional kann dabei SpongeTorch für komprimierungsbewusstes Training verwendet werden. Die Huawei-Ascend-Integration kompiliert ONNX-Exporte mit dem CANN-ATC-Compiler in das Offline-Format .om für FP16-Inferenz auf Ascend AI Processors.
Bereitstellungsoptionen im Vergleich#
Die folgende Tabelle fasst die Bereitstellungsoptionen für YOLO26-Modelle anhand der Kriterien zusammen, die üblicherweise die Auswahl bestimmen. Eine ausführliche Betrachtung jedes Formats findest du in der Dokumentation zu Exportformaten.
| Bereitstellungsoption | Leistungsbenchmarks | Kompatibilität und Integration | Community-Unterstützung und Ökosystem | Fallstudien | Wartung und Aktualisierungen | Sicherheitsaspekte | Hardwarebeschleunigung |
|---|---|---|---|---|---|---|---|
| PyTorch | Gute Flexibilität, möglicherweise auf Kosten der Rohleistung | Hervorragend mit Python-Bibliotheken | Umfangreiche Ressourcen und Community | Forschung und Prototypen | Regelmäßige, aktive Weiterentwicklung | Abhängig von der Bereitstellungsumgebung | CUDA-Unterstützung für GPU-Beschleunigung |
| TorchScript | Besser für die Produktion geeignet als PyTorch | Reibungsloser Übergang von PyTorch zu C++ | Spezialisierter, aber enger gefasst als PyTorch | Branchen, in denen Python ein Engpass ist | Konsistente Aktualisierungen zusammen mit PyTorch | Verbesserte Sicherheit ohne vollständiges Python | Übernimmt die CUDA-Unterstützung von PyTorch |
| ONNX | Je nach Laufzeitumgebung unterschiedlich | Hoch über verschiedene Frameworks hinweg | Breites Ökosystem, von vielen Organisationen unterstützt | Flexibilität über verschiedene ML-Frameworks hinweg | Regelmäßige Aktualisierungen für neue Operationen | Achte auf sichere Verfahren für Konvertierung und Bereitstellung | Verschiedene Hardwareoptimierungen |
| OpenVINO | Für Intel-Hardware optimiert | Am besten innerhalb des Intel-Ökosystems | Stark im Bereich Computer Vision | IoT und Edge mit Intel-Hardware | Regelmäßige Aktualisierungen für Intel-Hardware | Robuste Funktionen für sensible Anwendungen | Auf Intel-Hardware zugeschnitten |
| TensorRT | Erstklassige Leistung auf NVIDIA-GPUs | Am besten für NVIDIA-Hardware geeignet | Starkes Netzwerk durch NVIDIA | Echtzeitinferenz für Videos und Bilder | Häufige Aktualisierungen für neue GPUs | Sicherheitsfokus | Für NVIDIA-GPUs entwickelt |
| CoreML | Für On-Device-Hardware von Apple optimiert | Exklusiv für das Apple-Ökosystem | Starke Unterstützung durch Apple und die Entwickler-Community | On-Device-ML auf Apple-Produkten | Regelmäßige Aktualisierungen von Apple | Fokus auf Datenschutz und Sicherheit | Apple Neural Engine und GPU |
| TF SavedModel | Skalierbar in Serverumgebungen | Breite Kompatibilität im TensorFlow-Ökosystem | Umfangreiche Unterstützung aufgrund der Beliebtheit von TensorFlow | Modelle in großem Maßstab bereitstellen | Regelmäßige Aktualisierungen durch Google und die Community | Robuste Funktionen für Unternehmen | Verschiedene Hardwarebeschleunigungen |
| TF GraphDef | Stabil für statische Berechnungsgraphen | Gute Integration in die TensorFlow-Infrastruktur | Ressourcen zur Optimierung statischer Graphen | Szenarien, die statische Graphen erfordern | Aktualisierungen parallel zum TensorFlow-Kern | Bewährte TensorFlow-Sicherheitsverfahren | Optionen zur TensorFlow-Beschleunigung |
| TF Edge TPU | Für die Edge-TPU-Hardware von Google optimiert | Exklusiv für Edge-TPU-Geräte | Wachsende Unterstützung durch Ressourcen von Google und Drittanbietern | IoT-Geräte, die Echtzeitverarbeitung benötigen | Verbesserungen für neue Edge-TPU-Hardware | Robuste IoT-Sicherheit von Google | Speziell für Google Coral entwickelt |
| LiteRT | Geschwindigkeit und Effizienz auf Mobilgeräten, eingebetteten Geräten und im Web | Unterstützung für Mobilgeräte, eingebettete Systeme, Edge-Geräte und Browser | Starke Community, unterstützt von Google | On-Device-Apps für Android, iOS und das Web | Aktuelle Funktionen der On-Device-Laufzeitumgebung | Sichere Inferenz auf dem Gerät und im Browser | Beschleunigung durch GPU, DSP und WebGPU |
| PaddlePaddle | Leistungsfähig, einfach zu verwenden und skalierbar | Baidu-Ökosystem und breite Unterstützung für Anwendungen | Schnell wachsend, insbesondere in China | Chinesischer Markt und Sprachverarbeitung | Fokus auf chinesische KI-Anwendungen | Legt Wert auf Datenschutz und Sicherheit | Einschließlich der Kunlun-Chips von Baidu |
| MNN | Hohe Leistung auf Mobilgeräten | Mobile und eingebettete ARM-Systeme sowie X86-64-CPU | Community für ML auf Mobilgeräten und in eingebetteten Systemen | Effizienz auf mobilen Systemen | Hohe Leistung und gute Wartbarkeit auf Mobilgeräten | Sicherheitsvorteile durch die Verarbeitung auf dem Gerät | Optimierungen für ARM-CPUs und GPUs |
| NCNN | Für mobile Geräte mit ARM-Architektur optimiert | Mobile und eingebettete ARM-Systeme | Kleine, aber aktive ML-Community für mobile und eingebettete Systeme | Effizienz auf Android- und ARM-Systemen | Hohe Leistung und gute Wartbarkeit auf ARM | Sicherheitsvorteile durch die Verarbeitung auf dem Gerät | Optimierungen für ARM-CPUs und GPUs |
| Sony IMX500 | Inferenz auf dem Sensor bei sehr geringem Energieverbrauch | Sony IMX500-Sensor, Raspberry Pi AI Camera | Sony-AITRIOS-Ökosystem | Edge-KI direkt auf der Kamera | Aktualisierungen für Sony SDK und MCT-Toolchain | Die Daten bleiben auf dem Sensor | On-Chip-Beschleuniger des Sony IMX500 |
| Rockchip RKNN | Für Rockchip-NPUs optimiert | Rockchip-SoC-Boards (z. B. RK3588) | Rockchip-Entwickler-Community | Eingebettete SBCs und Edge-Geräte | Aktualisierungen für das Rockchip RKNN-Toolkit | Lokale Inferenz auf dem Gerät | Rockchip-NPU |
| ExecuTorch | Effiziente PyTorch-Laufzeitumgebung für die Ausführung auf dem Gerät | iOS, Android und eingebettete Systeme über XNNPACK | Unterstützt durch das PyTorch-Projekt | Mobile und eingebettete Anwendungen | Parallel zu PyTorch gepflegt | Die Inferenz auf dem Gerät hält die Daten lokal | XNNPACK sowie CPU- und GPU-Backends für Mobilgeräte |
| Axelera AI | Sehr hoher Durchsatz (bis zu 856 TOPS) | Metis AIPU über PCIe oder M.2 | Axelera Voyager SDK | Edge-Inferenz mit hohem Durchsatz | Aktualisierungen für das Axelera SDK | Lokale Edge-Inferenz | Axelera Metis AIPU |
| DEEPX | Für INT8 optimierte NPU-Inferenz | DEEPX-NPU-Hardware | DEEPX-Entwicklerwerkzeuge (dx_com, dx_engine) | Eingebettete Edge-Inferenz | Aktualisierungen für DEEPX SDK und Laufzeitumgebung | Lokale Inferenz auf dem Gerät | DEEPX-NPU |
| Qualcomm QNN | Schnelle Snapdragon-Inferenz auf dem Gerät | Snapdragon Hexagon NPU, Adreno GPU, CPU | Qualcomm-AI-Hub-Ökosystem | Mobile Snapdragon-Geräte und Snapdragon-Edge-Geräte | Aktualisierungen für den Qualcomm-AI-Stack (QAIRT) | Die Inferenz auf dem Gerät hält die Daten lokal | Snapdragon Hexagon NPU |
| Hailo | INT8-HEF-Inferenz auf Hailo-NPUs | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler und HailoRT | Kameras, Roboter, industrielle Edge-Systeme | Hailo-DFC- und HailoRT-Releases | Lokale Inferenz auf dem Gerät | Hailo NPU |
| Huawei Ascend | Höherer Durchsatz auf dem Ascend AI Core | Atlas-Boards und OrangePi AIPro | Huawei-CANN-Ökosystem | Edge-Inferenz auf Ascend-NPUs | CANN- und ATC-Releases | Lokale Inferenz auf dem Gerät | Ascend AI Core |
| Core AI | Optimiert für Apple Silicon | iOS 27 und macOS 27; Export erfordert macOS 26+ | Apple-Framework; noch nicht in iOS-/Flutter-SDKs enthalten | On-Device-ML auf Apple-Plattformen der nächsten Generation | An Apple-Betriebssystem-Releases gekoppelt; derzeit in der Beta | Die Inferenz auf dem Gerät hält die Daten lokal | Apple Neural Engine, GPU und CPU |
Dieser Vergleich gibt dir einen Überblick auf hoher Ebene. Berücksichtige bei der Bereitstellung die spezifischen Anforderungen und Einschränkungen deines Projekts für jede Option und ziehe den verlinkten Integrationsleitfaden für das von dir gewählte Format zurate.
Fazit#
Die große Auswahl an Exportformaten von YOLO26 ermöglicht es dir, ein Modell für nahezu jede Umgebung anzupassen – von einem Cloud-GPU-Server bis zu einer Edge-Kamera mit Inferenz auf dem Sensor. Nachdem du ein Format ausgewählt hast, befolge die Best Practices für die Modellbereitstellung zur Optimierung, Fehlerbehebung und Sicherheit und wende dich an die Ultralytics-Community, wenn du nicht weiterkommst.
FAQ#
Ultralytics YOLO26 unterstützt verschiedene Bereitstellungsformate, die jeweils für bestimmte Umgebungen und Hardwareplattformen entwickelt wurden. Zu den wichtigsten Formaten gehören:
- PyTorch für Forschung und Prototyping mit hervorragender Python-Integration.
- TorchScript für Produktionsumgebungen, in denen Python nicht verfügbar ist.
- ONNX für plattformübergreifende Kompatibilität und Hardwarebeschleunigung.
- OpenVINO für optimierte Leistung auf Intel-Hardware.
- TensorRT für schnelle Inferenz auf NVIDIA-GPUs.
Jedes Format bietet eigene Vorteile. Eine ausführliche Anleitung findest du in unserer Dokumentation zum Exportprozess.
Um die Inferenzgeschwindigkeit auf Intel-CPUs zu erhöhen, kannst du dein YOLO26-Modell mit Intels OpenVINO-Toolkit bereitstellen. OpenVINO ermöglicht deutliche Leistungssteigerungen, indem es Modelle für eine effiziente Nutzung der Intel-Hardware optimiert.
- Konvertiere dein YOLO26-Modell mithilfe der Funktion
model.export()in das OpenVINO-Format. - Befolge die ausführliche Einrichtungsanleitung in der Dokumentation zum Intel-OpenVINO-Export.
Weitere Informationen findest du in unserem Blogbeitrag.
- Konvertiere dein YOLO26-Modell mithilfe der Funktion
Ja, YOLO26-Modelle können auf mobilen Geräten mit LiteRT (früher TensorFlow Lite) und NCNN für Android sowie CoreML oder LiteRT für iOS bereitgestellt werden. LiteRT ist Googles Laufzeitumgebung für Geräte für mobile und eingebettete Geräte und führt dasselbe Modell unter Android, iOS und im Browser aus, wodurch eine effiziente Inferenz direkt auf dem Gerät ermöglicht wird.
Beispiel# Export command for NCNN format model.export(format="ncnn")Weitere Informationen zur Bereitstellung von Modellen auf mobilen Geräten findest du in unserem LiteRT-Integrationsleitfaden.
Berücksichtige bei der Auswahl eines Bereitstellungsformats für YOLO26 die folgenden Faktoren:
- Leistung: Einige Formate wie TensorRT bieten außergewöhnliche Geschwindigkeiten auf NVIDIA-GPUs, während OpenVINO für Intel-Hardware optimiert ist.
- Kompatibilität: ONNX bietet umfassende Kompatibilität über verschiedene Plattformen hinweg.
- Einfache Integration: Formate wie CoreML oder LiteRT sind auf bestimmte Ökosysteme wie iOS beziehungsweise Android zugeschnitten.
- Unterstützung durch die Community: Formate wie PyTorch und TensorFlow verfügen über umfangreiche Ressourcen und Unterstützung durch die Community.
Eine vergleichende Analyse findest du in unserer Dokumentation zu Exportformaten.
Für die Bereitstellung von YOLO26-Modellen in einer Webanwendung kannst du LiteRT.js, die Web-Laufzeitumgebung von LiteRT, verwenden. Damit lassen sich Modelle für maschinelles Lernen direkt im Browser und in Node.js ausführen. Dieser Ansatz macht eine Backend-Infrastruktur überflüssig und ermöglicht eine Leistung in Echtzeit.
- Exportiere das YOLO26-Modell in das LiteRT-Format.
- Integriere das exportierte Modell mit LiteRT.js in deine Webanwendung.
Eine Schritt-für-Schritt-Anleitung findest du in unserem LiteRT-Integrationsleitfaden.