Vergleich der Bereitstellungsoptionen für YOLO26#
YOLO26 unterstützt mehr als 20 Bereitstellungsoptionen, die jeweils auf eine andere Laufzeitumgebung, Hardware oder Plattform abgestimmt sind – von PyTorch und ONNX über TensorRT, OpenVINO und CoreML bis hin zu speziellen Formaten für Edge-NPUs. Bei der Wahl der passenden Option gilt es, Inferenzgeschwindigkeit, Hardwareeinschränkungen und einfache Integration gegeneinander abzuwägen. Dieser Leitfaden vergleicht alle Optionen, damit du die richtige für deine Anwendung auswählen und anschließend die Best Practices für die Modellbereitstellung nutzen kannst, um das Modell zuverlässig bereitzustellen.
Ansehen: So wählst du das beste Bereitstellungsformat für Ultralytics YOLO26 für dein Projekt aus | TensorRT | OpenVINO 🚀
Die Bereitstellung ist die Phase im Ablauf eines Computer-Vision-Projekts, in der ein trainiertes Modell seine praktische Arbeit aufnimmt. Das Exportformat wirkt sich daher direkt auf Geschwindigkeit, Kosten und Portabilität aus.
So wählst du die passende Bereitstellungsoption für dein YOLO26-Modell aus#
Wenn du dein YOLO26-Modell bereitstellen möchtest, ist die Wahl eines geeigneten Exportformats sehr wichtig. Wie in der Exportdokumentation für Ultralytics YOLO26 beschrieben, wandelt die Funktion model.export() dein trainiertes Modell in verschiedene Formate um, die auf unterschiedliche Umgebungen und Leistungsanforderungen zugeschnitten sind.
Das ideale Format hängt vom vorgesehenen Einsatzbereich und der Hardware deines Modells ab.
Für eine verwaltete Bereitstellung ohne manuellen Export bietet die Ultralytics Platform einsatzbereite Inferenzendpunkte mit automatischer Skalierung in 42 Regionen weltweit.
Die Bereitstellungsoptionen von YOLO26#
Hier findest du eine kurze Beschreibung der einzelnen Formate und ihrer Anwendungsbereiche. Eine vollständige Anleitung zum Export findest du in der Exportdokumentation; einen direkten Vergleich der Kriterien bietet die Vergleichstabelle.
- PyTorch (
.pt): Das native Format für Training und Inferenz bietet maximale Flexibilität und GPU-Beschleunigung mit NVIDIA CUDA oder AMD ROCm – ideal für Forschung und Prototypen, da kein Export erforderlich ist. - TorchScript (
torchscript): Serialisiert das Modell für eine C++-Laufzeitumgebung ohne Python und eignet sich für Produktionssysteme, in denen Python nicht verfügbar ist. - ONNX (
onnx): Ein frameworkunabhängiges Austauschformat mit breiter Plattform- und Hardwareunterstützung durch ONNX Runtime, auch für NVIDIA-GPUs über CUDA und AMD-GPUs über MIGraphX. - OpenVINO (
openvino): Intels Toolkit für optimierte Inferenz auf Intel-CPUs, integrierten GPUs und NPUs, das häufig im IoT und bei der Edge-Verarbeitung eingesetzt wird. - TensorRT (
engine): Die Hochleistungs-Laufzeitumgebung von NVIDIA ermöglicht erstklassige GPU-Inferenz mit FP16- und INT8-Optimierung. - CoreML (
coreml): Apples Format für die Ausführung auf Geräten mit iOS, macOS, watchOS und tvOS nutzt die Apple Neural Engine. - Core AI (
coreai): Apples neues Format.aimodelfür iOS 27 und macOS 27 verteilt die Ausführung auf CPU, GPU und Apple Neural Engine. Für den Export ist macOS 26 oder neuer auf Apple-Chips oder x86_64 Linux mit glibc 2.34 oder neuer sowie Python 3.11 bis 3.14 erforderlich. - TF SavedModel (
saved_model): Das Standardformat von TensorFlow für skalierbares serverseitiges Bereitstellen mit TensorFlow Serving. - TF GraphDef (
pb): Ein eingefrorenes TensorFlow-Format mit statischem Graphen für Umgebungen, die einen festen Berechnungsgraphen benötigen. - TF Edge TPU (
edgetpu): Kompiliert.tflite-Modelle für Google Coral Edge TPU-Beschleuniger. - LiteRT (
litert): Googles Laufzeitumgebung für die Ausführung auf Geräten (früher TensorFlow Lite) ermöglicht Inferenz auf Mobilgeräten, eingebetteten Systemen und im Browser mit einem einzigen.tflite-Modell. Sie unterstützt FP32 und INT8 sowie die Ausführung im Browser über LiteRT.js. - PaddlePaddle (
paddle): Das in China beliebte Deep-Learning-Framework von Baidu bietet breite Hardwareunterstützung. - MNN (
mnn): Eine schlanke, leistungsstarke Inferenz-Engine, optimiert für mobile und eingebettete ARM- und x86-64-Systeme. - NCNN (
ncnn): Ein leistungsstarkes, schlankes Inferenz-Framework, das für mobile ARM-Geräte optimiert ist. - Sony IMX500 (
imx): Exportiert Modelle für Sonys intelligenten Bildsensor IMX500 mit Verarbeitung auf dem Chip, etwa für die Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Unterstützt NPUs von Rockchip auf eingebetteten Platinen mit FP16- und INT8-Quantisierung. - ExecuTorch (
executorch): PyTorchs native Laufzeitumgebung für die Ausführung auf Mobilgeräten (iOS und Android) und eingebetteten Systemen über XNNPACK. - Axelera AI (
axelera): Kompiliert Modelle für Axelera Metis AIPU (bis zu 856 TOPS) über PCIe oder M.2 und ermöglicht so eine leistungsstarke Inferenz am Netzwerkrand. - DEEPX (
deepx): Unterstützt DEEPX-NPU-Hardware mit INT8-Quantisierung für eingebettete Inferenz am Netzwerkrand. - Qualcomm QNN (
qnn): Inferenz direkt auf Geräten mit Snapdragon Hexagon NPU, Adreno GPU und CPU über den Qualcomm-AI-Stack.
Die Hailo-Integration exportiert YOLO-Modelle für Erkennung, Segmentierung, semantische Segmentierung, Tiefenschätzung, Klassifizierung, Pose und OBB direkt in das Hailo-HEF-Format. In der Kompatibilitätstabelle findest du validierte Modelle und Ziele. Die Ambarella-Integration basiert auf einem ONNX-zuerst-Workflow und kompiliert ONNX-Exporte mit der CVflow-Toolchain von Ambarella in das AmbaPB-Format für CVflow®-SoCs wie den CV72; optional kommt dabei das SpongeTorch-kompressionsbewusste Training zum Einsatz. Die Huawei-Ascend-Integration kompiliert ONNX-Exporte mit dem CANN-ATC-Compiler für FP16-Inferenz auf Ascend AI Processors in das Offlineformat .om. Die AMD-Xilinx-Integration quantisiert ONNX-Exporte mit AMD Quark für NPUs der Versal AI Edge Series Gen 2, die der Vitis AI Execution Provider zu einem .rai-Modell kompiliert.
Vergleich der Bereitstellungsoptionen#
Die folgende Tabelle fasst die Bereitstellungsoptionen für YOLO26-Modelle anhand der Kriterien zusammen, die bei der Auswahl üblicherweise ausschlaggebend sind. Einen ausführlichen Überblick über die einzelnen Formate findest du in der Dokumentation zu Exportformaten.
| Bereitstellungsoption | Leistungsbenchmarks | Kompatibilität und Integration | Community-Unterstützung und Ökosystem | Fallstudien | Wartung und Aktualisierungen | Sicherheitsaspekte | Hardwarebeschleunigung |
|---|---|---|---|---|---|---|---|
| PyTorch | Gute Flexibilität; möglicherweise geringere Spitzenleistung | Hervorragend mit Python-Bibliotheken | Umfangreiche Ressourcen und aktive Community | Forschung und Prototypen | Regelmäßige, aktive Weiterentwicklung | Abhängig von der Bereitstellungsumgebung | CUDA-Unterstützung für GPU-Beschleunigung |
| TorchScript | Für den Produktionseinsatz besser geeignet als PyTorch | Reibungsloser Übergang von PyTorch zu C++ | Spezialisiert, aber weniger breit aufgestellt als PyTorch | Branchen, in denen Python zum Engpass wird | Regelmäßige Aktualisierungen zusammen mit PyTorch | Verbesserte Sicherheit ohne vollständige Python-Umgebung | Übernimmt die CUDA-Unterstützung von PyTorch |
| ONNX | Je nach Laufzeitumgebung unterschiedlich | Hohe Kompatibilität mit verschiedenen Frameworks | Breites Ökosystem, unterstützt von vielen Organisationen | Flexibilität über verschiedene ML-Frameworks hinweg | Regelmäßige Aktualisierungen zur Unterstützung neuer Operationen | Achte auf sichere Konvertierungs- und Bereitstellungsverfahren | Verschiedene Hardwareoptimierungen |
| OpenVINO | Für Intel-Hardware optimiert | Am besten innerhalb des Intel-Ökosystems | Etabliert im Bereich Computer Vision | IoT und Edge Computing mit Intel-Hardware | Regelmäßige Updates für Intel-Hardware | Leistungsstarke Funktionen für sensible Anwendungen | Auf Intel-Hardware zugeschnitten |
| TensorRT | Spitzenleistung auf NVIDIA-GPUs | Optimal für NVIDIA-Hardware | Starkes Netzwerk über NVIDIA | Echtzeit-Inferenz für Videos und Bilder | Häufige Updates für neue GPUs | Sicherheitsorientiert | Für NVIDIA-GPUs entwickelt |
| CoreML | Für Apple-Hardware direkt auf dem Gerät optimiert | Exklusiv im Apple-Ökosystem | Starke Unterstützung durch Apple und Entwickler | Maschinelles Lernen direkt auf Apple-Geräten | Regelmäßige Apple-Updates | Fokus auf Datenschutz und Sicherheit | Apple Neural Engine und GPU |
| Core AI | Für Apple Silicon optimiert | iOS 27 und macOS 27; Export auf Apple Silicon mit macOS 26+ oder auf x86_64 Linux (glibc 2.34+), Python 3.11-3.14 | Apple-Framework; optional in iOS-/Flutter-SDKs | Maschinelles Lernen direkt auf Apple-Plattformen der nächsten Generation | An Apple-Betriebssystemversionen gebunden; derzeit Beta | Bei der Inferenz direkt auf dem Gerät bleiben die Daten lokal | Apple Neural Engine, GPU und CPU |
| TF SavedModel | Für den Einsatz in Serverumgebungen skalierbar | Breite Kompatibilität im TensorFlow-Ökosystem | Umfangreiche Unterstützung dank der Beliebtheit von TensorFlow | Modelle in großem Maßstab bereitstellen | Regelmäßige Updates von Google und der Community | Leistungsstarke Funktionen für Unternehmen | Verschiedene Hardwarebeschleunigungen |
| TF GraphDef | Stabil bei statischen Berechnungsgraphen | Lässt sich gut in die TensorFlow-Infrastruktur integrieren | Ressourcen zur Optimierung statischer Graphen | Szenarien, in denen statische Graphen erforderlich sind | Updates parallel zum TensorFlow-Kern | Etablierte Sicherheitspraktiken von TensorFlow | TensorFlow-Beschleunigungsoptionen |
| TF Edge TPU | Für Googles Edge-TPU-Hardware optimiert | Exklusiv für Edge-TPU-Geräte | Wachsende Ressourcen von Google und Drittanbietern | IoT-Geräte, die Echtzeitverarbeitung erfordern | Verbesserungen für neue Edge-TPU-Hardware | Robuste IoT-Sicherheit von Google | Speziell für Google Coral entwickelt |
| LiteRT | Geschwindigkeit und Effizienz auf Mobilgeräten, eingebetteten Systemen und im Web | Unterstützung für Mobilgeräte, eingebettete Systeme, Edge-Geräte und Browser | Starke Community, unterstützt von Google | Apps direkt auf dem Gerät für Android, iOS und das Web | Neueste Funktionen für die Laufzeitumgebung auf dem Gerät | Sichere Inferenz direkt auf dem Gerät und im Browser | Beschleunigung durch GPU, DSP und WebGPU |
| PaddlePaddle | Leistungsfähig, einfach zu bedienen und skalierbar | Baidu-Ökosystem und breite Anwendungsunterstützung | Rasantes Wachstum, insbesondere in China | Chinesischer Markt und Sprachverarbeitung | Fokus auf chinesische KI-Anwendungen | Fokus auf Datenschutz und Sicherheit | Einschließlich Baidus Kunlun-Chips |
| MNN | Hohe Leistung auf Mobilgeräten | ARM-Systeme für Mobilgeräte und eingebettete Systeme sowie X86-64-CPU | Community für maschinelles Lernen auf Mobilgeräten und eingebetteten Systemen | Effizienz auf Mobilgeräten | Hohe Leistung und zuverlässige Wartung auf Mobilgeräten | Sicherheitsvorteile direkt auf dem Gerät | Optimierungen für ARM-CPUs und GPUs |
| NCNN | Für mobile Geräte mit ARM-Prozessoren optimiert | ARM-Systeme für Mobilgeräte und eingebettete Systeme | Kleine, aber aktive Community für maschinelles Lernen auf Mobilgeräten und eingebetteten Systemen | Effizienz auf Android- und ARM-Systemen | Hohe Leistung und zuverlässige Wartung auf ARM-Systemen | Sicherheitsvorteile direkt auf dem Gerät | Optimierungen für ARM-CPUs und GPUs |
| Sony IMX500 | Inferenz direkt auf dem Sensor bei sehr geringem Stromverbrauch | Sony IMX500-Sensor, Raspberry Pi AI Camera | Sony-AITRIOS-Ökosystem | Edge-KI direkt in der Kamera | Updates für Sony SDK und MCT-Toolchain | Die Daten bleiben auf dem Sensor | Sony-IMX500-Beschleuniger auf dem Chip |
| Rockchip RKNN | Für Rockchip-NPUs optimiert | Rockchip-SoC-Boards (z. B. RK3588) | Rockchip-Entwicklercommunity | Eingebettete Einplatinencomputer und Edge-Geräte | Updates für das Rockchip RKNN-Toolkit | Lokale Inferenz direkt auf dem Gerät | Rockchip NPU |
| ExecuTorch | Effiziente PyTorch-Laufzeitumgebung direkt auf dem Gerät | iOS, Android und eingebettete Systeme über XNNPACK | Unterstützt vom PyTorch-Projekt | Apps für Mobilgeräte und eingebettete Systeme | Parallel zu PyTorch gepflegt | Bei der Inferenz direkt auf dem Gerät bleiben die Daten lokal | XNNPACK und CPU-/GPU-Backends für Mobilgeräte |
| Axelera AI | Sehr hoher Durchsatz (bis zu 856 TOPS) | Metis AIPU über PCIe oder M.2 | Axelera Voyager SDK | Edge-Inferenz mit hohem Durchsatz | Axelera-SDK-Updates | Edge-Inferenz vor Ort | Axelera Metis AIPU |
| DEEPX | INT8-optimierte NPU-Inferenz | DEEPX-NPU-Hardware | DEEPX-Entwicklerwerkzeuge (dx_com, dx_engine) | Eingebettete Edge-Inferenz | Updates für DEEPX SDK und Laufzeitumgebung | Lokale Inferenz direkt auf dem Gerät | DEEPX NPU |
| Qualcomm QNN | Schnelle Snapdragon-Inferenz auf dem Gerät | Snapdragon Hexagon NPU, Adreno GPU, CPU | Qualcomm-AI-Hub-Ökosystem | Mobile Snapdragon-Geräte und Edge-Geräte | Updates für den Qualcomm-AI-Stack (QAIRT) | Bei der Inferenz direkt auf dem Gerät bleiben die Daten lokal | Snapdragon Hexagon NPU |
| Hailo | INT8-HEF-Inferenz auf Hailo-NPUs | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler und HailoRT | Kameras, Roboter, industrielle Edge-Systeme | Hailo-DFC- und HailoRT-Versionen | Lokale Inferenz direkt auf dem Gerät | Hailo NPU |
| Huawei Ascend | Höherer Durchsatz auf dem Ascend AI Core | Atlas-Boards und OrangePi AIPro | Huawei-CANN-Ökosystem | Edge-Inferenz auf Ascend-NPUs | CANN- und ATC-Versionen | Lokale Inferenz direkt auf dem Gerät | Ascend AI Core |
| AMD Xilinx | INT8-Inferenz auf NPUs der Versal AI Edge Gen 2 | Versal AI Edge Series Gen 2 (VEK385) | AMD Vitis AI und Quark | Eingebettete Bildverarbeitung auf adaptiven SoCs | Vitis-AI- und Quark-Versionen | Lokale Inferenz direkt auf dem Gerät | Versal-AI-Engine-NPU |
Dieser Vergleich bietet dir einen allgemeinen Überblick. Wäge für die Bereitstellung die spezifischen Anforderungen und Einschränkungen deines Projekts gegenüber den einzelnen Optionen ab und ziehe den verlinkten Integrationsleitfaden für das von dir gewählte Format heran.
Fazit#
Die große Auswahl an Exportformaten für YOLO26 ermöglicht es dir, ein Modell an nahezu jede Umgebung anzupassen – vom Cloud-GPU-Server bis zur Edge-Kamera am Sensor. Sobald du ein Format ausgewählt hast, befolge die bewährten Vorgehensweisen für die Modellbereitstellung zur Optimierung, Fehlerbehebung und Sicherheit und wende dich bei Problemen an die Ultralytics-Community.
Häufig gestellte Fragen#
Ultralytics YOLO26 unterstützt verschiedene Bereitstellungsformate, die jeweils für bestimmte Umgebungen und Hardwareplattformen ausgelegt sind. Zu den wichtigsten Formaten gehören:
- PyTorch für Forschung und Prototyping mit hervorragender Python-Integration.
- TorchScript für Produktionsumgebungen, in denen Python nicht verfügbar ist.
- ONNX für plattformübergreifende Kompatibilität und Hardwarebeschleunigung.
- OpenVINO für optimierte Leistung auf Intel-Hardware.
- TensorRT für schnelle Inferenz auf NVIDIA-GPUs.
Jedes Format bietet eigene Vorteile. Eine ausführliche Anleitung findest du in unserer Dokumentation zum Exportprozess.
Um die Inferenzgeschwindigkeit auf Intel-CPUs zu erhöhen, kannst du dein YOLO26-Modell mit dem OpenVINO-Toolkit von Intel bereitstellen. OpenVINO ermöglicht erhebliche Leistungssteigerungen, indem es Modelle so optimiert, dass sie Intel-Hardware effizient nutzen.
- Wandle dein YOLO26-Modell mit der Funktion
model.export()in das OpenVINO-Format um. - Folge der ausführlichen Einrichtungsanleitung in der Dokumentation zum Intel-OpenVINO-Export.
Weitere Informationen findest du in unserem Blogbeitrag.
- Wandle dein YOLO26-Modell mit der Funktion
Ja, YOLO26-Modelle lassen sich mit LiteRT (früher TensorFlow Lite) und NCNN für Android sowie mit CoreML oder LiteRT für iOS auf Mobilgeräten bereitstellen. LiteRT ist Googles Laufzeitumgebung für die Ausführung auf Mobilgeräten und eingebetteten Geräten. Sie führt dasselbe Modell auf Android, iOS und im Browser aus und ermöglicht eine effiziente Inferenz direkt auf dem Gerät.
Beispielfrom ultralytics import YOLO model = YOLO("yolo26n.pt") # Exportbefehl für das NCNN-Format model.export(format="ncnn")Weitere Informationen zur Bereitstellung von Modellen auf Mobilgeräten findest du in unserem LiteRT-Integrationsleitfaden.
Berücksichtige bei der Auswahl eines Bereitstellungsformats für YOLO26 die folgenden Faktoren:
- Leistung: Einige Formate wie TensorRT bieten außergewöhnlich hohe Geschwindigkeit auf NVIDIA-GPUs, während OpenVINO für Intel-Hardware optimiert ist.
- Kompatibilität: ONNX bietet breite Kompatibilität mit verschiedenen Plattformen.
- Einfache Integration: Formate wie CoreML oder LiteRT sind auf bestimmte Ökosysteme wie iOS beziehungsweise Android zugeschnitten.
- Unterstützung durch die Community: Für Formate wie PyTorch und TensorFlow gibt es umfangreiche Ressourcen und Unterstützung aus der Community.
Eine vergleichende Analyse findest du in unserer Dokumentation zu Exportformaten.
Um YOLO26-Modelle in einer Webanwendung bereitzustellen, kannst du LiteRT.js, die Web-Laufzeitumgebung von LiteRT, verwenden. Damit lassen sich Modelle für maschinelles Lernen direkt im Browser und in Node.js ausführen. Dadurch wird keine Backend-Infrastruktur benötigt und eine Leistung in Echtzeit ermöglicht.
- Exportiere das YOLO26-Modell in das LiteRT-Format.
- Integriere das exportierte Modell mit LiteRT.js in deine Webanwendung.
Eine Schritt-für-Schritt-Anleitung findest du in unserem LiteRT-Integrationsleitfaden.