Guía de inicio rápido: NVIDIA DGX Spark con Ultralytics YOLO26#
Esta guía completa ofrece un recorrido detallado para implementar Ultralytics YOLO26 en NVIDIA DGX Spark, el superordenador de IA de sobremesa compacto de NVIDIA. Además, muestra pruebas de rendimiento para demostrar las capacidades de YOLO26 en este potente sistema.
Esta guía se ha probado con NVIDIA DGX Spark Founders Edition ejecutando DGX OS basado en Ubuntu. Se espera que funcione con las versiones más recientes de DGX OS.
¿Qué es NVIDIA DGX Spark?#
NVIDIA DGX Spark es un superordenador de IA de sobremesa compacto impulsado por el superchip NVIDIA GB10 Grace Blackwell. Ofrece hasta 1 petaFLOP de rendimiento de computación de IA con precisión FP4, por lo que es ideal para desarrolladores, investigadores y científicos de datos que necesitan capacidades de IA potentes en un formato de sobremesa.
Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference
Especificaciones principales#
| Especificación | Detalles |
|---|---|
| Rendimiento de IA | Hasta 1 PFLOP (FP4) |
| GPU | Arquitectura NVIDIA Blackwell con Tensor Cores de quinta generación y RT Cores de cuarta generación |
| CPU | Procesador Arm de 20 núcleos (10 Cortex-X925 + 10 Cortex-A725) |
| Memoria | 128 GB de memoria de sistema unificada LPDDR5x, interfaz de 256 bits, 4266 MHz, ancho de banda de 273 GB/s |
| Almacenamiento | NVMe M.2 de 1 TB o 4 TB con cifrado automático |
| Red | 1x RJ-45 (10 GbE), Smart NIC ConnectX-7, Wi-Fi 7, Bluetooth 5.4 |
| Conectividad | 4x USB Type-C, 1x HDMI 2.1a, audio multicanal HDMI |
| Procesamiento de vídeo | 1x NVENC, 1x NVDEC |
DGX OS#
NVIDIA DGX OS es una distribución de Linux personalizada que proporciona una base de sistema operativo estable, probada y compatible para ejecutar aplicaciones de IA, aprendizaje automático y análisis en sistemas DGX. Incluye:
- Una base de Linux robusta optimizada para cargas de trabajo de IA
- Controladores y ajustes del sistema preconfigurados para hardware NVIDIA
- Actualizaciones de seguridad y funciones de mantenimiento del sistema
- Compatibilidad con el ecosistema de software más amplio de NVIDIA
DGX OS sigue un calendario de versiones periódico, con actualizaciones que normalmente se proporcionan dos veces al año (aproximadamente en febrero y agosto), además de parches de seguridad adicionales entre las versiones principales.
DGX Dashboard#
DGX Spark incluye un DGX Dashboard integrado que proporciona:
- Supervisión del sistema en tiempo real: Vista general de las métricas operativas actuales del sistema
- Actualizaciones del sistema: Posibilidad de aplicar actualizaciones directamente desde el panel
- Ajustes del sistema: Cambia el nombre del dispositivo y otras configuraciones
- JupyterLab integrado: Accede a Jupyter Notebooks locales para el desarrollo
Acceso al panel#
Haz clic en el botón "Show Apps" situado en la esquina inferior izquierda del escritorio de Ubuntu y, a continuación, selecciona "DGX Dashboard" para abrirlo en el navegador.
El panel incluye una instancia integrada de JupyterLab que crea automáticamente un entorno virtual e instala los paquetes recomendados al iniciarse. A cada cuenta de usuario se le asigna un puerto dedicado para acceder a JupyterLab.
Inicio rápido con Docker#
La forma más rápida de empezar con Ultralytics YOLO26 en NVIDIA DGX Spark es ejecutar con imágenes de Docker preconstruidas. La imagen NVIDIA ARM64 es compatible con DGX Spark con DGX OS.
t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $tLa solicitud de dispositivo CDI anterior se aplica a DGX Spark con DGX OS. Para cargas de trabajo de PyTorch en Jetson AGX Thor, consulta los requisitos de host independientes y la restricción de TensorRT en la guía de NVIDIA Jetson.
Esta imagen utiliza NVIDIA PyTorch 26.08, CUDA 13.4 y TensorRT 11. Actualiza el controlador de host de DGX OS a una versión compatible con NVIDIA PyTorch 26.08, y recompila los motores de TensorRT después de cambiar la imagen o la GPU de destino.
Cuando hayas terminado, ve directamente a la sección Usar TensorRT en NVIDIA DGX Spark.
Comienza con la instalación nativa#
Para realizar una instalación nativa sin Docker, sigue estos pasos.
Instalar el paquete de Ultralytics#
Aquí instalaremos el paquete Ultralytics en DGX Spark. Las dependencias de exportación se instalan automáticamente la primera vez que exportas un modelo, por lo que aquí solo se necesita el paquete base. Nos centraremos principalmente en las exportaciones de NVIDIA TensorRT, porque TensorRT garantizará que obtengamos el máximo rendimiento de DGX Spark.
-
Actualizar la lista de paquetes, instalar pip y actualizarlo a la última versión
sudo apt update sudo apt install python3-pip -y pip install -U pip -
Instalar el paquete pip
ultralyticspip install ultralytics -
Reiniciar el dispositivo
sudo reboot
Instalar PyTorch y Torchvision#
La instalación de ultralytics anterior instalará Torch y Torchvision. Sin embargo, es posible que estos paquetes instalados mediante pip no estén totalmente optimizados para la arquitectura ARM64 de DGX Spark con CUDA 13. Por ello, recomendamos instalar las versiones compatibles con CUDA 13:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130Al ejecutar PyTorch 2.9.1 en NVIDIA DGX Spark, es posible que aparezca el siguiente UserWarning al inicializar CUDA (por ejemplo, al ejecutar yolo checks, yolo predict, etc.):
UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)Puedes ignorar esta advertencia sin problemas. Para solucionarlo de forma permanente, se ha enviado una corrección en la PR de PyTorch #164590, que se incluirá en la versión PyTorch 2.10.
Instalar onnxruntime-gpu#
Las versiones actuales de ONNX Runtime GPU proporcionan paquetes (wheels) para Linux ARM64, incluyendo Python 3.12. La imagen de Docker de NVIDIA ARM64 instala el paquete oficial; para instalaciones nativas de CUDA 13, utiliza:
pip install onnxruntime-gpuUsar TensorRT en NVIDIA DGX Spark#
De todos los formatos de exportación de modelos compatibles con Ultralytics, TensorRT ofrece el mayor rendimiento de inferencia en NVIDIA DGX Spark, por lo que es nuestra principal recomendación para las implementaciones. Para consultar las instrucciones de configuración y el uso avanzado, visita nuestra guía específica de integración de TensorRT.
Convertir el modelo a TensorRT y ejecutar la inferencia#
El modelo YOLO26n en formato PyTorch se convierte a TensorRT para ejecutar la inferencia con el modelo exportado.
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Export the model to TensorRT
model.export(format="engine") # creates 'yolo26n.engine'
# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")
# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")Visita la página de exportación para acceder a argumentos adicionales al exportar modelos a distintos formatos de modelo
Pruebas de rendimiento de YOLO11 en NVIDIA DGX Spark#
El equipo de Ultralytics realizó pruebas de rendimiento de YOLO11 en varios formatos de modelo, midiendo la velocidad y la precisión: PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch. Las pruebas se realizaron en NVIDIA DGX Spark con precisión FP32 y un tamaño de imagen de entrada predeterminado de 640.
Tabla comparativa detallada#
La tabla siguiente muestra los resultados de las pruebas de rendimiento de cinco modelos diferentes (YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x) en varios formatos, e indica el estado, el tamaño, la métrica mAP50-95(B) y el tiempo de inferencia de cada combinación.
| Formato | Estado | Tamaño en disco (MB) | mAP50-95(B) | Tiempo de inferencia (ms/im) |
|---|---|---|---|---|
| PyTorch | ✅ | 5.4 | 0.5071 | 2.67 |
| TorchScript | ✅ | 10.5 | 0.5083 | 2.62 |
| ONNX | ✅ | 10.2 | 0.5074 | 5.92 |
| OpenVINO | ✅ | 10.4 | 0.5058 | 14.95 |
| TensorRT (FP32) | ✅ | 12.8 | 0.5085 | 1.95 |
| TensorRT (FP16) | ✅ | 7.0 | 0.5068 | 1.01 |
| TensorRT (INT8) | ✅ | 18.6 | 0.4880 | 1.62 |
| TF SavedModel | ✅ | 25.7 | 0.5076 | 36.39 |
| TF GraphDef | ✅ | 10.3 | 0.5076 | 41.06 |
| TF Lite | ✅ | 10.3 | 0.5075 | 64.36 |
| MNN | ✅ | 10.1 | 0.5075 | 12.14 |
| NCNN | ✅ | 10.2 | 0.5041 | 12.31 |
| ExecuTorch | ✅ | 10.2 | 0.5075 | 27.61 |
Probado con Ultralytics 8.3.249
Reproduce nuestros resultados#
Para reproducir los benchmarks de Ultralytics anteriores en todos los formatos de exportación, ejecuta este código:
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)Ten en cuenta que los resultados de las pruebas de rendimiento pueden variar en función del hardware y la configuración de software exactos del sistema, así como de la carga de trabajo actual del sistema en el momento de realizar las pruebas. Para obtener resultados más fiables, utiliza un conjunto de datos con un gran número de imágenes, por ejemplo, data='coco.yaml' (5000 imágenes de validación).
Prácticas recomendadas para NVIDIA DGX Spark#
Al utilizar NVIDIA DGX Spark, conviene seguir un par de prácticas recomendadas para lograr el máximo rendimiento al ejecutar YOLO26.
-
Supervisa el rendimiento del sistema
Utiliza las herramientas de supervisión de NVIDIA para controlar el uso de GPU y CPU:
nvidia-smi -
Optimiza el uso de la memoria
Con 128 GB de memoria unificada, DGX Spark puede gestionar tamaños de lote y modelos grandes. Considera la posibilidad de aumentar el tamaño del lote para mejorar el rendimiento:
from ultralytics import YOLO model = YOLO("yolo26n.engine") results = model.predict(source="path/to/images", batch=16) -
Usa TensorRT con FP16 o INT8
Para obtener el mejor rendimiento, exporta los modelos con precisión FP16 o INT8:
yolo export model=yolo26n.pt format=engine quantize=16 # FP16 yolo export model=yolo26n.pt format=engine quantize=8 # INT8
Actualizaciones del sistema (Founders Edition)#
Mantener tu DGX Spark Founders Edition actualizado es crucial para el rendimiento y la seguridad. NVIDIA proporciona dos métodos principales para actualizar el sistema operativo, los controladores y el firmware del sistema.
Uso de DGX Dashboard (recomendado)#
El DGX Dashboard es la forma recomendada de realizar actualizaciones del sistema y garantizar la compatibilidad. Te permite:
- Ver las actualizaciones del sistema disponibles
- Instalar parches de seguridad y actualizaciones del sistema
- Gestionar las actualizaciones de los controladores y el firmware de NVIDIA
Actualizaciones manuales del sistema#
Los usuarios avanzados pueden realizar las actualizaciones manualmente mediante el terminal:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo rebootAsegúrate de que tu sistema está conectado a una fuente de alimentación estable y de que has realizado una copia de seguridad de los datos críticos antes de efectuar las actualizaciones.
Siguientes pasos#
Para seguir aprendiendo y obtener asistencia, consulta la documentación de Ultralytics YOLO26.
Preguntas frecuentes#
Implementar Ultralytics YOLO26 en NVIDIA DGX Spark es sencillo. Puedes utilizar la imagen de Docker prediseñada para configurarlo rápidamente o instalar manualmente los paquetes necesarios. Encontrarás los pasos detallados para cada método en las secciones Inicio rápido con Docker y Empezar con la instalación nativa.
Los modelos YOLO26 ofrecen un rendimiento excelente en DGX Spark gracias al superchip GB10 Grace Blackwell. El formato TensorRT proporciona el mejor rendimiento de inferencia. Consulta la sección Tabla comparativa detallada para ver resultados específicos de las pruebas en distintos tamaños y formatos de modelo.
TensorRT es muy recomendable para implementar modelos YOLO26 en DGX Spark debido a su rendimiento óptimo. Acelera la inferencia aprovechando las capacidades de la GPU Blackwell, lo que garantiza la máxima eficiencia y velocidad. Obtén más información en la sección Usar TensorRT en NVIDIA DGX Spark.
DGX Spark ofrece hasta 1 PFLOP de rendimiento de IA y 128 GB de memoria unificada, frente a los 2070 TFLOPS y 128 GB de memoria de Jetson AGX Thor. DGX Spark está diseñado como un superordenador de IA de sobremesa, mientras que los dispositivos Jetson son sistemas integrados optimizados para la implementación en el edge.
Para las cargas de trabajo de PyTorch,
ultralytics/ultralytics:latest-nvidia-arm64es compatible con DGX Spark con DGX OS y Thor con JetPack 7.1. El TensorRT 11.2 incluido no es compatible con JetPack, por lo que los flujos de trabajo de TensorRT en Jetson deben utilizar el tiempo de ejecución compatible TensorRT 10.x para su versión de JetPack. Consulta los requisitos de Docker para Jetson.