Monitorización#
Ultralytics Platform proporciona monitoreo para endpoints desplegados. Realiza un seguimiento de las solicitudes de los endpoints, la latencia, los errores y los registros. Los endpoints dedicados de pago también proporcionan estadísticas de predicción en directo y ejemplos temporales que puedes inspeccionar y guardar en conjuntos de datos.

Panel de despliegues#
La página Deploy de la barra lateral sirve como panel de monitorización de todos tus despliegues. Combina el mapa del mundo, las métricas generales y la gestión de despliegues en una sola vista. Consulta Dedicated Endpoints para crear y gestionar despliegues.
graph TB
subgraph Dashboard
Map[World Map]:::proc --- Cards[Overview Cards]:::proc
Cards --- List[Deployments List]:::decide
end
subgraph "Per Ready Deployment"
Monitoring[Monitoring Tab: Paid Endpoints]:::out
Metrics[Metrics Row]:::out
Health[Health Check]:::out
Logs[Logs Tab]:::out
Code[Code Tab]:::out
Predict[Predict Tab]:::out
end
List --> Monitoring
List --> Metrics
List --> Health
List --> Logs
List --> Code
List --> Predict
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fffTarjetas de resumen#
Cuatro tarjetas de resumen en la parte superior de la página muestran:

| Métrica | Descripción |
|---|---|
| Solicitudes HTTP (24h) | Solicitudes HTTP en todos los endpoints, incluidas las solicitudes de predicción, monitoreo y estado |
| Despliegues activos | Endpoints que se encuentran actualmente en estado Ready |
| Tasa de errores HTTP (24h) | Proporción de respuestas con estado 4xx o 5xx, ponderada según el volumen de solicitudes |
| Latencia P95 HTTP (24h) | Media de las latencias del percentil 95 por hora, ponderada según el volumen |
Se muestra la latencia P95 en lugar de la latencia mediana porque las comprobaciones de estado responden en un par de milisegundos y, de lo contrario, dominarían la percepción de la latencia de inferencia real.
La tarjeta de tasa de errores se resalta en rojo cuando la tasa supera el 5 %. Comprueba la pestaña Logs en los despliegues individuales para diagnosticar los errores.
Mapa del mundo#
El mapa del mundo interactivo muestra:
- Marcadores de región para las 42 regiones disponibles
- Marcadores verdes para las regiones con un despliegue listo
- Marcadores azules animados para las regiones con despliegues activos en curso
- El tamaño del marcador varía según el estado del despliegue y la latencia
Haz clic en cualquier región para abrir el diálogo New Deployment. El mapa se oculta en pantallas pequeñas.

Lista de despliegues#
Debajo de las tarjetas de resumen, la lista de despliegues muestra todos los endpoints de tus proyectos. Usa el selector del modo de vista para alternar entre:
| Vista | Descripción |
|---|---|
| Tarjetas | Tarjetas de detalles completos con métricas, registros, código, predicción y pestañas de monitoreo elegibles |
| Compacta | Cuadrícula de tarjetas más pequeñas (de 1 a 4 columnas) con las métricas principales |
| Tabla | Tabla de datos con columnas ordenables: nombre, región, estado, solicitudes, P95 y errores |
El panel se actualiza automáticamente y lo hace con mayor frecuencia mientras los despliegues se encuentran en un estado de transición (creating, deploying o stopping). Haz clic en el botón de actualización para obtener actualizaciones inmediatas.
Métricas por despliegue#
Cada tarjeta de despliegue (en la vista de tarjetas) muestra métricas en tiempo real. La fila de métricas, la comprobación de estado y las pestañas Logs, Code y Predict descritas a continuación solo aparecen mientras el despliegue está Ready:
Fila de métricas#
| Métrica | Descripción |
|---|---|
| Solicitudes | Número de solicitudes de las últimas 24 horas |
| Latencia P95 | Media de las latencias del percentil 95 por hora (24 h) |
| Tasa de errores | Proporción de respuestas 4xx y 5xx, que solo se muestra cuando es superior a 0 |
Las métricas se actualizan automáticamente. Los endpoints que aún no han atendido ninguna solicitud muestran «Aún no hay tráfico», y las métricas solo se recopilan para los despliegues en estado Ready. En el panel de despliegues, las métricas se obtienen para los 20 despliegues más recientes.
Comprobación del estado#
Los despliegues en ejecución muestran un indicador de comprobación de estado:
| Indicador | Significado |
|---|---|
| Corazón verde | Correcto: muestra la latencia de respuesta |
| Corazón rojo | Incorrecto: muestra el mensaje de error |
| Icono giratorio | Comprobación de estado en curso |
Las comprobaciones de estado se reintentan automáticamente mientras el estado sea incorrecto y se detienen cuando el endpoint responde. Haz clic en el icono de actualización para activar manualmente una comprobación de estado, que también sirve para calentar un endpoint escalado a cero antes de enviar tráfico.

La plataforma concede tiempo adicional a la comprobación de estado y reintenta los fallos de conexión transitorios, para que un endpoint escalado a cero tenga tiempo de iniciarse. Si la tarjeta muestra «El servicio se está iniciando...», actualízala para detectar una instancia cuyo arranque haya terminado mientras tanto.
Pestaña de monitoreo#
Abre Deploy, cambia a la vista Cards y selecciona Monitoring en un endpoint dedicado de pago que esté en estado Ready. Envía una imagen a través de su pestaña Predict o de la API del endpoint para rellenar Temporary Examples y Prediction Statistics. Antes de procesar la primera imagen, la pestaña muestra No images processed.
El monitoreo requiere un endpoint de pago facturado por tiempo de actividad que ejecute un tiempo de ejecución compatible con el monitoreo. Un endpoint incluido no obtiene esta pestaña únicamente por tener un plan de espacio de trabajo de pago. Consulta Dedicated Endpoints para conocer la configuración de recursos. Los endpoints existentes no se actualizan automáticamente con cada lanzamiento del tiempo de ejecución, por lo que un endpoint más antiguo puede mostrar Monitoring unavailable hasta que se actualice su tiempo de ejecución.

El monitoreo es ligero y temporal: los gráficos, las estadísticas de predicción y las imágenes de ejemplo viven únicamente en la memoria de la instancia de servicio. Pueden perderse cuando el endpoint se apaga, se detiene, se reinicia, se vuelve a desplegar, cambia de recursos o reemplaza su modelo. El historial no se restaura cuando el endpoint vuelve a iniciarse. Guarda los ejemplos útiles en un conjunto de datos y espera a que termine la ingesta antes de cambiar el endpoint.
Ejemplos temporales#
La galería contiene una muestra dinámica de imágenes procesadas con superposiciones de predicción. Abre una imagen para inspeccionar las predicciones en el visor de pantalla completa y usa los controles de visibilidad para ajustar las superposiciones. La galería muestra inicialmente hasta 12 ejemplos; Show all la amplía.
- Muestreo: Hasta dos ejemplos inicialmente, y luego hasta una imagen adicional por minuto. La captura se realiza según el mejor esfuerzo; la inferencia no espera a que se codifique el ejemplo.
- Capacidad: Como máximo 100 imágenes dentro de un presupuesto de memoria compartido de 100 MiB para imágenes comprimidas, metadatos de predicción y recursos asociados. La interfaz etiqueta este presupuesto como 100 MB.
- Reemplazo: Los ejemplos más antiguos se reemplazan cuando se alcanza cualquiera de los dos límites. Un ejemplo puede dejar de estar disponible mientras lo estás viendo.
- Almacenamiento: Los ejemplos temporales permanecen en la memoria del endpoint. Guardarlos en un conjunto de datos utiliza los límites normales de almacenamiento y procesamiento del espacio de trabajo.

Guardar ejemplos en un conjunto de datos#
Los miembros del espacio de trabajo con permisos de edición de contenido pueden guardar ejemplos en un conjunto de datos dentro del espacio de trabajo del endpoint:
- Selecciona ejemplos individuales usando sus casillas de verificación o haz clic en Select all.
- Haz clic en Save to dataset.
- Elige un conjunto de datos existente con la misma tarea que el modelo desplegado. Los conjuntos de datos de origen conectado quedan excluidos; crea primero un conjunto de datos compatible si no hay ninguno disponible.
- Haz clic en el botón Save, que muestra el recuento de imágenes seleccionadas, y luego abre el conjunto de datos para seguir el procesamiento.
Las imágenes y predicciones seleccionadas se copian a través del flujo de trabajo estándar de carga e ingesta de conjuntos de datos. Se aplican la cuota normal, el mapeo de clases y el manejo de duplicados. Guardar los ejemplos deja los ejemplos temporales en la galería; las imágenes del conjunto de datos ingresadas con éxito sobreviven a los reinicios y a la eliminación del endpoint. Revisa las etiquetas predichas antes de usarlas para el entrenamiento.

Para eliminar ejemplos temporales, usa el control de papelera al pasar el cursor sobre una imagen o selecciona los ejemplos y haz clic en el botón de papelera masiva, luego confirma Delete. La eliminación de ejemplos deja intactas las estadísticas de predicción agregadas y las imágenes ya guardadas en los conjuntos de datos.
Estadísticas de predicción#
Las estadísticas agregan las imágenes procesadas independientemente del muestreo de la galería. Eliminar o reemplazar un ejemplo no resta su contribución. El resumen muestra las imágenes, las predicciones y las imágenes sin predicciones para el período seleccionado; los modelos de profundidad muestran el recuento de imágenes.
El selector de fechas toma por defecto los últimos 30 days y acepta rangos de hasta 365 days. Las fechas seleccionadas usan límites en UTC; las marcas de tiempo de los gráficos se muestran en hora local. Los rangos recientes de hasta tres días utilizan un historial por hora cuando todo el rango se encuentra dentro de las últimas 72 horas; otros rangos utilizan un historial diario. El rango de fechas filtra las estadísticas, mientras que la galería continúa mostrando los ejemplos temporales actuales.
El historial está limitado a 72 hourly buckets y 365 daily buckets, y está disponible únicamente desde que se inició la instancia actual. Un período seleccionado sin imágenes procesadas muestra No images processed in this period.
Los gráficos disponibles dependen de la tarea y de las predicciones recopiladas:
| Gráfica | Lo que muestra |
|---|---|
| Predictions over Time | Totales de imágenes procesadas y predicciones; los modelos de profundidad muestran Images over Time |
| Inference Time | Tiempo medio de inferencia del modelo en milisegundos, excluyendo la red y la sobrecarga de solicitudes |
| Clases principales | Recuentos de predicciones por clase |
| Predictions per Image | Distribución que incluye imágenes sin predicciones y un intervalo final de 100+; oculto para clasificación y profundidad |
| Prediction Confidence | Distribución de la confianza y media, cuando las puntuaciones de confianza están disponibles |
| Confidence over Time | Confianza media de predicción para cada intervalo de tiempo |
| Prediction Dimensions | Ancho y alto de la predicción en relación con la imagen de entrada, cuando las dimensiones de la caja están disponibles |
| Prediction Locations | Mapa de calor espacial de las predicciones, cuando los datos de ubicación están disponibles |


La confianza mide la certeza del modelo, no su corrección. Inspecciona los ejemplos y compáralos con las etiquetas revisadas al evaluar la precisión. Inference Time mide la ejecución del modelo; la P95 Latency del despliegue incluye el manejo de solicitudes y también puede reflejar tráfico ajeno a la inferencia, como las comprobaciones de estado.
El monitoreo se actualiza aproximadamente cada 2 seconds mientras su panel está abierto y visible. El sondeo se pausa cuando el panel está fuera de la pantalla o la pestaña del navegador está oculta. Una inferencia exitosa a través de la pestaña Predict del despliegue también activa una actualización de las estadísticas.
Registros#
Cada tarjeta de despliegue incluye una pestaña Logs para consultar las entradas de registro recientes:

Entradas de registro#
Cada entrada de registro muestra:
| Campo | Descripción |
|---|---|
| Gravedad | Barra codificada por colores (consulta la sección siguiente) |
| Marca de tiempo | Hora de la solicitud (formato local) |
| Mensaje | Contenido del registro |
| Información HTTP | Código de estado y latencia (si procede) |
Cada entrada incluye una barra de gravedad codificada por colores:
| Nivel | Color | Descripción |
|---|---|---|
| DEBUG | Gris | Mensajes de depuración |
| INFO | Azul | Solicitudes normales |
| WARNING | Ámbar | Problemas no críticos |
| ERROR | Rojo | Solicitudes fallidas |
| CRITICAL | Rojo | Fallos críticos |
La API acepta el conjunto completo de niveles de gravedad de los registros como filtro separado por comas: DEBUG, INFO, NOTICE, WARNING, ERROR, CRITICAL, ALERT y EMERGENCY.
La interfaz de usuario muestra las 20 entradas más recientes y oculta las que están vacías. La API utiliza de forma predeterminada 50 entradas por solicitud (máximo 200) y devuelve un nextPageToken para paginar hacia atrás.
Al investigar errores: haz clic primero en Errors para filtrar las entradas ERROR y WARNING; después, revisa las marcas de tiempo y los códigos de estado HTTP. Copia los registros al portapapeles para compartirlos con tu equipo.
Ejemplos de código#
Cada tarjeta de implementación incluye una pestaña Code que muestra código de API listo para usar con la URL del endpoint ya cumplimentada. Para los propietarios del espacio de trabajo, se inserta la clave de API asociada a la implementación, lista para copiarla y ejecutarla. Los usuarios que no son propietarios ven un marcador de posición YOUR_API_KEY:
import requests
# Deployment endpoint
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Send image for inference
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())Al ver la pestaña Code en la plataforma, la URL del endpoint y, para los propietarios del espacio de trabajo, la clave de API asociada se cumplimentan automáticamente. Consulta Claves de API para generar una clave.
Predict del despliegue#
La pestaña Predict de cada tarjeta de implementación proporciona un panel de predicción integrado: la misma interfaz que la pestaña Predict del modelo, pero ejecutando la inferencia a través del endpoint de implementación en lugar del servicio compartido. Resulta útil para probar directamente un endpoint implementado desde el navegador. Consulta Inferencia para obtener información sobre los parámetros y los formatos de respuesta.
Endpoints de API#
Cada implementación se identifica mediante su propietario y su nombre, y cada ruta requiere una clave de API. Consulta la referencia de la API para obtener información sobre la autenticación.
Métricas de la implementación#
GET /api/deployments/{owner}/{deployment}/metrics?range=24hSDK de Python: client.deployments.metrics(owner, deployment, range="24h")
Devuelve la carga útil completa de métricas de una implementación: un bloque summary con el total de solicitudes, el número y la tasa de errores, y la latencia media, P50, P95 y P99, además de matrices timeSeries para las solicitudes, los errores y la latencia P50 y P95, el uso de CPU y memoria, y el número de instancias.
| Parámetro | Tipo | Descripción |
|---|---|---|
range | string | Intervalo de tiempo: 1h, 6h, 24h, 7d o 30d (por defecto, 24h) |
sparkline | bool | Devuelve el resumen compacto del panel en lugar de la carga útil completa |
Con sparkline=true, la respuesta tiene el formato compacto que utilizan las tarjetas de implementación: 24 recuentos de solicitudes por hora, además del total de solicitudes, la tasa de errores y la latencia media. Esta es la llamada que se actualiza cada 60 segundos.
Registros de la implementación#
GET /api/deployments/{owner}/{deployment}/logs?limit=50&severity=ERROR,WARNINGSDK de Python: client.deployments.logs(owner, deployment, limit=50, severity="ERROR,WARNING")
Devuelve las entradas de registro recientes con un filtro de gravedad y paginación opcionales.
| Parámetro | Tipo | Descripción |
|---|---|---|
limit | int | Número máximo de entradas que se devolverán (por defecto: 50; máximo: 200) |
severity | string | Filtro de gravedad separado por comas |
pageToken | string | Token de paginación de la respuesta anterior |
Estado de la implementación#
GET /api/deployments/{owner}/{deployment}/healthSDK de Python: client.deployments.health(owner, deployment)
Hace ping a la implementación y devuelve su estado de salud con la latencia de ida y vuelta medida:
{
"healthy": true,
"status": 200,
"latencyMs": 142
}Una respuesta que indica que no está saludable omite status cuando no se ha podido acceder al endpoint en absoluto y añade un mensaje error.
Los números agregados de la página Deploy no están disponibles como un único endpoint REST. Reprodúcelos llamando a la ruta de métricas para cada implementación devuelta por GET /api/deployments/{owner} (client.deployments.list(owner)).
Optimización del rendimiento#
Usa los datos de monitorización para optimizar tus implementaciones:
Si la latencia es demasiado alta:
- Verifica que el tamaño del modelo sea adecuado
- Plantéate utilizar una región más cercana
- Comprueba el tamaño de la imagen enviada con cada solicitud
Prueba con un valor menor de imgsz y compara la latencia y la precisión resultantes de tu modelo. Implementa en una región más cercana a los clientes para reducir la latencia de red.
Preguntas frecuentes#
Las estadísticas de predicción y los ejemplos temporales duran únicamente durante el tiempo de vida de la instancia de servicio, dentro de los límites de los intervalos y de la galería descritos anteriormente. Detener, reiniciar, volver a desplegar, cambiar el tamaño o reemplazar el modelo puede borrarlos. Solo los ejemplos guardados con éxito en un conjunto de datos persisten independientemente del endpoint.
Las métricas operativas y los registros tienen ventanas de historial separadas. La API de métricas admite ventanas seleccionables desde 1 hora hasta 30 días, muestreadas de forma más gruesa a medida que la ventana crece — intervalos de 1 minuto durante 1 hora hasta intervalos de 4 horas durante 30 días. La tarjeta de despliegue muestra las 20 entradas de registro más recientes; la API de registros puede devolver hasta 200 entradas por solicitud y admite la paginación.
Las métricas y los registros solo se conservan mientras exista la implementación, por lo que eliminar una implementación también impide acceder a su historial. Exporta todo lo que necesites conservar antes de eliminar un endpoint.
Sí, la página de implementaciones muestra todos los endpoints con tarjetas de resumen agregadas. Usa la vista de tabla para comparar el rendimiento entre implementaciones.
No. Las métricas y las comprobaciones de estado solo se recopilan para las implementaciones en estado Ready. Un endpoint detenido conserva su tarjeta y su ventana de historial, pero no muestra datos en tiempo real hasta que lo vuelvas a iniciar.