Alquilar una GPU siempre ha implicado más pasos de lo que debería. Elige un proveedor, espera la capacidad, configura una imagen, expone un puerto y espera que la caja sea accesible. GPU Cloud elimina esa fricción. Usted implementa una instancia GPU gestionada en un clic, y EmpirioLabs maneja la provisión, el networking y la conexión segura de nuevo a usted.
GPU Cloud está ahora disponible generalmente en cada cuenta de EmpirioLabs. Esto es lo que puedes hacer con él.
Implementar un modelo en un clic
La manera más rápida de utilizar GPU Cloud es servir un modelo. Pruebe cualquier repositorio Hugging Face id, elija una GPU, y despliegue. EmpirioLabs carga los pesos y sirve el modelo desde un punto final compatible con OpenAI, por lo que su código de cliente existente funciona sin cambios.
curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "gpu slug": "rtx-4090", "mode": "hf id": " K
La llamada devuelve una instancia id con un estado de provisionesVotar el caso hasta que esté corriendo, luego enviar solicitudes a su camino de conexión. Para un modelo, ese camino es una URL base estándar de OpenAI:
curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "model": " Qwen/Qwen2.5-7B-Instruct ", "message": [{ "role": "us]
Chatea con tu modelo justo en el panel
No tienes que escribir ningún código para probar un modelo que acabas de desplegar. Cada instancia que sirve una API compatible con OpenAI obtiene una página de chat integrada en el panel de control. Abra la instancia de la página GPU Cloud, haga clic en Chat con este modelo y empiece a escribir. La página de chat transmite respuestas, admite un impulso del sistema y los controles de muestreo habituales, y le permite adjuntar imágenes o audio para modelos multimodales. Se ejecuta sobre la misma conexión segura que la API, por lo que no hay nada extra para configurar y no hay facturación separada, porque el caso ya está medido por el segundo.
Plantillas y contenedores personalizados
No todo volumen de trabajo es un modelo de chat. GPU Cloud envía plantillas de un clic para los entornos más comunes, incluyendo PyTorch con JupyterLab, ComfyUI, un terminal web y Ollama. Elija una plantilla, elija una GPU, y el entorno se abre en su navegador a través del panel de control.
Si necesita control completo, despliegue su propia imagen CUDA Docker. Point GPU Nube a la imagen, lista los puertos que sirve, y alcanzarla a través de la misma ruta de conexión que un modelo utilizaría.
curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "gpu slug": "rtx-4090", "mode": "template", "template sluch":
Precios
GPU Cloud se factura por segundo de tiempo de funcionamiento. La tarifa horaria se muestra antes de desplegarse y está bloqueada para la vida de esa instancia, por lo que un cambio de precio nunca afecta a un alquiler que ya está funcionando. Detener o destruir una instancia libera la GPU y detiene la facturación inmediatamente, y el almacenamiento efímero se elimina cuando la instancia se detiene, así que tratarlo como espacio de rasguños. Los gastos por vida y por posición son visibles en la página de GPU Cloud y a través de /v1/account/usage.
Empieza
Abierto Nube de GPU en el panel para desplegar su primera instancia, o leer el Documentación de GPU Cloud para la API completa.



