Los modelos abiertos han subido rápido. Laboratorios como Qwen, DeepSeek, GLM, Kimi y Mistral siguen enviando fuertes modelos de texto abiertos en Hugging Face, y para mucho trabajo son todo lo que necesitas. La parte dura nunca ha sido el modelo. Está todo a su alrededor: encontrar una GPU, instalar los controladores adecuados y la pila de servicio, cargar los pesos, exponer un puerto, y conseguir una conexión estable de nuevo a su aplicación.
GPU Cloud elimina ese trabajo. Usted implementa una GPU administrada, pega un repositorio Hugging Face id, y EmpirioLabs sirve el modelo detrás de un punto final compatible con OpenAI. Debido a que el endpoint habla la API estándar de OpenAI, puedes señalar casi cualquier herramienta en ella: un frontend de chat como SillyTavern, un asistente de codificación, tus propios scripts, o los SDKs oficiales de OpenAI. Esta guía recorre todo el flujo, incluyendo cómo elegir una GPU.
Implementar un modelo
Abra la página GPU Cloud en el panel de control, elija desplegar un modelo y pegar cualquier repositorio Hugging Face id, por ejemplo Qwen/Qwen3.5-4BEscoge una GPU, luego despliega. EmpirioLabs descarga los pesos, inicia un motor de servicio de alto rendimiento y expone el modelo en un punto final compatible con OpenAI. Los modelos estándar de Safetensors se sirven automáticamente, y los repositorios GGUF cuantificados se manejan también, por lo que la mayoría de los modelos de texto en Hugging Face trabajan sin configuración adicional.
Usted puede hacer lo mismo sobre la API. La llamada de despliegue devuelve una instancia id con un estado de provisionesVotar el caso hasta que esté corriendo.
curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "gpu slug": "rtx-a6000", "mode": "model", "hf 2 K"
Un modelo tarda unos minutos en llegar la primera vez, ya que los pesos tienen que descargar y cargar en la memoria GPU. Después de eso, el caso está listo para recibir solicitudes.
Elija la GPU correcta
Lo principal que decide qué GPU necesita es cuánto memoria toma el modelo. Un modelo de texto servido a 16 bits de precisión necesita aproximadamente 2 GB de memoria GPU por mil millones de parámetros, además de la sala para la ventana contextual y el caché de valor clave. Así que un modelo 7B quiere alrededor de 16 a 20 GB, un modelo 30B quiere una tarjeta única grande, y un modelo 70B quiere la tarjeta única más grande o varias cartas juntas. Las construcciones cuantificadas utilizan mucho menos memoria, lo que permite que un modelo más grande se ajuste a una GPU más pequeña.
Un buen defecto para los modelos de texto pequeños y medianos es el RTX A6000 con 48 GB a 0.65 USD por hora. Funciona cómodamente modelos hasta aproximadamente 13B a toda precisión, y mucho más grandes cuando están cuantificados. Para modelos alrededor de 30B, mueva hasta un A100 o H100 con 80 GB. Para 70B y más arriba, utilice un H200 con 141 GB, o dividir el modelo en varias GPUs en una sola instancia, que es cómo se sirven los modelos más grandes. El panel muestra la memoria de cada GPU junto a su precio por hora, y si un modelo necesita más memoria que la GPU que escogiste, el despliegue está bloqueado antes de que comience, por lo que nunca pagas por uno que no puede caber.
Úsalo en cualquier aplicación compatible con OpenAI
Aquí es donde se pone útil. Una instancia modelo en ejecución le da una URL base de conexión que se ve así:
https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1
Esa URL es una URL base de OpenAI. Cualquier cosa que pueda hablar con la API OpenAI puede hablar con su modelo. Necesitas tres valores: la URL base arriba, tu clave de API EmpirioLabs como símbolo del portador, y el nombre del modelo, que es el repositorio exacto id que implementaste, por ejemplo Qwen/Qwen3.5-4B. El punto final también responde /v1/models, así que los clientes que buscan una lista de modelos para llenar un trabajo desplegable como se esperaba.
curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "model": " Qwen/Qwen3.5-4B ", "message": [{ "role": "us]
Si prefiere el SDK OpenAI, señale su URL base en la misma ruta de conexión y todo lo demás permanece igual:
desde openai import OpenAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPIRIOLABS API KEY",) response = client.chat.completions.create(model=" Qwen/Qwen3.5-4B ", messages=[{"role": "user", "content]
Los mismos tres valores conectan las herramientas que ya usas. En un frontend de chat como SillyTavern, Open WebUI o LibreChat, elija el proveedor compatible con OpenAI o personalizado, establezca la URL de API a su URL de base de conexión, pega su clave de API EmpirioLabs e introduzca el nombre de modelo que se muestra en la instancia. Los asistentes de codificación que aceptan una URL base de OpenAI personalizada, como Cline, Continue y Aider, se configuran de la misma manera. Los frontends de Roleplay, los marcos de agentes, los oleoductos de recuperación y cualquier servicio interno siguen el mismo patrón: URL base, clave, modelo.
Charla con él en el tablero
Usted no necesita una herramienta externa para probar un modelo que acaba de desplegar. Cada instancia que sirve una API compatible con OpenAI obtiene una página de chat integrada. Abra la instancia de la página GPU Cloud, haga clic en Chat con este modelo y empiece a escribir. La página de chat transmite las respuestas, admite un sistema rápido y los controles habituales de muestreo, y se ejecuta sobre la misma conexión segura que la API, por lo que no hay nada extra para configurar y ninguna facturación separada, porque la instancia ya está medido por el segundo.
Pausa cuando no lo estés usando
GPU Cloud se factura por segundo de tiempo de ejecución, y la tarifa horaria está bloqueada cuando se implementa, por lo que un cambio de precio nunca afecta a una instancia que ya está funcionando. Cuando usted no necesita el modelo, detenga la instancia. Eso libera la GPU y detiene la facturación inmediatamente. Comience de nuevo más tarde y EmpirioLabs redistribuye el mismo modelo en la próxima GPU disponible. Dejar de aclarar el almacenamiento efímero de la instancia, así que tratarlo como espacio de arañazo, y destruir una instancia cuando se termine con él. Los gastos por vida y por posición son visibles en la página de GPU Cloud y a través de /v1/account/usage.
Empieza
Abierto Nube de GPU en el panel para desplegar su primer modelo, o leer el Documentación de GPU Cloud para la API completa.



