Casa Blog

Como executar qualquer modelo de rosto de abraço atrás de uma API compatível com OpenAI

Execute qualquer modelo de face de abraço na nuvem de GPU EmpirioLabs

Jun 8, 2026

EmpirioLabs AI

Modelos abertos alcançaram rapidamente. Laboratórios como Qwen, DeepSeek, GLM, Kimi e Mistral mantêm o envio de modelos de texto abertos fortes no Hugging Face, e para muito trabalho eles são tudo o que você precisa. A parte difícil nunca foi o modelo. É tudo ao seu redor: encontrar uma GPU, instalar os drivers certos e servir pilha, carregar os pesos, expor uma porta e obter uma conexão estável de volta ao seu aplicativo.

GPU Cloud remove esse trabalho. Você implementa uma GPU gerenciada, cola um id do repositório Hugging Face e EmpirioLabs serve o modelo por trás de um endpoint compatível com OpenAI. Como o endpoint fala a API padrão do OpenAI, você pode apontar quase qualquer ferramenta para ele: uma interface de chat como SillyTavern, um assistente de codificação, seus próprios scripts, ou os SDKs oficiais do OpenAI. Este guia percorre todo o fluxo, incluindo como escolher uma GPU.

Implantar um modelo

Abra a página da GPU Cloud no painel, escolha implantar um modelo e cole qualquer ID do repositório do Hugging Face, por exemplo Qwen/Qwen3.5-4BEscolha uma GPU e depois implante. EmpirioLabs baixa os pesos, inicia um motor de serviço de alto desempenho e expõe o modelo em um endpoint compatível com OpenAI. Os modelos de segurança padrão são servidos automaticamente, e repositórios GGUF quantizados também são manipulados, então a maioria dos modelos de texto no Hugging Face funcionam sem nenhuma configuração extra.

Você pode fazer a mesma coisa sobre a API. A chamada de implantação devolve um ID de instância com um estado de provisionamento. Pesquise a instância até que seja em execução.

curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "Autorização: Carregador $EMPIRIOLABS API KEY" \ -H "Tipo de Conteúdo: application/json " \ -d '{ "gpu slug": "rtx-a6000", "modo": "modelo", "hf id": " Qwen/Qwen3.5-4B " }'

Um modelo leva alguns minutos para aparecer pela primeira vez, já que os pesos têm que baixar e carregar na memória da GPU. Depois disso, a instância está pronta para receber pedidos.

Escolha a GPU certa

A principal coisa que decide qual GPU você precisa é quanta memória o modelo leva. Um modelo de texto servido com precisão de 16 bits precisa de aproximadamente 2 GB de memória GPU por bilhão de parâmetros, além de headroom para a janela de contexto e o cache de valor chave. Então, um modelo 7B quer em algum lugar de 16 a 20 GB, um modelo 30B quer um cartão único grande, e um modelo 70B quer o maior cartão único ou vários cartões juntos. Compilações quantitativas usam muito menos memória, o que permite um modelo maior caber em uma GPU menor.

Um bom padrão para modelos de texto pequenos e médios é o RTX A6000 com 48 GB a 0.65 USD por hora. Ele roda confortavelmente modelos até aproximadamente 13B com precisão total, e muito maiores quando eles são quantizados. Para modelos em torno de 30B, passar para um A100 ou H100 com 80 GB. Para 70B e acima, use um H200 com 141 GB, ou divida o modelo em várias GPUs em uma única instância, que é como os maiores modelos são servidos. O painel mostra a memória de cada GPU ao lado de seu preço de hora, e se um modelo precisa de mais memória do que a GPU que você escolheu, o implante é bloqueado antes de começar, então você nunca paga por um que não se encaixa.

Use-o em qualquer aplicativo compatível com OpenAI

É aqui que se torna útil. Uma instância de modelo em execução dá-lhe uma URL base de ligação que se parece com esta:

https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1

Essa URL é uma URL base do OpenAI. Qualquer coisa que possa falar com a API OpenAI pode falar com o seu modelo. Você precisa de três valores: o URL base acima, sua chave API EmpirioLabs como o token portador, e o nome do modelo, que é o ID exato do repositório que você implantou, por exemplo Qwen/Qwen3.5-4B. O desfecho também responde /v1/models, então os clientes que buscam uma lista de modelos para preencher um trabalho suspenso como esperado.

curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -H "Autorização: Carregador $EMPIRIOLABS API KEY" \ -H "Tipo de Conteúdo: application/json " \ -d '{ "modelo": " Qwen/Qwen3.5-4B ", "mensagens": [{ "role": "usuário", "contente": "Olá"}] }'

Se preferir o OpenAI SDK, aponte a sua URL base no mesmo caminho de ligação e tudo o resto permanece igual:

do openai import Cliente OpenAI = OpenAI(base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPIRIOLABS API KEY",) resposta = client.chat.completions.create(model=" Qwen/Qwen3.5-4B ", mensagens=[{"role": "user", "content": "Hello"}],) print(resposta. choices[0].message.content)

Os mesmos três valores se conectam às ferramentas que você já usa. Em um frontend de bate-papo, como SillyTavern, Open WebUI ou LibreChat, escolha o provedor compatível com OpenAI ou personalizado, defina a URL da API para sua URL base de conexão, cole sua chave API EmpirioLabs e digite o nome do modelo mostrado na instância. Assistentes de codificação que aceitam uma URL base personalizada do OpenAI, como Cline, Continue e Aider, são configurados da mesma forma. Representar frontends, frameworks de agentes, pipelines de recuperação e qualquer serviço interno seguem o mesmo padrão: URL base, chave, modelo.

Converse com ele no painel

Você não precisa de uma ferramenta externa para tentar um modelo que você acabou de implantar. Cada instância que serve uma API compatível com OpenAI recebe uma página de chat integrada. Abra a instância da página GPU Cloud, clique em Chat com este modelo e comece a digitar. A página de bate-papo transmite respostas, suporta um prompt de sistema e os controles de amostragem habituais, e executa a mesma conexão segura que a API, então não há nada extra para configurar e nenhuma cobrança separada, porque a instância já é medido pela segunda.

Pausa quando não estiver a usá- lo

A GPU Cloud é faturada por segundo de tempo de execução, e a taxa horária é bloqueada quando você implantar, então uma mudança de preço nunca afeta uma instância que já está em execução. Quando você não precisa do modelo, pare a instância. Isso libera a GPU e pára de cobrar imediatamente. Inicie-o novamente mais tarde e EmpirioLabs reposiciona o mesmo modelo na próxima GPU disponível. Parar limpa o armazenamento efêmero da instância, então trate-o como espaço de arranhão e destrua uma instância quando terminar com ela. O gasto vitalício e por instance são visíveis na página da GPU Cloud e através /v1/account/usage.

Começar

Abrir Nuvem GPU no painel para implantar seu primeiro modelo, ou ler Documentação da GPU Cloud para a API completa.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.