Les modèles ouverts ont rattrapé rapidement. Les laboratoires comme Qwen, DeepSeek, GLM, Kimi et Mistral continuent d'envoyer des modèles de texte ouverts sur Hugging Face, et pour beaucoup de travail, ils sont tout ce dont vous avez besoin. La partie dure n'a jamais été le modèle. C'est tout autour: trouver un GPU, installer les bons pilotes et servir la pile, charger les poids, exposer un port, et obtenir une connexion stable de retour à votre application.
GPU Cloud supprime ce travail. Vous déployez un GPU géré, collez un id de dépôt Hugging Face et EmpirioLabs sert le modèle derrière un paramètre compatible OpenAI. Parce que le paramètre parle de l'API OpenAI standard, vous pouvez pointer presque n'importe quel outil dessus: un frontend de chat comme SillyTavern, un assistant de codage, vos propres scripts, ou les SDK OpenAI officiels. Ce guide passe par tout le flux, y compris la façon de choisir un GPU.
Déployer un modèle
Ouvrez la page GPU Cloud dans le tableau de bord, choisissez de déployer un modèle et collez n'importe quel id de dépôt Hugging Face, par exemple Qwen/Qwen3.5-4B. Choisissez un GPU, puis déployez. EmpirioLabs télécharge les poids, démarre un moteur de service à haut débit et expose le modèle sur un paramètre compatible OpenAI. Les modèles de sécurité standard sont fournis automatiquement, et les dépôts GGUF quantifiés sont également manipulés, de sorte que la plupart des modèles de texte sur Hugging Face fonctionnent sans configuration supplémentaire.
Vous pouvez faire la même chose sur l'API. L'appel de déploiement renvoie un identifiant d'instance avec un statut de fourniture. Sondagez l'instance jusqu'à ce qu'elle soit exécution.
curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "Autorisation: porteur $EMPIRIOLABS API KEY" \ -H "Type de contenu: application/json " \ -d '{ "gpu slug": "rtx-a6000", "mode": "modèle", "hf id": " Qwen/Qwen3.5-4B " }'
Un modèle prend quelques minutes pour monter la première fois, puisque les poids doivent télécharger et charger dans la mémoire GPU. Après cela, l'instance est prête à recevoir des demandes.
Choisissez le bon GPU
La chose principale qui décide quel GPU vous avez besoin est combien de mémoire le modèle prend. Un modèle de texte servi avec une précision de 16 bits nécessite environ 2 Go de mémoire GPU par milliard de paramètres, plus une salle de tête pour la fenêtre contextuelle et le cache à valeur clé. Donc, un modèle 7B veut quelque part environ 16 à 20 Go, un modèle 30B veut une grande carte simple, et un modèle 70B veut la plus grande carte simple ou plusieurs cartes ensemble. Les constructions quantifiées utilisent beaucoup moins de mémoire, ce qui permet à un modèle plus grand de s'adapter sur un GPU plus petit.
Un bon défaut pour les modèles de texte petits et moyens est le RTX A6000 avec 48 Go à 0,65 USD par heure. Il exécute confortablement des modèles jusqu'à environ 13B à pleine précision, et beaucoup plus grands quand ils sont quantifiés. Pour les modèles autour de 30B, passer à un A100 ou H100 avec 80 Go. Pour 70B et plus, utilisez un H200 avec 141 Go, ou divisez le modèle entre plusieurs GPU en une seule instance, ce qui est la façon dont les plus grands modèles sont servis. Le tableau de bord montre la mémoire de chaque GPU à côté de son prix horaire, et si un modèle a besoin de plus de mémoire que le GPU que vous avez choisi, le déploiement est bloqué avant qu'il ne commence, de sorte que vous ne payez jamais pour un qui ne peut pas s'adapter.
Utilisez-le dans toute application compatible OpenAI
C'est là que ça devient utile. Une instance modèle en cours d'exécution vous donne une URL de base de connexion qui ressemble à ceci:
https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1
Cette URL est une URL de base OpenAI. Tout ce qui peut parler à l'API OpenAI peut parler à votre modèle. Vous avez besoin de trois valeurs: l'URL de base ci-dessus, votre clé API EmpirioLabs comme jeton porteur, et le nom du modèle, qui est l'identifiant de dépôt exact que vous avez déployé, par exemple Qwen/Qwen3.5-4B. Le paramètre répond également /v1/models, donc les clients qui récupèrent une liste de modèles pour remplir un travail déroulant comme prévu.
curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -H "Autorisation: porteur $EMPIRIOLABS API KEY" \ -H "Type de contenu: application/json " \ -d "{ "modèle": " Qwen/Qwen3.5-4B ", "messages": [{ "rôle": "utilisateur", "contenu": "bonjour" }] }"
Si vous préférez le SDK OpenAI, pointez son URL de base sur le même chemin de connexion et tout le reste reste le même:
à partir de openai import Client OpenAI = OpenAI(base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPIRIOLABS API KEY",) response = client.chat.completions.create(model=" Qwen/Qwen3.5-4B ", messages=[{"role": "user", "content": "Hello"}],) print(reponse.choices[0].message.content)
Les mêmes trois valeurs se branchent dans les outils que vous utilisez déjà. Dans un frontend de chat comme SillyTavern, Open WebUI ou LibreChat, choisissez le fournisseur compatible OpenAI ou personnalisé, définissez l'URL de l'API à votre URL de base de connexion, collez votre clé API EmpirioLabs et entrez le nom de modèle affiché sur l'instance. Les assistants de codage qui acceptent une URL de base OpenAI personnalisée, comme Cline, Continue et Aider, sont configurés de la même manière. Les frontends de jeu de rôles, les cadres d'agents, les pipelines de récupération et tout service interne suivent le même modèle: URL de base, clé, modèle.
Dialoguez avec elle dans le tableau de bord
Vous n'avez pas besoin d'un outil externe pour essayer un modèle que vous venez de déployer. Chaque instance qui sert une API compatible OpenAI obtient une page de chat intégrée. Ouvrez l'instance depuis la page GPU Cloud, cliquez sur Clavarder avec ce modèle et commencez à taper. La page de chat flux les réponses, prend en charge une prompte système et les contrôles d'échantillonnage habituels, et fonctionne sur la même connexion sécurisée que l'API, donc il n'y a rien de plus à configurer et pas de facturation séparée, parce que l'instance est déjà mesurée par la seconde.
Pause quand vous ne l'utilisez pas
GPU Cloud est facturé par seconde de temps de fonctionnement, et le taux horaire est verrouillé lorsque vous déployez, de sorte qu'un changement de prix n'affecte jamais une instance qui est déjà en cours d'exécution. Lorsque vous n'avez pas besoin du modèle, arrêtez l'instance. Cela libère le GPU et arrête la facturation immédiatement. Recommencer plus tard et EmpirioLabs redéploye le même modèle sur le prochain GPU disponible. Arrêter efface le stockage éphémère de l'instance, alors traitez-le comme un espace de rayures, et détruisez une instance lorsque vous en avez fini avec elle. La durée de vie et les dépenses par installation sont visibles sur la page GPU Cloud et à travers /v1/account/usage.
Commencez
Ouvrir Nuage GPU dans le tableau de bord pour déployer votre premier modèle, ou lire Documentation GPU Cloud pour l'API complète.



