Zuhause Blog

So führen Sie ein umarmendes Gesichtsmodell hinter einer OpenAI-kompatiblen API aus

Führen Sie jedes Hugging Face-Modell in der EmpirioLabs GPU Cloud aus

Jun 8, 2026

EmpirioLabs AI

Offene Modelle haben schnell aufgeholt. Labs wie Qwen, DeepSeek, GLM, Kimi und Mistral liefern weiterhin starke offene Textmodelle auf Hugging Face, und für viel Arbeit sind sie alles, was Sie brauchen. Der schwierige Teil war nie das Modell. Es ist alles um ihn herum: eine GPU zu finden, die richtigen Treiber zu installieren und Stack zu servieren, die Gewichte zu laden, einen Port freizulegen und eine stabile Verbindung zu Ihrer App zu erhalten.

GPU Cloud entfernt diese Arbeit. Sie stellen eine verwaltete GPU bereit, fügen eine Hugging Face-Repository-ID ein und EmpirioLabs bedient das Modell hinter einem OpenAI-kompatiblen Endpunkt. Da der Endpunkt die Standard-OpenAI-API spricht, können Sie fast jedes Tool darauf richten: ein Chat-Frontend wie SillyTavern, einen Programmierassistenten, Ihre eigenen Skripte oder die offiziellen OpenAI-SDKs. Dieser Leitfaden führt durch den gesamten Fluss, einschließlich der Auswahl einer GPU.

Bereitstellen eines Modells

Öffnen Sie die GPU-Cloud-Seite im Dashboard, wählen Sie die Bereitstellung eines Modells und fügen Sie beispielsweise eine Hugging Face-Repository-ID ein Qwen/Qwen3.5-4BWähle eine GPU und setze sie dann ein. EmpirioLabs lädt die Gewichte herunter, startet eine Hochdurchsatz-Service-Engine und setzt das Modell auf einem OpenAI-kompatiblen Endpunkt frei. Standard-Safetensor-Modelle werden automatisch bedient und auch quantisierte GGUF-Repositories werden behandelt, so dass die meisten Textmodelle auf Hugging Face ohne zusätzliche Konfiguration funktionieren.

Sie können dasselbe über die API tun. Der Deploy Call gibt eine Instanz-ID mit dem Status bereitstellungDie Instanz abfragen, bis sie laufen.

curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "gpu slug": "rtx-a6000", "mode": "model", "hf id": " Qwen/Qwen3.5-4B " }'

Ein Modell braucht ein paar Minuten, um das erste Mal aufzutauchen, da die Gewichte heruntergeladen und in den GPU-Speicher geladen werden müssen. Danach ist die Instanz bereit, Anfragen zu empfangen.

Wählen Sie die richtige GPU

Die Hauptsache, die entscheidet, welche GPU Sie benötigen, ist, wie viel Speicher das Modell benötigt. Ein Textmodell mit 16-Bit-Präzision benötigt etwa 2 GB GPU-Speicher pro Milliarde Parameter, plus Headroom für das Kontextfenster und den Schlüsselwert-Cache. Ein 7B-Modell möchte also zwischen 16 und 20 GB, ein 30B-Modell eine große Einzelkarte und ein 70B-Modell die größte Einzelkarte oder mehrere Karten zusammen. Quantisierte Builds verwenden weit weniger Speicher, wodurch ein größeres Modell auf eine kleinere GPU passt.

Ein guter Standard für kleine und mittelgroße Textmodelle ist die RTX A6000 mit 48 GB bei 0,65 USD pro Stunde. Es läuft bequem Modelle bis etwa 13B mit voller Präzision, und viel größere, wenn sie quantisiert werden. Für Modelle um 30B, bewegen Sie sich bis zu einem A100 oder H100 mit 80 GB. Verwenden Sie für 70B und höher eine H200 mit 141 GB oder teilen Sie das Modell auf mehrere GPUs in einer einzigen Instanz auf, so dass die größten Modelle bedient werden. Das Dashboard zeigt den Speicher jeder GPU neben ihrem Stundenpreis an, und wenn ein Modell mehr Speicher benötigt als die GPU, die Sie ausgewählt haben, wird die Bereitstellung vor dem Start blockiert, so dass Sie niemals für eine bezahlen, die nicht passt.

Verwenden Sie es in jeder OpenAI-kompatiblen App

Hier wird es nützlich. Eine laufende Modellinstanz gibt Ihnen eine Connect-Basis-URL, die so aussieht:

https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1

Diese URL ist eine Drop-in OpenAI-Basis-URL. Alles, was mit der OpenAI API sprechen kann, kann mit Ihrem Modell sprechen. Sie benötigen drei Werte: die obige Basis-URL, Ihren EmpirioLabs-API-Schlüssel als Träger-Token und den Modellnamen, der die genaue Repository-ID ist, die Sie beispielsweise bereitgestellt haben Qwen/Qwen3.5-4BDer Endpunkt antwortet auch /v1/modelsclients, die eine modellliste abrufen, um eine dropdown-arbeit wie erwartet zu füllen.

curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "model": " Qwen/Qwen3.5-4B ", "messages": [{ "role": "user", "content": "Hello" }] }

Wenn Sie das OpenAI SDK bevorzugen, zeigen Sie seine Basis-URL auf den gleichen Verbindungspfad und alles andere bleibt gleich:

aus openai import OpenAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPIRIOLABS API KEY",) response = client.chat.completions.create(model=" Qwen/Qwen3.5-4B ", messages=[{"role": "user", "content": "Hello"}],) print(response.choices[0]message.content)

Die gleichen drei Werte werden in die Tools eingefügt, die Sie bereits verwenden. Wählen Sie in einem Chat-Frontend wie SillyTavern, Open WebUI oder LibreChat den OpenAI-kompatiblen oder benutzerdefinierten Anbieter, legen Sie die API-URL auf Ihre Connect-Basis-URL fest, fügen Sie Ihren EmpirioLabs-API-Schlüssel ein und geben Sie den auf der Instanz angezeigten Modellnamen ein. Codierungsassistenten, die eine benutzerdefinierte OpenAI-Basis-URL wie Cline, Continue und Aider akzeptieren, sind auf die gleiche Weise konfiguriert. Rollenspiel-Frontends, Agent-Frameworks, Retrieval-Pipelines und jeder interne Service folgen dem gleichen Muster: Basis-URL, Schlüssel, Modell.

Chatten Sie damit im Dashboard

Sie benötigen kein externes Tool, um ein Modell auszuprobieren, das Sie gerade bereitgestellt haben. Jede Instanz, die eine OpenAI-kompatible API bedient, erhält eine integrierte Chat-Seite. Öffnen Sie die Instanz von der GPU-Cloud-Seite, klicken Sie auf Chat mit diesem Modell und beginnen Sie mit der Eingabe. Die chat-seite streamt antworten, unterstützt eine systemaufforderung und die üblichen sampling-steuerungen und läuft über die gleiche sichere verbindung wie die api, so dass es nichts extra zu installieren gibt und keine separate abrechnung, da die instanz bereits um die sekunde gemessen wird.

Pause, wenn Sie es nicht verwenden

Die GPU Cloud wird pro Sekunde Laufzeit in Rechnung gestellt und der Stundensatz wird bei der Bereitstellung gesperrt, so dass eine Preisänderung niemals eine bereits laufende Instanz betrifft. Wenn Sie das Modell nicht benötigen, stoppen Sie die Instanz. Das gibt die GPU frei und stoppt sofort die Abrechnung. Starten Sie es später erneut und EmpirioLabs setzt das gleiche Modell für die nächste verfügbare GPU neu ein. Stoppen löscht den ephemeren Speicher der Instanz, also behandeln Sie sie als Kratzerplatz und zerstören Sie eine Instanz, wenn Sie damit fertig sind. Lebenszeit und Ausgaben pro Instanz sind auf der GPU-Cloud-Seite und durch /v1/account/usage.

Beginn

Offen GPU Cloud im dashboard, um ihr erstes modell bereitzustellen, oder lesen sie die GPU Cloud Dokumentation für die vollständige API.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.