開いたモデルは速く追いつかりました。 Qwen、DeepSeek、GLM、Kimi、Mistralなどのラボは、ハッギングフェイスで強力なオープンテキストモデルを出荷し、必要な作業がたくさんあります。 硬い部分は、モデルではなかった。 それはそれの周りにすべてです: GPUを見つけます, 適切なドライバをインストールし、スタックをサービング, 体重をロード, ポートを露出します, そして、あなたのアプリに戻って安定した接続を取得.
GPU Cloudその作業を取り除く。マネージドGPUを展開し、Hugging FaceリポジトリIDを貼り付け、EmpirioLabsOpenAI互換エンドポイントの背後でモデルを提供します。エンドポイントは標準のOpenAI APIを操作しているため、SillyTavernのようなチャットフロントエンド、コーディングアシスタント、自社スクリプト、公式OpenAISDKなど、ほぼあらゆるツールを向けることができます。このガイドでは、GPUの選び方を含め、全体の流れを解説します。
モデルの展開
ダッシュボードでGPU Cloudページを開き、モデルをデプロイし、Hugging FaceリポジトリのIDを貼り付けます お問い合わせ. GPU を選択し、デプロイします。 EmpirioLabsは重量をダウンロードし、ハイスループットサービングエンジンを起動し、OpenAI対応エンドポイントでモデルを公開します。 標準のセーフテナーモデルは自動で提供され、定量化された GGUF リポジトリも処理されます。そのため、ほとんどのテキストモデルは Hugging Face のほとんどのテキストモデルで、追加の構成はありません.
API上で同じことをすることができます。 デプロイコールはインスタンス ID をステータスで返します プロビジョニング. インスタンスを出力する ランニングお問い合わせ.
curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "Authorization: Bearer $ EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "gpu slug": "rtx-a6000", "mode": "model", "hf id": " Qwen/Qwen3.5-4B " \ -d ' { "gpu sluglug": "rtx-a6000", "mode"
体重がGPUメモリにダウンロードして読み込む必要があるため、モデルが初めて登場するまで数分かかります。 その後、インスタンスはリクエストを受け取る準備ができています.
正しいGPUを選ぶ
必要なGPUがどれだけのメモリであるかを決定する主なことは、モデルがかかるメモリです。 16ビットの精度で提供されるテキストモデルは、約2 GBのGPUメモリを10億パラメーター、コンテキストウィンドウのヘッドルームとキー値キャッシュを必要とします。 そこで、7Bモデルは16〜20 GBのどこかで望んでいます。30Bモデルは大きなシングルカードを望んでおり、70Bモデルは一緒に最大のシングルカードまたは複数のカードを望んでいます。 量子化されたビルドは、はるかに少ないメモリを使用して、より大きなモデルが小さいGPUに収まることを可能にします.
小さなサイズのテキストモデルと中サイズのテキストモデルは、1時間あたり0.65 USDで48 GBのRTX A6000です。 高精度で約13Bまでのモデルを快適に走行し、量子化した時にはるかに大きいモデルを稼働させます。 30B前後のモデルでは、A100 または H100 まで 80 GB で移動します。 70B 以上では、141 GB の H200 を使うか、複数の GPU を渡るモデルを 1 つのインスタンスに分割するか、最大のモデルがいかに役立つかを指定します。 ダッシュボードは、各GPUのメモリを1時間以内に表示し、選択したモデルがGPUよりもメモリを必要とする場合、デプロイは開始する前にブロックされますので、収まることはできません.
OpenAI対応アプリでご使用ください
これは、それが役に立つ場所です. 実行中のモデルインスタンスは、このように見える接続ベースURLを提供します
https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1
このURLは、OpenAIベースURLのドロップインです。 OpenAI API に話せるものは、モデルに話せます。 上記のベース URL と、EmpirioLabs API キーをベアアトークンとして 3 つの値、デプロイした正確なリポジトリ ID であるモデル名などです お問い合わせ. エンドポイントも回答 お問い合わせつまり、モデルリストを取得して、期待どおりにドロップダウン作業を埋めるクライアント.
curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -H "認証:ベアラー $EMPIRIOLABS_API_KEY" \ -h "Content-Type: application/json" \ -d '{ "model": "Qwen/Qwen3.5-4B", "messages": [{ "role": "user", "content": "Hello" }] }'
OpenAI SDK を好む場合は、ベース URL を同じコネクトパスで指すと、他のすべてが同じままになります
openai のインポート OpenAI クライアント = OpenAI(base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPIRIOLABS API KEY",) 応答 = client.chat.completions.create(model=" Qwen/Qwen3.5-4B ", message=[{"role": "user", "content": "Hello"}",))) プリント(response.choice[0mess]
既に使用しているツールに同じ3つの値が差し込みます。 SillyTavern、Open WebUI、またはLibreChatなどのチャットフロントエンドでは、OpenAI互換またはカスタムプロバイダーを選択し、接続ベースURLにAPI URLを設定し、EmpirioLabs APIキーを貼り付け、インスタンスに示すモデル名を入力します。 Cline、 Continue、Aider などのカスタム OpenAI ベース URL を受け入れるコーディングアシスタントは、同じように構成されます。 ロールプレイ フロントエンド、エージェントフレームワーク、検索パイプライン、および社内サービスが同じパターンに従う:ベースURL、キー、モデル.
ダッシュボードでチャット
デプロイしたモデルを試すための外部ツールは必要ありません。 OpenAI 互換 API を提供するすべてのインスタンスは、組み込みのチャットページを取得します。 GPU Cloud ページからインスタンスを開き、このモデルでチャットをクリックし、タイピングを開始します。 チャットページはレスポンスをストリームし、システムプロンプトと通常のサンプリング制御をサポートし、同じセキュアな接続をAPIとして実行します。そのため、インスタンスは既に2秒でメーター化されているため、セットアップと別々の請求はありません.
使用していないときのポーズ
GPUクラウドは稼働時間秒単位で課金され、デプロイ時に1時間単位のレートがロックされますので、既に稼働しているインスタンスには価格変更は影響しません。 モデルを必要としないときは、インスタンスを停止します。 GPUを解放し、すぐに請求を停止します。 その後、EmpirioLabsは、次の利用可能なGPUで同じモデルを再採用します。 Stopping はインスタンスのエピヘムストレージをクリアするので、スクラッチスペースとして扱い、それで終了したときにインスタンスを破壊します。 GPUクラウドページや、 お問い合わせお問い合わせ.
スタート
アクセス GPUクラウド ダッシュボードで最初のモデルをデプロイしたり、最初のモデルを読み込みます GPUクラウドドキュメント 完全な API の場合.



