घर ब्लॉग

OpenAI-Compatible API के पीछे किसी भी Hugging फेस मॉडल को कैसे रन करें

EmpirioLabs GPU क्लाउड पर किसी भी Hugging फेस मॉडल को चलाएं

Jun 8, 2026

EmpirioLabs AI

ओपन मॉडल ने तेजी से पकड़ लिया है। Qwen, DeepSeek, GLM, Kimi, और मिस्ट्रल जैसे लैब्स हगिंग फेस पर मजबूत ओपन टेक्स्ट मॉडल शिपिंग करते हैं, और बहुत सारे काम के लिए वे आपको आवश्यक हैं। कठिन हिस्सा कभी मॉडल नहीं रहा है। यह चारों ओर सब कुछ है: एक GPU ढूँढना, सही ड्राइवर स्थापित करना और स्टैक की सेवा करना, भार को लोड करना, एक पोर्ट को उजागर करना और अपने ऐप में एक स्थिर कनेक्शन वापस प्राप्त करना।.

GPU क्लाउड उस काम को हटा देता है। आप एक प्रबंधित GPU तैनात करते हैं, एक हगिंग फेस रिपोसिटरी आईडी पेस्ट करते हैं, और EmpirioLabs एक OpenAI-compatible समापन बिंदु के पीछे मॉडल की सेवा करते हैं। चूंकि एंडपॉइंट मानक ओपनएआई एपीआई को बोलता है, आप उस पर लगभग किसी भी उपकरण को इंगित कर सकते हैं: एक चैट फ्रंटेंड जैसे सिल्लीटावेन, एक कोडिंग सहायक, आपकी खुद की स्क्रिप्ट, या आधिकारिक ओपनएआई एसडीके। यह गाइड पूरे प्रवाह के माध्यम से चलता है, जिसमें जीपीयू कैसे चुनना है।.

एक मॉडल तैनाती

डैशबोर्ड में GPU क्लाउड पेज खोलें, एक मॉडल को तैनात करने का विकल्प चुनें, और किसी भी Hugging फेस रिपॉज़िटरी आईडी पेस्ट करें, उदाहरण के लिए TOKENएक GPU चुनें, फिर तैनात करें। EmpirioLabs भार को डाउनलोड करता है, एक उच्च थ्रूपुट सेवा इंजन शुरू करता है, और एक OpenAI-compatible समापन बिंदु पर मॉडल को उजागर करता है। मानक सुरक्षित सेंसर मॉडल को स्वचालित रूप से परोसा जाता है, और quantized GGUF repositories को भी संभाला जाता है, इसलिए Hugging Face पर अधिकांश टेक्स्ट मॉडल बिना किसी अतिरिक्त कॉन्फ़िगरेशन के काम करते हैं।.

आप एपीआई पर एक ही बात कर सकते हैं। परिनियोजित कॉल रिटर्न एक उदाहरण आईडी के साथ स्टेटस ऑफ़ प्रावधानउदाहरण जब तक यह नहीं है दौड़ना।.

कर्ल https://api.empiriolabs.ai/v1/gpu/instances

एक मॉडल पहली बार आने के लिए कुछ मिनट लेता है, क्योंकि वजन को GPU मेमोरी में डाउनलोड और लोड करना पड़ता है। उसके बाद, उदाहरण अनुरोध प्राप्त करने के लिए तैयार है।.

सही GPU चुनें

जो मुख्य बात यह तय करती है कि आपको किस GPU की आवश्यकता है वह कितना स्मृति मॉडल लेता है। एक पाठ मॉडल 16-बिट परिशुद्धता की जरूरत पर लगभग 2 जीबी जीपीयू मेमोरी प्रति अरब मापदंडों, साथ ही संदर्भ विंडो और कुंजी मूल्य कैश के लिए हेडरूम पर काम किया। तो एक 7B मॉडल 16 से 20 जीबी के आसपास कहीं चाहता है, एक 30B मॉडल एक बड़ा एकल कार्ड चाहता है, और एक 70B मॉडल एक साथ सबसे बड़ा एकल कार्ड या कई कार्ड चाहता है। Quantized builds अब तक कम स्मृति का उपयोग करते हैं, जो एक छोटे से जीपीयू पर एक बड़ा मॉडल फिट होने देता है।.

छोटे और मध्यम आकार के टेक्स्ट मॉडल के लिए एक अच्छा डिफ़ॉल्ट RTX A6000 है जिसमें 48 GB प्रति घंटे 0.65 USD है। यह आराम से पूरी परिशुद्धता पर लगभग 13B तक मॉडल चलाता है, और जब वे मात्रात्मक होते हैं तो बहुत बड़े लोग। 30B के आसपास के मॉडल के लिए, 80 GB के साथ A100 या H100 तक चले गए। 70B और ऊपर के लिए, 141 GB के साथ एक H200 का उपयोग करें, या एक ही उदाहरण में कई GPUs में मॉडल को विभाजित करें, जो कि सबसे बड़ा मॉडल कैसे काम किया जाता है। डैशबोर्ड प्रत्येक GPU की स्मृति को अपने घण्टे की कीमत के बगल में दिखाता है, और यदि किसी मॉडल को GPU की तुलना में अधिक स्मृति की आवश्यकता होती है, तो यह प्रक्रिया शुरू होने से पहले अवरुद्ध हो जाती है।.

इसे किसी भी OpenAI-compatible ऐप में उपयोग करें

यह कहाँ उपयोगी हो जाता है। एक रनिंग मॉडल उदाहरण आपको कनेक्ट बेस यूआरएल देता है जो इस तरह दिखता है:

https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1

यह URL एक ड्रॉप-इन OpenAI बेस URL है। जो कुछ भी ओपनएआई एपीआई से बात कर सकता है वह आपके मॉडल से बात कर सकता है। आपको तीन मानों की आवश्यकता है: ऊपर का आधार यूआरएल, आपके EmpirioLabs API कुंजी बियरर टोकन के रूप में, और मॉडल का नाम, जो आपके द्वारा तैनात सटीक भंडार आईडी है, उदाहरण के लिए TOKENअंत बिंदु भी जवाब देता है TOKENइसलिए ग्राहक जो उम्मीद के अनुसार एक ड्रॉपडाउन कार्य को भरने के लिए एक मॉडल सूची प्राप्त करते हैं।.

कर्ल https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions

यदि आप OpenAI SDK को पसंद करते हैं, तो उसके आधार URL को उसी कनेक्ट पथ पर इंगित करें और बाकी सब कुछ उसी तरह रहता है:

openai आयात OpenAI क्लाइंट = OpenAI (base url=" https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api key="YOUR EMPIRIOLABS API KEY), उत्तर = ग्राहक.chat.completions.create(model=" Qwen/Qwen3.5-4B ", संदेश=[{"role": "user", "content": "Hello"}], प्रिंट (response.choices[0].message.content)

वही तीन मान उन उपकरणों में प्लग करते हैं जिन्हें आप पहले से ही उपयोग करते हैं। ऐसे SillyTavern, ओपन WebUI, या LibreChat के रूप में एक चैट फ्रंटेंड में, OpenAI-compatible या कस्टम प्रदाता का चयन करें, अपने कनेक्ट बेस यूआरएल के लिए API URL सेट करें, अपने EmpirioLabs API कुंजी पेस्ट करें, और उदाहरण पर दिखाया गया मॉडल नाम दर्ज करें। कोडिंग सहायक जो एक कस्टम ओपनएआई बेस यूआरएल को स्वीकार करते हैं, जैसे कि क्लाइन, जारी रखें और एडर को उसी तरह कॉन्फ़िगर किया गया है। रोलप्ले फ्रंटेंड, एजेंट फ्रेमवर्क, पुनर्प्राप्ति पाइपलाइन, और किसी भी घर में सेवा उसी पैटर्न का पालन करें: आधार यूआरएल, कुंजी, मॉडल।.

इसके साथ डैशबोर्ड में चैट करें

आपको उस मॉडल की कोशिश करने के लिए किसी बाहरी उपकरण की आवश्यकता नहीं है जिसे आपने अभी तैनात किया था। प्रत्येक उदाहरण जो ओपनएआई-संगत एपीआई को सेवा प्रदान करता है उसे अंतर्निहित चैट पेज मिलता है। उदाहरण को GPU क्लाउड पेज से खोलें, इस मॉडल के साथ चैट पर क्लिक करें, और टाइपिंग शुरू करें। चैट पेज प्रतिक्रियाओं को स्ट्रीम करता है, सिस्टम प्रॉम्प्ट और सामान्य नमूना नियंत्रण का समर्थन करता है, और एपीआई के समान सुरक्षित कनेक्शन को चलाता है, इसलिए सेट अप करने के लिए अतिरिक्त कुछ भी नहीं है और कोई अलग बिलिंग नहीं है, क्योंकि उदाहरण पहले से ही दूसरे द्वारा मीटर हो चुका है।.

जब आप इसका उपयोग नहीं कर रहे हैं तो रोकें

GPU क्लाउड को चलने के समय के प्रति सेकंड बिल दिया जाता है, और जब आप तैनात करते हैं तो घंटो की दर बंद हो जाती है, इसलिए मूल्य में बदलाव कभी भी ऐसा नहीं होता है जो पहले से ही चल रहा है। जब आपको मॉडल की आवश्यकता नहीं होती है, तो उदाहरण बंद करें। यह जीपीयू जारी करता है और तुरंत बिलिंग बंद कर देता है। इसे फिर से शुरू करें और EmpirioLabs अगले उपलब्ध GPU पर उसी मॉडल को फिर से दोहराते हैं। स्टॉपिंग उदाहरण के इफेमेरल स्टोरेज को साफ़ करता है, इसलिए इसे स्क्रैच स्पेस के रूप में मानते हैं और जब आप इसके साथ समाप्त हो जाते हैं तो एक उदाहरण को नष्ट कर देते हैं। लाइफटाइम और प्रति इंस्टेंस खर्च जीपीयू क्लाउड पेज पर और उसके माध्यम से दिखाई देते हैं TOKEN।.

शुरू हो जाओ

खुला GPU क्लाउड डैशबोर्ड में अपने पहले मॉडल को तैनात करने या पढ़ने के लिए GPU बादल प्रलेखन पूर्ण एपीआई के लिए।.

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।