المنزل المدونة

كيفية تشغيل أي نموذج وجه متناقض خلف واجهة برمجة تطبيقات متوافقة مع OpenAI

شغل أي نموذج Hugging Face على شبكة EmpirioLabs Cloud GPU

Jun 8, 2026

EmpirioLabs AI

النماذج المفتوحة لحقت بسرعة. مختبرات مثل Qwen وDeepSeek وGLM وKimi وMistral تستمر في تقديم نماذج قوية للنص المفتوح على Hugging Face، ولكثير من العمل فهي كل ما تحتاجه. الجزء الصعب لم يكن أبدا هو العارضة. الأمر يتعلق بكل شيء حوله: إيجاد بطاقة الرسوميات، تثبيت التعريفات الصحيحة وتخزين الخدمة، تحميل الأوزان، كشف منفذ، واستعادة اتصال مستقر إلى تطبيقك.

سحابة GPU تزيل هذا العمل. تقوم بنشر وحدة معالجة رسومات مدارة، وتلصق معرف مستودع Hugging Face، وEmpirioLabs يخدم النموذج وراء نقطة نهاية متوافقة مع OpenAI. نظرا لأن النقطة النهائية تتحدث إلى واجهة OpenAI القياسية، يمكنك توجيه أي أداة تقريبا إليها: واجهة دردشة مثل SillyTavern، مساعد برمجة، سكريبتاتك الخاصة، أو مجموعات تطوير OpenAI الرسمية. هذا الدليل يشرح السير بالكامل، بما في ذلك كيفية اختيار وحدة معالجة الرسوميات.

نشر نموذج

افتح صفحة سحابة GPU في لوحة التحكم، اختر نشر نموذج، والصق أي معرف مستودع من Hugging Face، على سبيل المثال Qwen/Qwen3.5-4B. اختر بطاقة رسوميات ثم نشرها. يقوم EmpirioLabs بتحميل الأوزان، وتشغيل محرك خدمة عالي الإنتاجية، وعرض النموذج على نقطة نهاية متوافقة مع OpenAI. يتم تقديم نماذج الأمان القياسية تلقائيا، كما يتم التعامل مع مستودعات GGUF الكمومية أيضا، لذا تعمل معظم نماذج النصوص على Hugging Face بدون إعدادات إضافية.

يمكنك فعل الشيء نفسه عبر واجهة برمجة التطبيقات (API). تعيد استدعاء النشر معرف مثيل بحالة التزويد. قم باستطلاع النسخة حتى تصبح الجري.

curl https://api.empiriolabs.ai/v1/gpu/instances \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -H "المحتوى-TYPE: application/json" \ -D '{ "gpu_slug": "RTX-A6000", "MODE": "MODEL", "hf_id": "Qwen/Qwen3.5-4B" }'

يستغرق النموذج بضع دقائق ليظهر لأول مرة، لأن الأوزان يجب أن تحمل وتحمل في ذاكرة GPU. بعد ذلك، يكون الجهاز جاهزا لاستقبال الطلبات.

اختر بطاقة الرسوميات المناسبة

الشيء الرئيسي الذي يحدد أي بطاقة رسومات تحتاجها هو كمية الذاكرة التي يستهلكها النموذج. نموذج نصي يقدم بدقة 16-بت يحتاج تقريبا 2 جيجابايت من ذاكرة GPU لكل مليار معلم، بالإضافة إلى مساحة كبيرة لنافذة السياق وذاكرة التخزين المؤقت لقيمة المفاتيح. لذا نموذج 7B يحتاج إلى حوالي 16 إلى 20 جيجابايت، ونموذج 30B يحتاج إلى بطاقة واحدة كبيرة، وطراز 70B يريد أكبر بطاقة فردية أو عدة بطاقات معا. الإصدارات الكمية تستخدم ذاكرة أقل بكثير، مما يسمح لنموذج أكبر بالتركيب على بطاقة رسومات أصغر.

الإعداد الافتراضي الجيد لنماذج النصوص الصغيرة والمتوسطة الحجم هو RTX A6000 بسعة 48 جيجابايت بسعر 0.65 دولار أمريكي في الساعة. يدير النماذج بسهولة حتى حوالي 13 بايت بدقة كاملة، ونماذج أكبر بكثير عند التكميم. بالنسبة للطرازات حول 30B، انتقل إلى A100 أو H100 بسعة 80 جيجابايت. بالنسبة لمعالج 70B وما فوق، استخدم معالج H200 بسعة 141 جيجابايت، أو قسم النموذج على عدة وحدات معالجة رسومات في حالة واحدة، وهكذا يتم تقديم أكبر الطرازات. تظهر لوحة التحكم ذاكرة كل بطاقة رسومات بجانب سعرها بالساعة، وإذا كان الطراز يحتاج ذاكرة أكثر من بطاقة الرسوميات التي اخترتها، يتم حظر النشر قبل البدء، لذلك لن تدفع أبدا مقابل واحدة لا تتسع لها.

استخدمه في أي تطبيق متوافق مع OpenAI

هنا يصبح الأمر مفيدا. نسخة نموذج قيد التشغيل تعطيك رابط قاعدة اتصال تبدو كالتالي:

https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1

هذا الرابط هو رابط أساسي في OpenAI متاح. أي شيء يمكنه التواصل مع واجهة برمجة تطبيقات OpenAI يمكنه التواصل مع نموذجك. تحتاج إلى ثلاث قيم: عنوان URL الأساسي أعلاه، ومفتاح واجهة برمجة التطبيقات EmpirioLabs كرمز الحامل، واسم النموذج، وهو بالضبط معرف المستودع الذي قمت بنشره، على سبيل المثال Qwen/Qwen3.5-4B. النهاية تجيب أيضا /v1/models، أي العملاء الذين يجلبون قائمة نماذج لملء قائمة منسدلة يعملون كما هو متوقع.

curl https://api.empiriolabs.ai/v1/gpu/connect/$INSTANCE_ID/v1/chat/completions \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -H "CONTENT-TYPE: application/json" \ -d '{ "model": "Qwen/Qwen3.5-4B", "messages": [{ "role": "user", "content": "Hello" }] }'

إذا كنت تفضل حزمة تطوير البرمجيات OpenAI، وجه رابط الرابط الأساسي إلى نفس مسار الاتصال وسيبقى كل شيء آخر كما هو:

من openai استيراد عميل OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1/gpu/connect/INSTANCE_ID/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) response = client.chat.completions.create(model="Qwen/Qwen3.5-4B", messages=[{"role": "user", "content": "Hello"}],) print(response.choices[0].message.content)

نفس القيم الثلاث تدخل في الأدوات التي تستخدمها بالفعل. في واجهة الدردشة مثل SillyTavern أو Open WebUI أو LibreChat، اختر المزود المتوافق مع OpenAI أو المزود المخصص، وحدد رابط API لرابط قاعدة الاتصال الخاصة بك، والصق مفتاح واجهة EmpirioLabs الخاصة بك، وأدخل اسم النموذج المعروض على النسخة. مساعدي البرمجة الذين يقبلون رابط OpenAI مخصص لقاعدة المعلومات، مثل Cline وContinue وAider، يتم تكوينهم بنفس الطريقة. تتبع الواجهات الأمامية لتمثيل الأدوار، وأطر الوكلاء، وخطوط الاسترجاع، وأي خدمة داخلية نفس النمط: رابط القاعدة، المفتاح، النموذج.

تحدث معه في لوحة التحكم

لا تحتاج إلى أداة خارجية لتجربة نموذج قمت بنشره للتو. كل مثيل يخدم واجهة برمجة تطبيقات متوافقة مع OpenAI يحصل على صفحة دردشة مدمجة. افتح النسخة من صفحة سحابة GPU، اضغط على الدردشة مع هذا النموذج، وابدأ بالكتابة. صفحة الدردشة تبث الردود، وتدعم موجه النظام وعناصر التحكم المعتادة في أخذ العينات، وتعمل عبر نفس الاتصال الآمن مثل واجهة برمجة التطبيقات، لذلك لا يوجد شيء إضافي لإعداده ولا توجد فوترة منفصلة، لأن النسخة يتم قياسها بالفعل بثانية.

توقف عندما لا تستخدمه

يتم احتساب سحابة GPU لكل ثانية من وقت التشغيل، ويكون سعر الساعة مقفلا عند النشر، لذا لا يؤثر تغيير السعر على مثيل يعمل بالفعل. عندما لا تحتاج إلى النموذج، أوقف النموذج. هذا يطلق بطاقة الرسومات ويوقف الفوترة فورا. إذا أعدت تشغيله لاحقا، فإن EmpirioLabs تعيد نشر نفس النموذج على بطاقة الرسوميات التالية المتاحة. التوقف يمسح التخزين المؤقت، لذا تعامل معه كمساحة خدش، ودمر النسخة عندما تنتهي منها. مدة الحياة وكل حالة يمكن رؤيتها على صفحة سحابة GPU ومن خلال ذلك /v1/account/usage.

ابدأ

مفتوح سحابة وحدة معالجة الرسومات (GPU Cloud) في لوحة التحكم لنشر نموذجك الأول، أو اقرأ توثيق سحابة وحدة معالجة الرسومات (GPU) لواجهة برمجة التطبيقات الكاملة.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.