
Qwen3.6 35B A3B एक 256-विशेषज्ञ mixture-of-experts रीजनिंग मॉडल है जिसमें 128K संदर्भ, फ़ंक्शन टूल और सख्त संरचित JSON आउटपुट है।
Qwen3.6 35B A3B एक 256-विशेषज्ञ mixture-of-experts रीजनिंग मॉडल है जिसमें 128K संदर्भ, फ़ंक्शन टूल और सख्त संरचित JSON आउटपुट है।
केवल पाठ। यह बिल्ड आधार Qwen3.6 35B A3B के विपरीत, छवि या वीडियो इनपुट स्वीकार नहीं करता है। वज़न 2-बिट एस्कैमो W2 बिल्ड से परोसा जाता है जिसे एस्चा लैब्स (eschalabs.com) द्वारा प्रकाशित अपाचे -2.0 के तहत हगिंग फेस पर EschaLabs/Qwen3.6-35B-A3B-Escha-W2 के रूप में प्रस्तुत किया जाता है। विशेषज्ञों को 2 बिट्स तक परिमाणित किया जाता है, प्रति प्रक्षेपण मिश्रित (gate_up_proj 2-बिट पर और down_proj 3-बिट पर), घनी परतें int8 हैं, और KV कैश FP16 है। एस्चा लैब्स एक ही मॉडल की FP8 आधार रेखा के खिलाफ गुणवत्ता तुलना प्रकाशित करती है: गणित, स्नातक विज्ञान, उपकरण उपयोग और लंबे संदर्भ पर समानता या बेहतर, व्यापक ज्ञान पर लगभग 2 प्रतिशत कम, और लंबे-क्षितिज कोड पीढ़ी पर लगभग 7 प्रतिशत कम, जो एक स्पष्ट अंतर है। पूर्ण बेंचमार्क तालिका और प्रोटोकॉल के लिए मॉडल कार्ड देखें। व्यवहार स्ट्रीमिंग, फ़ंक्शन टूल, सख्त स्कीमा सहित संरचित JSON आउटपुट और डिफ़ॉल्ट रूप से सोच मोड का समर्थन करता है। सीधे उत्तरों के लिए enable_thinking=false सेट करें। सोचने के साथ, तर्क reasoning_content में आता है और उत्तर सामग्री में आता है, इसलिए दोनों को पढ़ें। सोचने के साथ कम max_tokens पूरी तरह से तर्क पर खर्च किया जा सकता है, इसलिए उत्तर के लिए जगह दें। कैशिंग स्वचालित उपसर्ग कैश रीड को रिपोर्ट किए जाने पर कैश्ड-इनपुट दर पर बिल किया जाता है। स्पष्ट कैश नियंत्रण समर्थित नहीं हैं। स्ट्रीमिंग अनुरोध को रद्द करना मध्य-पीढ़ी केवल उस बिंदु तक उत्पादित टोकन का बिल देता है।
इस नाम से भी जाना जाता है EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B
qwen3-6-35b-a3b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContentqwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Qwen3.6 35B A3B OpenAI-संगत Chat Completions API देता है। किसी भी OpenAI SDK को अपनी EmpirioLabs API key के साथ https://api.empiriolabs.ai/v1 पर सेट करें और model id qwen3-6-35b-a3b उपयोग करें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-6-35b-a3b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)EmpirioLabs पर Qwen3.6 35B A3B API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 से 2 | नमूना तापमान। 0 नियतात्मक है और 2 अधिकतम यादृच्छिकता है। |
| top_p | number | 0.95 | 0 से 1 | नाभिक नमूनाकरण संभाव्यता द्रव्यमान। कम मान आउटपुट को अधिक केंद्रित बनाते हैं। |
| max_tokens | number | 4096 | 1 से 16384 | अधिकतम आउटपुट टोकन। |
| stop | string | - | - | 4 स्ट्रिंग्स तक जहां मॉडल आगे टोकन उत्पन्न करना बंद कर देगा। |
| enable_thinking | boolean | true | - | उत्तर देने से पहले तर्क सक्षम करें। |
| reasoning_effort | enum | medium | none, low, medium, high, max | तर्क प्रयास स्तर। कोई भी सोच को अक्षम नहीं करता है। निम्न, मध्यम, उच्च और अधिकतम सेट चयनित मॉडल के आकार के बाउंड थिंकिंग बजट। |
| top_k | number | 20 | 1 से 200 | समर्थित होने पर नमूनाकरण को शीर्ष K उम्मीदवार टोकन तक सीमित करें। |
| min_p | number | 0 | 0 से 1 | टोकन नमूने के लिए न्यूनतम संभावना सीमा। |
| frequency_penalty | number | 0 | -2 से 2 | टोकन कितनी बार पहले ही दिखाई दे चुका है, इसके आधार पर जुर्माना। |
| presence_penalty | number | 0 | -2 से 2 | टोकन के लिए जुर्माना जो पहले से ही जेनरेट किए गए टेक्स्ट में दिखाई दे रहे हैं। |
| seed | number | - | 0 से 2147483647 | प्रतिलिपि प्रस्तुत करने योग्य नमूने के लिए वैकल्पिक यादृच्छिक बीज। |
| response_format | enum | - | text, json_object, json_schema | आउटपुट को वैध JSON तक सीमित करें। किसी भी JSON ऑब्जेक्ट के लिए JSON मोड का उपयोग करें, या सटीक प्रतिक्रिया आकार को बाध्य करने के लिए JSON स्कीमा की आपूर्ति करें। |
| web_search_linkup | boolean | false | - | लिंकअप द्वारा संचालित वैकल्पिक वेब खोज। सक्षम होने पर, हाल के वेब स्रोतों को आपके नवीनतम उपयोगकर्ता संदेश को क्वेरी के रूप में उपयोग करके पुनर्प्राप्त किया जाता है और मॉडल को अतिरिक्त संदर्भ के रूप में प्रदान किया जाता है। मॉडल की सामान्य टोकन लागत के शीर्ष पर लागू होने पर प्रति कॉल $0.013 जोड़ता है। डिफ़ॉल्ट रूप से अक्षम। |
| disable_formatting | boolean | false | - | सक्षम होने पर, गेटवे "स्रोत" पाद लेख को सहायक प्रतिक्रियाओं में नहीं जोड़ेगा जो लिंकअप वेब खोज का उपयोग करते हैं। उपयोगी जब मॉडल आउटपुट को किसी अन्य सिस्टम में पाइप... |
केवल पाठ। यह बिल्ड आधार Qwen3.6 35B A3B के विपरीत, छवि या वीडियो इनपुट स्वीकार नहीं करता है। वज़न 2-बिट एस्कैमो W2 बिल्ड से परोसा जाता है जिसे एस्चा लैब्स (eschalabs.com) द्वारा प्रकाशित अपाचे -2.0 के तहत हगिंग फेस पर EschaLabs/Qwen3.6-35B-A3B-Escha-W2 के रूप में प्रस्तुत किया जाता है। विशेषज्ञों को 2 बिट्स तक परिमाणित किया जाता है, प्रति प्रक्षेपण मिश्रित (gate_up_proj 2-बिट पर और down_proj 3-बिट पर), घनी परतें int8 हैं, और KV कैश FP16 है। एस्चा लैब्स एक ही मॉडल की FP8 आधार रेखा के खिलाफ गुणवत्ता तुलना प्रकाशित करती है: गणित, स्नातक विज्ञान, उपकरण उपयोग और लंबे संदर्भ पर समानता या बेहतर, व्यापक ज्ञान पर लगभग 2 प्रतिशत कम, और लंबे-क्षितिज कोड पीढ़ी पर लगभग 7 प्रतिशत कम, जो एक स्पष्ट अंतर है। पूर्ण बेंचमार्क तालिका और प्रोटोकॉल के लिए मॉडल कार्ड देखें। व्यवहार स्ट्रीमिंग, फ़ंक्शन टूल, सख्त स्कीमा सहित संरचित JSON आउटपुट और डिफ़ॉल्ट रूप से सोच मोड का समर्थन करता है। सीधे उत्तरों के लिए enable_thinking=false सेट करें। सोचने के साथ, तर्क reasoning_content में आता है और उत्तर सामग्री में आता है, इसलिए दोनों को पढ़ें। सोचने के साथ कम max_tokens पूरी तरह से तर्क पर खर्च किया जा सकता है, इसलिए उत्तर के लिए जगह दें। कैशिंग स्वचालित उपसर्ग कैश रीड को रिपोर्ट किए जाने पर कैश्ड-इनपुट दर पर बिल किया जाता है। स्पष्ट कैश नियंत्रण समर्थित नहीं हैं। स्ट्रीमिंग अनुरोध को रद्द करना मध्य-पीढ़ी केवल उस बिंदु तक उत्पादित टोकन का बिल देता है।
EmpirioLabs पर Qwen3.6 35B A3B का बिल उपयोग के अनुसार बनता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Qwen3.6 35B A3B 128K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 16,384 आउटपुट टोकन के साथ।
हां। Qwen3.6 35B A3B OpenAI-संगत Chat Completions API देता है, इसलिए मौजूदा OpenAI SDKs base_url को https://api.empiriolabs.ai/v1 पर सेट करके और model id qwen3-6-35b-a3b रखकर काम करते हैं।
हां। EmpirioLabs playground ब्राउज़र में Qwen3.6 35B A3B को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।