Qwen3.6 35B A3B एपीआई

Qwen3.6 35B A3B एक 256-विशेषज्ञ mixture-of-experts रीजनिंग मॉडल है जिसमें 128K संदर्भ, फ़ंक्शन टूल और सख्त संरचित JSON आउटपुट है।

Alibaba Cloudपाठ निर्माण128K कॉन्टेक्स्टरिलीज 16 अप्रैल 2026नेटिव इन्फरेंसनया

Qwen3.6 35B A3B के बारे में

Qwen3.6 35B A3B एक 256-विशेषज्ञ mixture-of-experts रीजनिंग मॉडल है जिसमें 128K संदर्भ, फ़ंक्शन टूल और सख्त संरचित JSON आउटपुट है।

केवल पाठ। यह बिल्ड आधार Qwen3.6 35B A3B के विपरीत, छवि या वीडियो इनपुट स्वीकार नहीं करता है। वज़न 2-बिट एस्कैमो W2 बिल्ड से परोसा जाता है जिसे एस्चा लैब्स (eschalabs.com) द्वारा प्रकाशित अपाचे -2.0 के तहत हगिंग फेस पर EschaLabs/Qwen3.6-35B-A3B-Escha-W2 के रूप में प्रस्तुत किया जाता है। विशेषज्ञों को 2 बिट्स तक परिमाणित किया जाता है, प्रति प्रक्षेपण मिश्रित (gate_up_proj 2-बिट पर और down_proj 3-बिट पर), घनी परतें int8 हैं, और KV कैश FP16 है। एस्चा लैब्स एक ही मॉडल की FP8 आधार रेखा के खिलाफ गुणवत्ता तुलना प्रकाशित करती है: गणित, स्नातक विज्ञान, उपकरण उपयोग और लंबे संदर्भ पर समानता या बेहतर, व्यापक ज्ञान पर लगभग 2 प्रतिशत कम, और लंबे-क्षितिज कोड पीढ़ी पर लगभग 7 प्रतिशत कम, जो एक स्पष्ट अंतर है। पूर्ण बेंचमार्क तालिका और प्रोटोकॉल के लिए मॉडल कार्ड देखें। व्यवहार स्ट्रीमिंग, फ़ंक्शन टूल, सख्त स्कीमा सहित संरचित JSON आउटपुट और डिफ़ॉल्ट रूप से सोच मोड का समर्थन करता है। सीधे उत्तरों के लिए enable_thinking=false सेट करें। सोचने के साथ, तर्क reasoning_content में आता है और उत्तर सामग्री में आता है, इसलिए दोनों को पढ़ें। सोचने के साथ कम max_tokens पूरी तरह से तर्क पर खर्च किया जा सकता है, इसलिए उत्तर के लिए जगह दें। कैशिंग स्वचालित उपसर्ग कैश रीड को रिपोर्ट किए जाने पर कैश्ड-इनपुट दर पर बिल किया जाता है। स्पष्ट कैश नियंत्रण समर्थित नहीं हैं। स्ट्रीमिंग अनुरोध को रद्द करना मध्य-पीढ़ी केवल उस बिंदु तक उत्पादित टोकन का बिल देता है।

इस नाम से भी जाना जाता है EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B

reasoningfunction callingjson modecache

Qwen3.6 35B A3B की विशेषताएं

मॉडल ID
qwen3-6-35b-a3b
निर्माता
Alibaba Cloud
श्रेणी
पाठ निर्माण
रिलीज
16 अप्रैल 2026
कॉन्टेक्स्ट विंडो
128K टोकन
अधिकतम आउटपुट
16,384 टोकन
इनपुट
टेक्स्ट
आउटपुट
टेक्स्ट
संरचित आउटपुट
JSON Schema
एंडपॉइंट
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContent
वैकल्पिक मॉडल ID
qwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2

Qwen3.6 35B A3B API की कीमतें72% तक बचाएं

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
इनपुट
प्रति 1M प्रॉम्प्ट टोकन
$0.248$0.07
उत्पादन
प्रति 1M जेनरेट किए गए टोकन
$1.485$0.42
अंतर्निहित कैश पढ़ा गया
प्रति 1M कैश्ड इनपुट टोकन
$0.035
वेब खोज (लिंकअप)
प्रति कॉल जब लागू किया जाता है
$0.013
पूरे कीमत पेज पर तुलना करें

Qwen3.6 35B A3B API को कैसे कॉल करें

Qwen3.6 35B A3B OpenAI-संगत Chat Completions API देता है। किसी भी OpenAI SDK को अपनी EmpirioLabs API key के साथ https://api.empiriolabs.ai/v1 पर सेट करें और model id qwen3-6-35b-a3b उपयोग करें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-6-35b-a3b",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-6-35b-a3b",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Qwen3.6 35B A3B API का पूरा संदर्भ

Qwen3.6 35B A3B API के पैरामीटर

EmpirioLabs पर Qwen3.6 35B A3B API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
temperaturenumber0.70 से 2नमूना तापमान। 0 नियतात्मक है और 2 अधिकतम यादृच्छिकता है।
top_pnumber0.950 से 1नाभिक नमूनाकरण संभाव्यता द्रव्यमान। कम मान आउटपुट को अधिक केंद्रित बनाते हैं।
max_tokensnumber40961 से 16384अधिकतम आउटपुट टोकन।
stopstring--4 स्ट्रिंग्स तक जहां मॉडल आगे टोकन उत्पन्न करना बंद कर देगा।
enable_thinkingbooleantrue-उत्तर देने से पहले तर्क सक्षम करें।
reasoning_effortenummediumnone, low, medium, high, maxतर्क प्रयास स्तर। कोई भी सोच को अक्षम नहीं करता है। निम्न, मध्यम, उच्च और अधिकतम सेट चयनित मॉडल के आकार के बाउंड थिंकिंग बजट।
top_knumber201 से 200समर्थित होने पर नमूनाकरण को शीर्ष K उम्मीदवार टोकन तक सीमित करें।
min_pnumber00 से 1टोकन नमूने के लिए न्यूनतम संभावना सीमा।
frequency_penaltynumber0-2 से 2टोकन कितनी बार पहले ही दिखाई दे चुका है, इसके आधार पर जुर्माना।
presence_penaltynumber0-2 से 2टोकन के लिए जुर्माना जो पहले से ही जेनरेट किए गए टेक्स्ट में दिखाई दे रहे हैं।
seednumber-0 से 2147483647प्रतिलिपि प्रस्तुत करने योग्य नमूने के लिए वैकल्पिक यादृच्छिक बीज।
response_formatenum-text, json_object, json_schemaआउटपुट को वैध JSON तक सीमित करें। किसी भी JSON ऑब्जेक्ट के लिए JSON मोड का उपयोग करें, या सटीक प्रतिक्रिया आकार को बाध्य करने के लिए JSON स्कीमा की आपूर्ति करें।
web_search_linkupbooleanfalse-लिंकअप द्वारा संचालित वैकल्पिक वेब खोज। सक्षम होने पर, हाल के वेब स्रोतों को आपके नवीनतम उपयोगकर्ता संदेश को क्वेरी के रूप में उपयोग करके पुनर्प्राप्त किया जाता है और मॉडल को अतिरिक्त संदर्भ के रूप में प्रदान किया जाता है। मॉडल की सामान्य टोकन लागत के शीर्ष पर लागू होने पर प्रति कॉल $0.013 जोड़ता है। डिफ़ॉल्ट रूप से अक्षम।
disable_formattingbooleanfalse-सक्षम होने पर, गेटवे "स्रोत" पाद लेख को सहायक प्रतिक्रियाओं में नहीं जोड़ेगा जो लिंकअप वेब खोज का उपयोग करते हैं। उपयोगी जब मॉडल आउटपुट को किसी अन्य सिस्टम में पाइप...

जानने योग्य

केवल पाठ। यह बिल्ड आधार Qwen3.6 35B A3B के विपरीत, छवि या वीडियो इनपुट स्वीकार नहीं करता है। वज़न 2-बिट एस्कैमो W2 बिल्ड से परोसा जाता है जिसे एस्चा लैब्स (eschalabs.com) द्वारा प्रकाशित अपाचे -2.0 के तहत हगिंग फेस पर EschaLabs/Qwen3.6-35B-A3B-Escha-W2 के रूप में प्रस्तुत किया जाता है। विशेषज्ञों को 2 बिट्स तक परिमाणित किया जाता है, प्रति प्रक्षेपण मिश्रित (gate_up_proj 2-बिट पर और down_proj 3-बिट पर), घनी परतें int8 हैं, और KV कैश FP16 है। एस्चा लैब्स एक ही मॉडल की FP8 आधार रेखा के खिलाफ गुणवत्ता तुलना प्रकाशित करती है: गणित, स्नातक विज्ञान, उपकरण उपयोग और लंबे संदर्भ पर समानता या बेहतर, व्यापक ज्ञान पर लगभग 2 प्रतिशत कम, और लंबे-क्षितिज कोड पीढ़ी पर लगभग 7 प्रतिशत कम, जो एक स्पष्ट अंतर है। पूर्ण बेंचमार्क तालिका और प्रोटोकॉल के लिए मॉडल कार्ड देखें। व्यवहार स्ट्रीमिंग, फ़ंक्शन टूल, सख्त स्कीमा सहित संरचित JSON आउटपुट और डिफ़ॉल्ट रूप से सोच मोड का समर्थन करता है। सीधे उत्तरों के लिए enable_thinking=false सेट करें। सोचने के साथ, तर्क reasoning_content में आता है और उत्तर सामग्री में आता है, इसलिए दोनों को पढ़ें। सोचने के साथ कम max_tokens पूरी तरह से तर्क पर खर्च किया जा सकता है, इसलिए उत्तर के लिए जगह दें। कैशिंग स्वचालित उपसर्ग कैश रीड को रिपोर्ट किए जाने पर कैश्ड-इनपुट दर पर बिल किया जाता है। स्पष्ट कैश नियंत्रण समर्थित नहीं हैं। स्ट्रीमिंग अनुरोध को रद्द करना मध्य-पीढ़ी केवल उस बिंदु तक उत्पादित टोकन का बिल देता है।

Qwen3.6 35B A3B API: आम सवाल

Qwen3.6 35B A3B API की कीमत कितनी है?

EmpirioLabs पर Qwen3.6 35B A3B का बिल उपयोग के अनुसार बनता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

Qwen3.6 35B A3B की context window कितनी है?

Qwen3.6 35B A3B 128K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 16,384 आउटपुट टोकन के साथ।

क्या Qwen3.6 35B A3B API OpenAI-संगत है?

हां। Qwen3.6 35B A3B OpenAI-संगत Chat Completions API देता है, इसलिए मौजूदा OpenAI SDKs base_url को https://api.empiriolabs.ai/v1 पर सेट करके और model id qwen3-6-35b-a3b रखकर काम करते हैं।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में Qwen3.6 35B A3B आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में Qwen3.6 35B A3B को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

Qwen3.6 35B A3B की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।