Qwen3.8 Flash अलीबाबा के Qwen3.8 परिवार में नवीनतम मल्टीमॉडल मॉडल है, जिसे 26 अगस्त, 2026 को जारी किया गया है, जिसे तेज़, कम लागत वाली कोडिंग, एजेंट और विज़न वर्क के लिए बनाया गया है। यह टेक्स्ट, छवि और वीडियो समझ के साथ 1M टोकन संदर्भ जोड़ता है, गहरी सोच जो डिफ़ॉल्ट रूप से चालू है, और Qwen3.8 मैक्स के समान पांच अंतर्निहित उपकरण।
Qwen3.8 Flash आज EmpirioLabs पर OpenAI-संगत API के माध्यम से लाइव है, जिसमें फ़ंक्शन कॉलिंग, सख्त JSON स्कीमा संरचित आउटपुट, स्ट्रीमिंग और 128K आउटपुट टोकन हैं। इसे में आज़माएं खेल इसे किसी भी OpenAI-compatible क्लाइंट से कॉल करें। पूर्ण कल्पना और वर्तमान दरों पर रहते हैं Qwen3.8 फ्लैश मॉडल पेज और एपीआई डॉक।.
मूल्य निर्धारण
बिलिंग प्रत्येक प्रॉम्प्ट आकार पर एक फ्लैट इनपुट दर और एक फ्लैट आउटपुट दर के साथ उपयोग आधारित है, और कोई अलग कैश टियर नहीं है। वेब खोज, text-to-image खोज और image-to-image खोज एक छोटा प्रति-कॉल शुल्क जोड़ते हैं जो केवल तभी लागू होता है जब कोई कॉल वास्तव में चलती है; वेब एक्सट्रैक्टर और कोड दुभाषिया बिना किसी अतिरिक्त लागत के चलते हैं। वर्तमान दरें हमेशा पर रहती हैं मॉडल पेज और मूल्य निर्धारण पृष्ठ, जो आप जो चार्ज कर रहे हैं उसके साथ सिंक में रहते हैं।.
क्विकस्टार्ट
EmpirioLabs आधार URL पर किसी भी OpenAI SDK को इंगित करें और पास करें qwen3-8-flash मॉडल के रूप में:
OpenAI आयात OpenAI क्लाइंट से = OpenAI (base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model ="qwen3-8-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "इस चार्ट में क्या हो रहा है?"}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}, ]}, ], extra_body={"enable_thinking": सच, "thinking_budget": 8192},) print(resp.choices[0].message.content)
वही मॉडल आईडी काम करती है TOKEN, मानवशास्त्रीय आकार का TOKEN, और Google-संगत /v1beta/models/qwen3-8-flash:generateContent मार्ग। वैकल्पिक आईडी QWEN3.8-फ्लैश उसी मॉडल को हल करता है।
विचारशील
गहरी सोच डिफ़ॉल्ट रूप से चालू है और वापस स्ट्रीम करती है तर्क content उत्तर के साथ। इसे नियंत्रित करें सक्षम तथा सोच (262,144 टोकन तक), या भेजें तर्क effort और प्लेटफ़ॉर्म इसे मॉडल के लिए बजट आकार में मैप करता है। टोकन को आउटपुट टोकन के रूप में सोचना, इसलिए सोच को अक्षम करें या छोटे, विलंबता-संवेदनशील मोड़ों के लिए एक छोटा बजट निर्धारित करें।
अंतर्निहित उपकरण
पांच अंतर्निर्मित उपकरण पीछे की सवारी करते हैं उपकरण टॉगल: TOKEN, tool_web_extractor, tool_code_interpreter, tool_web_search_image, और tool_image_search. वेब एक्सट्रैक्टर को वेब खोज की आवश्यकता होती है, और एक्सट्रैक्टर और कोड दुभाषिया दोनों केवल तभी चलते हैं जब सोच सक्षम होती है। जब उपकरण चलते हैं, तो प्रतिक्रिया की उपयोग.tool usage MAP रिपोर्ट करता है कि वास्तव में कितनी कॉल की गई थीं, ताकि आप प्रति-टूल बिलिंग का ऑडिट कर सकें.
संरचित उत्पादन
सटीक प्रतिक्रिया आकार के लिए, पास करें response_format साथ {"प्रकार": "json_schema",...} तथा "सख्त": सच: मॉडल बिना किसी अतिरिक्त के स्कीमा की चाबियाँ लौटाता है। सादा JSON मोड के साथ {"type": "json object"} भी समर्थित है।
आपकी पहली कॉल से पहले जानने लायक बातें
- सभी पांच अंतर्निहित उपकरण डिफ़ॉल्ट रूप से चालू होते हैं, और प्रति आह्वान किए गए कॉल बिल की खोज करते हैं। एक एकल अनुरोध वेब खोज को कई बार चला सकता है, और प्रत्येक आह्वान को बिल किया जाता है। बिना किसी टूल शुल्क के सादे चैट के लिए, सेट करें
TOKEN,tool_web_search_image, औरtool_image_searchसेवा मेरेझूठ।. Tool choice: "required"सोच के दौरान काम नहीं करता है। अनुरोध एक स्पष्ट त्रुटि के साथ अस्वीकार कर दिया जाता है। रखनाtool_choice: "ऑटो"सोच सक्षम या सेट के साथenable_thinking: असत्यजब आपको किसी फ़ंक्शन कॉल को बाध्य करने की आवश्यकता होती है।- JSON मोड को आपके संदेशों में "json" शब्द की आवश्यकता होती है। A
{"type": "json object"}अनुरोध तब तक अस्वीकार कर दिया जाता है जब तक कि यह शब्द बातचीत में कहीं दिखाई न दे। JSON स्कीमा अनुरोधों की ऐसी कोई आवश्यकता नहीं है।
Qwen3.8 फ्लैश अब में उपलब्ध है खेल और के माध्यम से EmpirioLabs एपीआई।.



