
1M टोकन संदर्भ, 128K आउटपुट, कम, उच्च या अधिकतम प्रयास पर हमेशा चलने वाले तर्क, मूल वेब खोज और टूल कॉलिंग के साथ कोडिंग और एजेंटिक मॉडल।
जैसे ही आप जाते हैं, भुगतान करें, या साप्ताहिक भत्ते के साथ एक योजना चुनें।
मूल्य निर्धारण सूची
EmpirioLabs मूल्य निर्धारण मॉडल और इकाई के अनुसार भिन्न होता है: टोकन, चित्र, ऑडियो या वीडियो के सेकंड, संदेश, 3 डी संपत्ति और खोज अनुरोध। इंटरैक्टिव मूल्य निर्धारण तालिका वर्तमान कैटलॉग को लोड करती है, जबकि ये प्रतिनिधि दरें क्लाइंट जावास्क्रिप्ट के बिना पठनीय रहती हैं।
छवि इनपुट प्रति छवि $0.05। वीडियो आउटपुट 480p के लिए $0.096 प्रति सेकंड और 720p के लिए $0.168 प्रति सेकंड से शुरू होता है।
लागत प्रभावी लंबे संदर्भ वाले मल्टीमॉडल एपीआई के लिए इनपुट $0.40 प्रति 1M प्रॉम्प्ट टोकन से शुरू होता है।
मल्टीमॉडल रीजनिंग, कोडिंग और एजेंट वर्कलोड के लिए इनपुट $0.30 प्रति 1M प्रॉम्प्ट टोकन से शुरू होता है।
इमेज-टू-3डी पीढ़ी की कीमत प्रति जेनरेट की गई 3डी संपत्ति के लिए है, जिसमें प्रारूप और रिज़ॉल्यूशन नियंत्रण के लिए दस्तावेज़ हैं।
मॉडल API दरें USD में दिखाई और बिल की जाती हैं। पात्र होने पर checkout स्थानीय भुगतान विधियां दिखा सकता है।
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4.1 Flash
GLM 5.3 Flash
Qwen3.8 Flash
Qwen3.8 27B
Muse Glimmer 30B
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
मिनीमैक्स एम3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 Flashमुफ्तThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V Flashमुफ्तThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 Flashमुफ्तThis model is free to run, so using it never draws from your weekly allowance.
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Fugu Max
Fugu Ultra v2.0
Qwen3.8 Max 0902
Muse Spark 1.3
GLM 5.3
DeepSeek V4 Pro 0813
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 प्लस
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

1M टोकन संदर्भ, 128K आउटपुट, कम, उच्च या अधिकतम प्रयास पर हमेशा चलने वाले तर्क, मूल वेब खोज और टूल कॉलिंग के साथ कोडिंग और एजेंटिक मॉडल।

टेक्स्ट-टू-वीडियो और सिंक्रनाइज़ किए गए देशी ऑडियो के साथ image-to-video, 720p या 1080p पर 3 से 15 सेकंड के लिए, पहलू अनुपात और शीघ्र नियंत्रण के साथ।

1M टोकन संदर्भ, छवि और वीडियो इनपुट, हमेशा तर्क, मूल वेब खोज और टूल कॉलिंग के साथ मूल रूप से मल्टीमॉडल फ्लैश मॉडल।

1M टोकन संदर्भ, 128K आउटपुट, समायोज्य तर्क प्रयास, मूल वेब खोज और टूल कॉलिंग के साथ रीजनिंग और कोडिंग मॉडल।
1M टोकन संदर्भ, 128K आउटपुट, समायोज्य तर्क प्रयास, मूल वेब खोज और टूल कॉलिंग के साथ रीजनिंग और कोडिंग मॉडल।

1M टोकन संदर्भ, 128K आउटपुट, समायोज्य तर्क प्रयास, मूल वेब खोज और टूल कॉलिंग के साथ रीजनिंग और कोडिंग मॉडल।

Kimi K3 मूनशॉट का प्रमुख रीजनिंग मॉडल है जिसमें 1M टोकन संदर्भ, हमेशा चालू रहने वाली सोच, मूल वेब खोज और टेक्स्ट, छवि और वीडियो इनपुट हैं।

मेटा का अपडेटेड फ्रंटियर रीजनिंग मॉडल 1,048,576-टोकन संदर्भ, छवि, वीडियो, ऑडियो और पीडीएफ समझ, वेब खोज और टूल कॉलिंग के साथ है।

Kimi K2.7 कोड मूनशॉट का ट्रिलियन-पैरामीटर एजेंट कोडिंग मॉडल है जिसमें 256K संदर्भ, हमेशा तर्क और टेक्स्ट, छवि और वीडियो इनपुट हैं।

Kimi K2.7 कोड मूनशॉट का ट्रिलियन-पैरामीटर एजेंट कोडिंग मॉडल है जिसमें 256K संदर्भ, हमेशा तर्क और टेक्स्ट, छवि और वीडियो इनपुट हैं।

1,048,576-टोकन संदर्भ के साथ मेटा फ्रंटियर रीजनिंग मॉडल के साथ-साथ छवि, वीडियो, ऑडियो और पीडीएफ समझ, वेब खोज और टूल कॉलिंग।

कठिन तर्क, कोडिंग और अनुसंधान के लिए अद्यतन बहु-एजेंट कंडक्टर, विशिष्ट अधिकतम प्रयास, 1M संदर्भ, छवि इनपुट और वेब खोज के साथ।

पाठ, छवि, वीडियो, कोडिंग, उपकरण उपयोग, जीयूआई समझ और 1M-संदर्भ वर्कफ़्लो के लिए लागत प्रभावी Qwen3.7 दृष्टि-भाषा मॉडल।

पाठ, छवि, वीडियो, कोडिंग, उपकरण उपयोग, जीयूआई समझ और 1M-संदर्भ वर्कफ़्लो के लिए लागत प्रभावी Qwen3.7 दृष्टि-भाषा मॉडल।

Moonshot AIInternationalरिलीज 16 जून 2026Ctx 256Kपाठ निर्माणKimi K2.7 कोड हाईस्पीड मूनशॉट के एजेंटिक कोडिंग मॉडल का सबसे तेज़ सेवा वाला स्तर है, जिसमें 256K संदर्भ, हमेशा चालू तर्क और छवि और वीडियो इनपुट है।

1M संदर्भ, छवि इनपुट, फ़ंक्शन कॉलिंग और वेब खोज के साथ कठिन तर्क, कोडिंग और अनुसंधान के लिए मूल बहु-एजेंट कंडक्टर।

टेक्स्ट, छवि, वीडियो, टूल उपयोग और एजेंट कार्यों के लिए फास्ट Qwen3.7 विजन-लैंग्वेज मॉडल, अंतर्निहित कैशिंग और 1M टोकन संदर्भ के साथ।

टेक्स्ट, छवि, वीडियो, टूल उपयोग और एजेंट कार्यों के लिए फास्ट Qwen3.7 विजन-लैंग्वेज मॉडल, अंतर्निहित कैशिंग और 1M टोकन संदर्भ के साथ।
MiniMax M3 टेक्स्ट, छवि और वीडियो इनपुट के साथ कोडिंग, एजेंट और लंबे संदर्भ विश्लेषण के लिए एक मल्टीमॉडल रीजनिंग मॉडल है।
MiniMax M3 टेक्स्ट, छवि और वीडियो इनपुट के साथ कोडिंग, एजेंट और लंबे संदर्भ विश्लेषण के लिए एक मल्टीमॉडल रीजनिंग मॉडल है।

Qwen3.7 Max कोडिंग, उत्पादकता, लंबे समय तक चलने वाले एजेंटों, गहरी सोच, उपकरण और 1M-टोकन संदर्भ के लिए एक प्रमुख टेक्स्ट मॉडल है।
Qwen3.7 Max कोडिंग, उत्पादकता, लंबे समय तक चलने वाले एजेंटों, गहरी सोच, उपकरण और 1M-टोकन संदर्भ के लिए एक प्रमुख टेक्स्ट मॉडल है।

कोडिंग, लॉन्ग-क्षितिज एजेंटों और पेशेवर काम के लिए ट्रिलियन-स्केल MoE फ्लैगशिप, 1M-टोकन संदर्भ में छवि और वीडियो समझ के साथ।
कोडिंग, लॉन्ग-क्षितिज एजेंटों और पेशेवर काम के लिए ट्रिलियन-स्केल MoE फ्लैगशिप, 1M-टोकन संदर्भ में छवि और वीडियो समझ के साथ।

कोडिंग, एजेंटों और दृश्य समझ के लिए फास्ट Qwen3.8 विजन-लैंग्वेज मॉडल, छवि और वीडियो इनपुट, पांच अंतर्निहित टूल और 1M टोकन संदर्भ के साथ।

मजबूत कोडिंग, स्थिर मल्टी-टूल एजेंट रन और 1M-टोकन संदर्भ में तेज चार्ट और दस्तावेज़ दृष्टि के साथ उन्नत Qwen3.8 Max स्नैपशॉट।
text-to-song और गीत-निर्देशित ऑडियो के लिए ओपन-सोर्स संगीत निर्माण मॉडल, नियंत्रणीय गीत पुनरावृत्ति के लिए तेज़ 8-चरण XL टर्बो अनुमान के साथ।
Apache-लाइसेंस प्राप्त 4B FLUX.2 क्लेन छवि निर्माण और संपादन मॉडल text-to-image, संदर्भ-छवि संपादन और रचनात्मक वर्कफ़्लो समर्थन के साथ।

हाई-स्पीड M2.7 वैरिएंट को मजबूत एजेंट क्षमताओं के साथ मजबूत सामान्य-उद्देश्य प्रदर्शन के साथ तेजी से अनुमान लगाने के लिए ट्यून किया गया है।
रीयलटाइम वॉयस मॉडल जो सादा-अंग्रेजी डिलीवरी दिशा लेता है, 200+ भाषाओं में एक आवाज की पहचान रखता है, और शब्द टाइमस्टैम्प के साथ स्ट्रीम करता है।
130 भाषाओं में 271+ आवाजों के साथ सब-15ms TTFB वॉयस सिंथेसिस, अभिव्यंजक छंदशास्त्र और कम-विलंबता वॉयस एजेंटों के लिए रीयल-टाइम SSE स्ट्रीमिंग।
समृद्ध अभिव्यंजक छंदशास्त्र के साथ प्रसारण-गुणवत्ता वाला आवाज संश्लेषण, 271 भाषाओं में 15+ आवाज़ें, और प्रति-शब्द टाइमस्टैम्प के साथ वास्तविक समय एसएसई स्ट्रीमिंग।
202K संदर्भ, 128K आउटपुट, टूल कॉलिंग, संरचित आउटपुट और कैश समर्थन के साथ लंबे संदर्भ वाला Zhipu AI रीजनिंग मॉडल।

Kimi K2.6 एक मूनशॉट मल्टीमॉडल रीजनिंग मॉडल है जिसमें 256K संदर्भ, मजबूत कोडिंग और टेक्स्ट, इमेज और वीडियो इनपुट हैं।

पोस्ट-प्रशिक्षित 0731 कोडिंग, रिपॉजिटरी कार्य, उपकरण का उपयोग और पूर्ण-स्टैक कार्यों के साथ-साथ 1M संदर्भ विंडो में प्रमुख लाभ के साथ रिलीज।

DeepSeekUnited Statesरिलीज 31 जुल॰ 2026Ctx 1Mपाठ निर्माणपोस्ट-प्रशिक्षित 0731 कोडिंग, रिपॉजिटरी कार्य, उपकरण का उपयोग और पूर्ण-स्टैक कार्यों के साथ-साथ 1M संदर्भ विंडो में प्रमुख लाभ के साथ रिलीज।
गीत से पूर्ण स्टीरियो गाने और एक शैली संकेत, अवधि, बीज और प्रारूप नियंत्रण के साथ 5 मिनट तक उत्पन्न करता है।

आधिकारिक 0813 प्रो कोडिंग, रिपॉजिटरी कार्य, उपकरण उपयोग और एजेंट कार्यों, साथ ही हाइब्रिड सोच और 1M संदर्भ विंडो में प्रमुख लाभ के साथ रिलीज।

मेटा का लॉन्ग-होराइजन एजेंटिक रीजनिंग मॉडल 1,048,576-टोकन संदर्भ, इमेज, वीडियो और पीडीएफ समझ, वेब खोज और टूल कॉलिंग के साथ।
विलंबता-पहला रीयलटाइम वॉयस सिंथेसिस 200+ भाषाओं में एक आवाज की पहचान रखता है, जिसे उच्च-मात्रा स्ट्रीमिंग वर्कलोड के लिए ट्यून किया गया है।

देशी छवि समझ, हाइब्रिड सोच, 1M संदर्भ और 384K आउटपुट टोकन तक के साथ DeepSeek के नए आर्किटेक्चर का लाइटवेट फ्लैगशिप।

MiniMax M2.7 एक सामान्य प्रयोजन तर्क चैट मॉडल है जिसमें इंटरलीव्ड थिंकिंग, फ़ंक्शन कॉलिंग और प्रॉम्प्ट कैशिंग है।
TRELLIS.2 इमेज-टू-3D मॉडल जो एक संदर्भ छवि को रिज़ॉल्यूशन, बीज, जाल, बनावट और निर्यात नियंत्रण के साथ एक बनावट वाली GLB संपत्ति में बदल देता है।

Qwen3.5 122B-A10B 256K संदर्भ, कुशल विरल MoE अनुमान और पाठ, छवि और वीडियो इनपुट के साथ एक मल्टीमॉडल तर्क मॉडल है।

Qwen3.5 397B-A17B भाषा, कोड, एजेंटों, GUI कार्यों और छवि और वीडियो समझ के लिए एक प्रमुख मल्टीमॉडल रीजनिंग मॉडल है।

Qwen3.5 35B-A3B विरल MoE रूटिंग, गहरी सोच और टेक्स्ट, छवि और वीडियो इनपुट के साथ एक कुशल देशी दृष्टि-भाषा मॉडल है।

Qwen3.5 27B एक सघन मल्टीमॉडल रीजनिंग मॉडल है जिसमें तेज़ प्रतिक्रियाएँ, 256K संदर्भ और टेक्स्ट, इमेज और वीडियो समझ है।
256K संदर्भ, छवि और वीडियो इनपुट, फ़ंक्शन टूल, संरचित JSON, और डिफ़ॉल्ट रूप से सोच के साथ मल्टीमॉडल रीजनर।

Qwen3.6 27B 256K संदर्भ पर एजेंडटिक कोडिंग, एसटीईएम रीजनिंग, स्थानिक दृष्टि, ओसीआर और टेक्स्ट, छवि और वीडियो समझ में सुधार करता है।

एजेटिक कोडिंग, गणित तर्क, स्थानिक समझ, ओसीआर, और पाठ, छवि और वीडियो इनपुट के लिए फास्ट Qwen3.6 दृष्टि-भाषा मॉडल।

एजेटिक कोडिंग, गणित तर्क, स्थानिक समझ, ओसीआर, और पाठ, छवि और वीडियो इनपुट के लिए फास्ट Qwen3.6 दृष्टि-भाषा मॉडल।
जेम्मा 4 26B A4B 256K संदर्भ, टेक्स्ट, छवि और वीडियो इनपुट, टूल और संरचित आउटपुट के साथ एक Google ओपन मल्टीमॉडल मॉडल है।
मेटा छवि समझ, 128K संदर्भ, टूल कॉलिंग, संरचित आउटपुट और नियंत्रणीय तर्क शक्ति के साथ 30B एजेंट मॉडल खोलें।
Qwen3.5 9B 256K संदर्भ, छवि और वीडियो इनपुट, फ़ंक्शन टूल और संरचित आउटपुट के साथ एक कॉम्पैक्ट मल्टीमॉडल रीजनिंग मॉडल है।

Qwen3.5 4B 256K संदर्भ, छवि और वीडियो इनपुट, फ़ंक्शन टूल और संरचित आउटपुट के साथ एक कम लागत वाला मल्टीमॉडल रीजनिंग मॉडल है।
Qwen3.6 35B A3B एक 256-विशेषज्ञ mixture-of-experts रीजनिंग मॉडल है जिसमें 128K संदर्भ, फ़ंक्शन टूल और सख्त संरचित JSON आउटपुट है।

कोडिंग, रीजनिंग, लंबे-संदर्भ लेखन और सामान्य चैट के लिए मुफ्त लाइटवेट GLM-4.7 टेक्स्ट मॉडल।

तर्क, कोडिंग, लंबी-फ़ॉर्म चैट और सामान्य भाषा कार्यों के लिए मुफ्त हल्का GLM-4.5 टेक्स्ट मॉडल।

मूल फ़ंक्शन कॉलिंग के साथ छवि, वीडियो, फ़ाइल और पाठ समझ के लिए मुफ्त मल्टीमॉडल GLM-4.6V मॉडल।

छवि निर्माण और संपादन मॉडल पाठ या छवि इनपुट से छवियों को बनाने और संशोधित करने के लिए, इनपेंटिंग, वर्चुअल ट्राई-ऑन और स्टाइल नियंत्रण के साथ।

वीडियो जनरेशन मॉडल टेक्स्ट से 2 मिनट तक के मल्टी-शॉट वीडियो का उत्पादन करता है और बेहतर गुणवत्ता और स्थिरता के साथ वैकल्पिक छवि संकेत देता है।

उत्पादन कार्यभार के लिए बहु-भाषा समर्थन और उन्नत अनुकूलन योग्य सेटिंग्स के साथ नोवा -3 मॉडल का उपयोग करके भाषण-से-पाठ प्रतिलेखन।

DeepSeek R1 को एकीकृत, डेटा-नियंत्रित इंटरफ़ेस के पीछे एंथ्रोपिक क्लाउड रचनात्मक और कोड जनरेशन के साथ तर्क chain-of-thought जोड़ता है।

ओपन-सोर्स मिक्सचर-ऑफ-एक्सपर्ट्स एलएलएम लंबे समय तक चलने वाले संकेतों में उच्च दक्षता वाले तर्क, कोडिंग और सामान्य भाषा कार्यों के लिए ट्यून किया गया है।

284B कुल/13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ हल्का MoE मॉडल, कम-विलंबता, लागत प्रभावी उच्च-समवर्ती उपयोग के लिए ट्यून किया गया।

284B कुल/13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ हल्का MoE मॉडल, कम-विलंबता, लागत प्रभावी उच्च-समवर्ती उपयोग के लिए ट्यून किया गया।

284B कुल/13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ हल्का MoE मॉडल, कम-विलंबता, लागत प्रभावी उच्च-समवर्ती उपयोग के लिए ट्यून किया गया।

284B कुल/13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ हल्का MoE मॉडल, कम-विलंबता, लागत प्रभावी उच्च-समवर्ती उपयोग के लिए ट्यून किया गया।

1.6T कुल/49B सक्रिय मापदंडों के साथ फ्लैगशिप MoE LLM और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ।

1.6T कुल/49B सक्रिय मापदंडों के साथ फ्लैगशिप MoE LLM और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ।

1.6T कुल/49B सक्रिय मापदंडों के साथ फ्लैगशिप MoE LLM और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ।

1.6T कुल/49B सक्रिय मापदंडों के साथ फ्लैगशिप MoE LLM और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ।

एक प्राकृतिक भाषा के प्रश्न का त्वरित एलएलएम-शैली का उत्तर, इनलाइन उद्धरणों और स्रोत लिंक के साथ ताजा Exa वेब खोज परिणामों पर आधारित।

वेब खोज इंजन पृष्ठों को खोजने, समान पृष्ठों को पुनर्प्राप्त करने, क्रॉल करने और एआई एजेंटों के लिए खुले वेब पर समर्पित कोड खोज के लिए।

उत्पादन ऐप्स के लिए एकल और बहु-स्पीकर आवाज़ों और नियंत्रणीय शैली, उच्चारण और अभिव्यंजक स्वर के साथ कम-विलंबता text-to-speech।

पॉडकास्ट, ऑडियोबुक और ग्राहक सहायता के लिए उच्च गुणवत्ता वाले टीटीएस पूर्वावलोकन, 23+ भाषाओं में अभिव्यंजक बहु-स्पीकर आवाज़ों के साथ।

सटीक शैली, टोन, गति, और कथन, सहायकों और आवाज ऐप्स में वितरण के लिए नए ऑडियो टैग के साथ अत्यधिक नियंत्रणीय टीटीएस।

128K संदर्भ, 140+ भाषाओं, बेहतर math/reasoning, संरचित आउटपुट और फ़ंक्शन कॉलिंग के साथ ओपन-सोर्स विज़न-लैंग्वेज मॉडल।

एलएलएम-आधारित text-to-speech 3-10 ऑडियो और भावना-अभिव्यंजक, बहु-इनाम आरएल के माध्यम से नियंत्रणीय आउटपुट के 3-10 से शून्य-शॉट वॉयस क्लोनिंग के साथ।

डीप-लर्निंग डिटेक्टर जो एआई बनाम मानव द्वारा उत्पन्न पाठ के कुछ हिस्सों को चिह्नित करता है, सामग्री को पूरी तरह से मानव, एआई या मिश्रित के रूप में वर्गीकृत करता है।

वीडियो मॉडल टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, रेफरेंस-टू-वीडियो और वीडियो एडिट मोड के साथ उच्च-निष्ठा, गति-चिकनी आउटपुट की पेशकश करता है।

फोटोरियलिस्टिक विवरण और मजबूत बहुभाषी पाठ प्रतिपादन के साथ मल्टीमॉडल मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर पर ओपन-सोर्स text-to-image मॉडल।
8.3B-पैरामीटर वीडियो मॉडल देशी 720p आउटपुट (1080p तक अपस्केलेबल), मजबूत गति सुसंगतता और 10s तक द्विभाषी त्वरित समझ के साथ।

जानूस प्रो 7बी मॉडल पर ऑटोरेग्रेसिव फ्रेमवर्क जो एक आर्किटेक्चर में मल्टीमॉडल समझ और छवि निर्माण को एकीकृत करता है।

टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, रेफरेंस-टू-वीडियो, एडिटिंग, नेटिव साउंड और मल्टी-सीन ट्रांज़िशन के साथ स्टैंडर्ड या प्रो मोड में वीडियो मॉडल।

क्लिंग 3.0 मॉडल जो मानक 720p और प्रो 1080p स्तरों के साथ एक संदर्भ छवि से एक संदर्भ वीडियो से एक चरित्र पर गति स्थानांतरित करता है।

पुनरावृत्त एआई खोज जो प्रारंभिक परिणाम अपर्याप्त होने पर क्वेरी करती रहती है, मानक मोड की तुलना में अधिक व्यापक उत्तर लौटाती है।

विस्तृत अवलोकन और उत्तरों के साथ AI-संचालित वेब खोज, डीप सर्च की तुलना में तेज़। OpenAI SimpleQA बेंचमार्क पर #1 रैंक है।

छवि विश्लेषण, प्रोग्रामिंग, गणित और बहुभाषी कार्यों के लिए 128K संदर्भ के साथ 24B-पैरामीटर मल्टीमॉडल मॉडल, कुशल स्थानीय अनुमान के लिए ट्यून किया गया।

हाइब्रिड मॉडल एकीकृत निर्देश, तर्क (मैजिस्ट्रल), और डेवस्ट्रल परिवार: 40% कम पूर्णता समय और 3x थ्रूपुट बनाम छोटा 3।

ओपन-सोर्स 32B MoE फाउंडेशन मॉडल जो सटीक दोहरे टॉवर लिप-सिंक के साथ एक अनुमान चरण में सिंक्रनाइज़ वीडियो और ऑडियो उत्पन्न करता है।

300K संदर्भ (~ 30 मिनट वीडियो तक) पर पाठ, छवियों और वीडियो के लिए कम लागत वाला मल्टीमॉडल फाउंडेशन मॉडल, गति और सामर्थ्य के लिए ट्यून किया गया।

1M संदर्भ (लंबे दस्तावेज़ और ~ 90 मिनट क्लिप) पर पाठ, छवियों, दस्तावेजों और वीडियो के लिए तेज़, लागत प्रभावी मल्टीमॉडल तर्क मॉडल।

टेक्स्ट-ओनली फाउंडेशन मॉडल अल्ट्रा-लो विलंबता और 128K संदर्भ पर लागत के लिए ट्यून किया गया। 44% कैश छूट के साथ सारांश, अनुवाद और चैट के लिए मजबूत।

मल्टीमॉडल फाउंडेशन मॉडल 300K संदर्भ (~ 30 मिनट वीडियो तक) पर पाठ, छवियों और वीडियो के लिए सटीकता, गति और लागत को संतुलित करता है।

व्हिस्पर-1 speech-to-text ट्रांसक्रिप्शन को बहुभाषी पर्यवेक्षित ऑडियो पर प्रशिक्षित किया गया है, जिसमें प्रति फ़ाइल 25 एमबी अपलोड सीमा है।

क्लाउड ओपस 4.6 रीजनिंग द्वारा संचालित संस्थागत-ग्रेड अनुसंधान, अधिकतम गहराई, उन्नत टूल एक्सेस और व्यापक स्रोत कवरेज के साथ।

बहु-चरणीय पुनर्प्राप्ति, संश्लेषण और तर्क के लिए अनुसंधान मॉडल, स्वायत्त रूप से खोज, पढ़ना और जटिल विषयों में स्रोतों का मूल्यांकन करना।

सोनार प्रो एक एजेंट शोधकर्ता के रूप में: वेब खोजों को श्रृंखलाबद्ध करता है, पूर्ण पृष्ठ प्राप्त करता है, और लाइव रीजनिंग को स्ट्रीम करता है, जटिल प्रश्नों के लिए रणनीति को अपनाता है।

डोमेन, भाषा, दिनांक और बहुत कुछ के आधार पर फ़िल्टरिंग के साथ वास्तविक समय वेब खोज। खोज परिणाम लौटाता है, एलएलएम प्रतिक्रियाएं नहीं; कोई फ़ाइल अपलोड नहीं।

उत्पादन ऐप्स में एआई खोज एकीकरण up-to-date लिए सटीक उद्धरणों और अनुकूलन योग्य स्रोतों के साथ वास्तविक समय वेब-कनेक्टेड खोज।

दोगुने उद्धरणों और एक बड़ी संदर्भ विंडो के साथ खोज-ग्राउंडेड मॉडल, जटिल प्रश्नों के लिए गहराई से, सूक्ष्म उत्तरों की आवश्यकता होती है।

वेब खोज के साथ बिना सेंसर किए गए ओपन-सोर्स R1-1776 पर रीजनिंग मॉडल, SimpleQA बेंचमार्क पर अग्रणी खोज इंजन और LLM से बेहतर प्रदर्शन करता है।

टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और ट्रांज़िशन मोड में उच्च विवरण, द्रव गति और सजीव एनिमेशन के साथ सिनेमाई वीडियो जनरेशन।

टेक्स्ट या 1-2 फ्रेम इमेज प्रॉम्प्ट से 1080p तक, मल्टीपल आस्पेक्ट रेशियो, 5-10s अवधि, वैकल्पिक सिंक्रनाइज़ ऑडियो के साथ वीडियो जेनरेट करता है।

एकीकृत छवि निर्माण और संपादन मॉडल वर्ग-अग्रणी जटिल Chinese/English पाठ प्रतिपादन, यथार्थवादी बनावट, और बहु-छवि संलयन के साथ।

बेस और प्रो वेरिएंट, बहुभाषी टाइपोग्राफी, बहु-छवि संदर्भ और नियंत्रणीय 1K या 2K आउटपुट के साथ क्वेन छवि निर्माण और संपादन।

हाइब्रिड रैखिक-ध्यान प्लस विरल MoE, 1M संदर्भ, और तेज़ मल्टीमॉडल text/image/वीडियो अनुमान के साथ दृष्टि-भाषा मॉडल।

हाइब्रिड रैखिक-ध्यान प्लस विरल MoE, 1M संदर्भ, और तेज़ मल्टीमॉडल text/image/वीडियो अनुमान के साथ दृष्टि-भाषा मॉडल।

Alibaba CloudSingaporeरिलीज 30 मार्च 2026Ctx 256Kपाठ निर्माणलागत-कुशल ओमनी-मोडल मॉडल टेक्स्ट, छवि, ऑडियो और वीडियो को संभालता है, जिसमें 3+ भाषाओं में 3 घंटे तक का ऑडियो और 1 घंटे का वीडियो 90 घंटे तक है।

टेक्स्ट, छवि, ऑडियो और वीडियो के लिए फ्लैगशिप ओमनी-मोडल मॉडल। 3 घंटे ऑडियो, 1 घंटे वीडियो, 90+ इनपुट और 30+ आउटपुट भाषाएं, 55 आवाज का समय।

1M संदर्भ पर पाठ, छवि और वीडियो में कुशल गहरी सोच और दृश्य समझ के लिए हाइब्रिड आर्किटेक्चर के साथ मल्टीमॉडल मॉडल।

1M संदर्भ पर पाठ, छवि और वीडियो में कुशल गहरी सोच और दृश्य समझ के लिए हाइब्रिड आर्किटेक्चर के साथ मल्टीमॉडल मॉडल।

Alibaba CloudSingaporeरिलीज 20 अप्रैल 2026Ctx 256Kपाठ निर्माण3.6 श्रृंखला में सबसे बड़ा पूर्वावलोकन संस्करण (केवल-पाठ): बेहतर कोडिंग एजेंट निष्पादन, मजबूत फ्रंट-एंड कौशल और व्यापक लंबी-पूंछ ज्ञान।

3.5 से अधिक प्रमुख उन्नयन के साथ विजन-भाषा मॉडल: एजेनिक और फ्रंट-एंड कोडिंग, मल्टीमॉडल पहचान, ओसीआर, और ऑब्जेक्ट स्थानीयकरण।

3.5 से अधिक प्रमुख उन्नयन के साथ विजन-भाषा मॉडल: एजेनिक और फ्रंट-एंड कोडिंग, मल्टीमॉडल पहचान, ओसीआर, और ऑब्जेक्ट स्थानीयकरण।

256K-संदर्भ फ्लैगशिप तर्क, निर्देश पालन और बहुभाषी समर्थन में बड़े सुधार के साथ-साथ उच्च coding/math सटीकता के साथ।

चीनी-अंग्रेजी समझ, जटिल निर्देशों, बहुभाषी क्षमता और उपकरण उपयोग में 2.5 श्रृंखला पर प्रमुख लाभ के साथ पूर्वावलोकन रिलीज़।

अनुकूली उपकरण उपयोग (खोज, मेमोरी, कोड दुभाषिया) और जटिल कार्यों पर उच्च सटीकता के लिए परीक्षण-समय स्केलिंग के साथ तर्क मॉडल।

सिमेंटिक दस्तावेज़ रीरैंकर। प्रासंगिकता के आधार पर प्रति क्वेरी 500 उम्मीदवारों को क्रमबद्ध करता है, 100+ भाषाओं का समर्थन करता है, और एक कस्टम सॉर्टिंग निर्देश स्वीकार करता है।

कोडिंग-ट्यून किया गया 256K-संदर्भ मॉडल मजबूत फ्रंट-एंड परिणामों और एआई कोडिंग टूल और एजेंटों के लिए बहुभाषी प्रोग्रामिंग समर्थन के साथ।

उच्च आवृत्ति उद्यम कार्यभार के लिए संतुलित सामान्य प्रयोजन मॉडल: सूचना प्रसंस्करण, सामग्री, खोज और डेटा विश्लेषण।

256K संदर्भ के साथ विलंबता-केंद्रित मल्टीमॉडल मॉडल, चार तर्क प्रयास मोड और उच्च-समवर्ती उपयोग के लिए image/video समझ।

जटिल तर्क, मल्टीमॉडल समझ, संरचित पीढ़ी और उपकरण-संवर्धित निष्पादन के लिए 256K संदर्भ के साथ प्रमुख सामान्य मॉडल।

देशी ऑडियो सिंक, कैमरा नियंत्रण और प्रति रेंडर कम लागत पर स्थिर गति के साथ सिनेमाई क्लिप के लिए स्पीड-अनुकूलित 2.0 वीडियो संस्करण।

स्थिर गति और सुसंगत वर्णों के साथ पाठ, छवि, ऑडियो या वीडियो इनपुट से सिनेमाई आउटपुट के लिए मल्टीमॉडल वीडियो मॉडल।

एकीकृत मल्टीमॉडल छवि मॉडल जो प्रतिपादन से पहले संकेतों के माध्यम से तर्क करता है, उच्च-रिज़ॉल्यूशन और सुसंगत संपादन और ब्रांड दृश्य तैयार करता है।

प्रीमियम सीड्रीम छवि मॉडल जो एक छवि को संपादन योग्य परतों में विभाजित करता है, समन्वय या स्केच मार्कर द्वारा संपादन करता है, और 10 संदर्भों तक फ़्यूज़ करता है।

पैरालिंग्विस्टिक नियंत्रण (हँसी, आह) और शून्य-शॉट वॉयस क्लोनिंग के साथ लंबे-फॉर्म, मल्टी-स्पीकर पॉडकास्ट संवाद के लिए ओपन-सोर्स वॉयस मॉडल।

टेक्स्ट प्रॉम्प्ट से 3 मिनट तक ऑडियो उत्पन्न करता है, समायोज्य अवधि, चरणों और सीएफजी पैमाने के साथ text-to-audio और audio-to-audio का समर्थन करता है।

संगीत उत्पादन, ध्वनि डिजाइन और रीमिक्सिंग के लिए text-to-audio, audio-to-audio और ऑडियो इनपेंटिंग के साथ पाठ से अप-to-3-minute ऑडियो।

WAN 2.0 पर स्थिर वीडियो इन्फिनिटी 2.2 प्रो: स्थिर छवियों को सैद्धांतिक रूप से अनंत-लंबाई वाले वीडियो में विस्तारित करता है, जबकि लगातार चरित्र आईडी रखता है।

बहु-खोज अनुसंधान सहायक जो किसी विषय की खोज करता है, स्रोतों का विश्लेषण करता है, और उद्धरणों के साथ एक विस्तृत शोध रिपोर्ट तैयार करता है।

डाउनस्ट्रीम पाइपलाइनों के लिए पृष्ठों और डोमेन में तेज़, संरचित पुनर्प्राप्ति के लिए क्रॉल, एक्सट्रैक्ट और URL मैपिंग के साथ वेब खोज।

चयन योग्य आउटपुट आयामों (64-2048) के साथ बहुभाषी पाठ एम्बेडिंग। प्रति इनपुट 8,192 टोकन तक।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 1Kएम्बेडिंगस्पीड-ऑप्टिमाइज़ किए गए मल्टीमॉडल एम्बेडिंग, विज़न-प्लस के समान आकार, 3× सस्ते image/video टोकन।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 1Kएम्बेडिंगमल्टीमॉडल एम्बेडिंग टेक्स्ट, छवि और वीडियो इनपुट के लिए स्वतंत्र वैक्टर का उत्पादन करता है।

देशी ऑडियो-विजुअल सिंक (लिप-सिंक, संवाद, संगीत, एसएफएक्स) के साथ सिनेमाई, मल्टी-शॉट कहानियों के लिए मल्टीमॉडल वीडियो जनरेशन मॉडल।

टेक्स्ट, छवि या वीडियो इनपुट से उच्च-निष्ठा आउटपुट के साथ T2V, I2V, वीडियो संपादन और reference-to-video का समर्थन करने वाला मल्टीमॉडल वीडियो मॉडल।

छवि निर्माण और संपादन साथी मॉडल: text-to-image, बाउंडिंग-बॉक्स संपादन और सामंजस्यपूर्ण छवि सेट, प्रो पर 4K आउटपुट तक।
बहुभाषी एएसआर, अनुवाद, वीएडी, टाइमस्टैम्प, उपशीर्षक, हॉटवर्ड्स और डिकोडर नियंत्रण के साथ नियंत्रित कानाफूसी बड़े v3 टर्बो ट्रांसक्रिप्शन।

स्वायत्त एआई एजेंट जो उच्च-स्तरीय प्रॉम्प्ट को उप-कार्यों, कॉल टूल और एपीआई में बदल देता है, और मैन्युअल ऑर्केस्ट्रेशन के बिना end-to-end परिणाम प्रदान करता है।

टेक्स्ट-टू-वीडियो, image-to-video और reference-to-video पीढ़ी लगातार वर्णों के लिए सात संदर्भ छवियों के साथ, 15p पर 1080 सेकंड तक।

एजेंट वर्कफ़्लोज़, जटिल सॉफ्टवेयर इंजीनियरिंग और लंबे-क्षितिज कार्यों के लिए शीर्ष स्तरीय मॉडल, 1M संदर्भ पर 1000+ टूल कॉल में काम को बनाए रखता है।

1M संदर्भ पर देशी दृश्य और ऑडियो समझ के साथ मल्टीमॉडल मॉडल, एजेंट वर्कफ़्लो में तौर-तरीकों में तर्क और कार्य करने के लिए डिज़ाइन किया गया है।

टेक्स्ट, इमेज और reference-to-video को एक मॉडल में रखें। सिनेमाई गति, 9 संदर्भों तक चरित्र स्थिरता, और सिंक्रनाइज़ देशी ऑडियो।

480p और 720p पर देशी ऑडियो, कैमरा नियंत्रण और छवि या वीडियो इनपुट के साथ लघु सिनेमाई क्लिप के लिए सबसे तेज़, सबसे किफायती Seedance 720 स्तर।

छवि और वीडियो इनपुट, टूल कॉलिंग, समायोज्य तर्क प्रयास और 256K संदर्भ के साथ स्टेपफन मल्टीमॉडल रीजनिंग मॉडल।

एजेंटों, कोडिंग, टूल कॉलिंग और लंबे संदर्भ विश्लेषण के लिए स्टेपफन टेक्स्ट रीजनिंग मॉडल।

एजेंट-अनुकूलित चरण 3.5 कम और उच्च तर्क प्रयास मोड के साथ फ्लैश संस्करण।

टेक्स्ट आउटपुट और पैरालिंग्विस्टिक समझ के साथ StepFun ऑडियो और टेक्स्ट वार्तालाप मॉडल।

text-to-image और एकल-छवि संपादन के लिए StepFun छवि निर्माण और छवि संपादन मॉडल।

प्रासंगिक StepFun प्राकृतिक भाषा की आवाज दिशा और अभिव्यंजक वितरण के साथ text-to-speech मॉडल।

StepFun आधिकारिक आवाज़, कस्टम क्लोन आवाज़ों और वॉयस टैग नियंत्रण के साथ text-to-speech मॉडल।

चीनी और अंग्रेजी ऑडियो ट्रांसक्रिप्शन के लिए StepFun स्ट्रीमिंग स्पीच रिकग्निशन मॉडल।

इंजीनियरिंग-ग्रेड कोड डिलीवरी, लंबे-क्षितिज स्वायत्तता और 256K मल्टीमॉडल समझ के साथ अगली पीढ़ी की कोडिंग और एजेंट मॉडल।

1,000 से अधिक आवाजों, 16 भाषाओं, 20 चीनी बोलियों, प्राकृतिक-भाषा वितरण दिशा और इनलाइन भावना टैग के साथ स्तरीय भाषण संश्लेषण।

एक अनुरोध में पाठ, छवि, वीडियो और ऑडियो संदर्भों का पालन करते हुए, देशी स्टीरियो ऑडियो के साथ 2K तक 4 से 15 सेकंड क्लिप उत्पन्न करता है।

OpenAI का प्रमुख छवि मॉडल जिसमें 16 संदर्भ छवियों में मजबूत त्वरित निष्ठा, स्पष्ट पाठ प्रतिपादन और निर्देश-आधारित संपादन है।

Kuaishou का Kling 3.0 वीडियो जनरेटर text-to-video, पहला और आखिरी फ्रेम image-to-video, मूल ऑडियो और 720p, 1080p, या 4K आउटपुट के साथ।

text-to-video और image-to-video के साथ अलीबाबा का वान 2.5 वीडियो मॉडल, मूल ऑडियो, वैकल्पिक कस्टम ऑडियो ट्रैक और 480p से 1080p आउटपुट।

अलीबाबा का वान 2.2 वीडियो परिवार मानक और फ्लैश स्तरों के साथ, पहला और आखिरी फ्रेम प्रक्षेप, और कम लागत पर 480p से 1080p आउटपुट।

अलीबाबा का वान 2.1 वीडियो मॉडल text-to-video, image-to-video और 480p पर पहले और आखिरी फ्रेम क्लिप के लिए टर्बो और प्लस टियर के साथ।

अलीबाबा का वान 2.5 छवि मॉडल लगभग 1.7 मेगापिक्सेल पर 3 छवियों तक के text-to-image और बहु-संदर्भ संपादन के साथ।

अलीबाबा का वान 2.2 text-to-image मॉडल प्लस और फ्लैश टियर के साथ और कम प्रति-छवि मूल्य निर्धारण पर 1440x1440 आउटपुट तक।

अलीबाबा का वान 2.1 टर्बो और प्लस टियर के साथ text-to-image मॉडल और कम प्रति-छवि मूल्य निर्धारण पर 1440x1440 आउटपुट तक।

30 सेकंड तक सुसंगत क्लिप के लिए लंबा-फॉर्म वीडियो मॉडल, जिसमें 50 संदर्भ छवियों, वीडियो और ऑडियो क्लिप, मूल ऑडियो, संपादन और एक्सटेंशन तक हैं।

टेक्स्ट-टू-इमेज प्लस बहु-संदर्भ संपादन अधिकतम पांच स्रोत छवियों, स्वचालित या पिन किए गए गुणवत्ता स्तरों और 1K या 2K आउटपुट रिज़ॉल्यूशन के साथ।

मूल ऑडियो, मल्टी-शॉट कट और क्लिप एक्सटेंशन के साथ टेक्स्ट, छवियों, पहले और अंतिम फ्रेम, या अधिकतम सात संदर्भों से वीडियो उत्पन्न करता है।

एक्शन और इफेक्ट के लिए सिनेमा-ग्रेड वीडियो मॉडल, टेक्स्ट, इमेज, पहले और आखिरी फ्रेम, या संदर्भों से, देशी सिंक्रनाइज़ ऑडियो के साथ।

किसी मौजूदा वीडियो में माउथ मूवमेंट को अपलोड किए गए ऑडियो ट्रैक या चौदह अंतर्निहित आवाजों में से किसी एक द्वारा बोले गए पाठ के साथ संरेखित करता है.
एक एकल चित्र को एक बात करने वाले अवतार वीडियो में बदल देता है, जो एक अपलोड किए गए ऑडियो ट्रैक द्वारा या एक अंतर्निहित आवाज के साथ बोले गए पाठ द्वारा संचालित होता है।

एक मॉडल में छह वीडियो परिवर्तन: शीघ्र संपादन, रेस्टलिंग, विषय स्वैप, गति स्थानांतरण, अपस्केलिंग और उत्पन्न ध्वनि प्रभाव।

मिलीसेकंड लिप सिंक, छह भाषाओं में संवाद, सिनेमाई कैमरा मूव्स और 1080p आउटपुट के साथ संयुक्त ऑडियो और वीडियो जनरेशन।

उच्च-निष्ठा छवि निर्माण और 14 संदर्भ छवियों के साथ संपादन, मजबूत टेक्स्ट रेंडरिंग, और एक फ्लैट मूल्य पर 2K या 4K आउटपुट।

14 संदर्भ छवियों के साथ एकीकृत छवि निर्माण और संपादन, 15 तक के बैच सेट, और एक फ्लैट प्रति-छवि मूल्य पर 1K से 4K आउटपुट।

रॉडिन जेन -2 इंजन जो पीबीआर सामग्री और क्वाड या कच्चे जाल के साथ उत्पादन 3 डी संपत्ति में एक टेक्स्ट प्रॉम्प्ट या पांच संदर्भ छवियों को बदल देता है।

संरचना-जागरूक बनावट, 1536 और 1536 प्रो सटीक स्तरों के साथ उत्पादन-केंद्रित छवि-से-3 डी, दो मिलियन चेहरों तक और पांच निर्यात प्रारूपों को मिलाता है।

मल्टीमॉडल एम्बेडिंग जो क्रॉस-मोडल खोज और पुनर्प्राप्ति के लिए टेक्स्ट, छवियों और वीडियो को एक 1024 या 2048 आयाम वेक्टर में फ़्यूज़ करता है।

मूल ऑडियो, ओमनी-मोडल संदर्भ (छवियों, वीडियो, ऑडियो, फ़ाइलें, वेब लिंक) और एक तेज़ प्राइम टियर के साथ 30 सेकंड तक ऑल-इन-वन वीडियो जनरेशन।

लागत-कुशल बहु-एजेंट कंडक्टर जो 1M संदर्भ, छवि इनपुट और वेब खोज के साथ प्रति कार्य एक सही आकार की विशेषज्ञ टीम को इकट्ठा करता है।

1M संदर्भ, छवि इनपुट और वेब खोज के साथ सबसे कठिन तर्क, कोडिंग और अनुसंधान कार्य के लिए फ्लैगशिप मल्टी-एजेंट कंडक्टर।
163 / 182 मॉडल