
टेक्स्ट-टू-वीडियो और image-to-video सिंक्रनाइज़ किए गए मूल ऑडियो के साथ, 3 से 15 सेकंड के लिए 720p या 1080p पर, पहलू अनुपात और शीघ्र नियंत्रण के साथ।
जैसा कि आप जाते हैं, या साप्ताहिक भत्ते के साथ एक योजना चुनें।
मूल्य निर्धारण सूची
EmpirioLabs मूल्य निर्धारण मॉडल और इकाई के अनुसार भिन्न होता है: टोकन, चित्र, ऑडियो या वीडियो के सेकंड, संदेश, 3 डी संपत्ति और खोज अनुरोध। इंटरैक्टिव मूल्य निर्धारण तालिका वर्तमान कैटलॉग को लोड करती है, जबकि ये प्रतिनिधि दरें क्लाइंट जावास्क्रिप्ट के बिना पठनीय रहती हैं।
छवि इनपुट प्रति छवि $0.05। वीडियो आउटपुट 480p के लिए $0.096 प्रति सेकंड और 720p के लिए $0.168 प्रति सेकंड से शुरू होता है।
लागत प्रभावी लंबे संदर्भ वाले मल्टीमॉडल एपीआई के लिए इनपुट $0.40 प्रति 1M प्रॉम्प्ट टोकन से शुरू होता है।
मल्टीमॉडल रीजनिंग, कोडिंग और एजेंट वर्कलोड के लिए इनपुट $0.30 प्रति 1M प्रॉम्प्ट टोकन से शुरू होता है।
इमेज-टू-3डी पीढ़ी की कीमत प्रति जेनरेट की गई 3डी संपत्ति के लिए है, जिसमें प्रारूप और रिज़ॉल्यूशन नियंत्रण के लिए दस्तावेज़ हैं।
मॉडल API दरें USD में दिखाई और बिल की जाती हैं। पात्र होने पर checkout स्थानीय भुगतान विधियां दिखा सकता है।
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
मिनीमैक्स एम3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 Flashमुफ्तThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V Flashमुफ्तThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 Flashमुफ्तThis model is free to run, so using it never draws from your weekly allowance.
Mistral Medium 3
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 प्लस
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
Mistral Medium 3.1
Nova Premier 1.0
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

टेक्स्ट-टू-वीडियो और image-to-video सिंक्रनाइज़ किए गए मूल ऑडियो के साथ, 3 से 15 सेकंड के लिए 720p या 1080p पर, पहलू अनुपात और शीघ्र नियंत्रण के साथ।

एक 1M टोकन संदर्भ, 128K आउटपुट, समायोज्य तर्क प्रयास, मूल वेब खोज और टूल कॉल के साथ रीजनिंग और कोडिंग मॉडल।
एक 1M टोकन संदर्भ, 128K आउटपुट, समायोज्य तर्क प्रयास, मूल वेब खोज और टूल कॉल के साथ रीजनिंग और कोडिंग मॉडल।

Kimi K3 एक 1M टोकन संदर्भ, हमेशा सोच, मूल वेब खोज, और पाठ, छवि और वीडियो इनपुट के साथ Moonshot के फ्लैगशिप तर्क मॉडल है।

मेटा का अद्यतन फ्रंटियर तर्क मॉडल 1,048,576-टोकन संदर्भ, छवि, वीडियो, ऑडियो और पीडीएफ समझ, वेब खोज और टूल कॉल के साथ।

Kimi K2.7 कोड 256K संदर्भ, हमेशा तर्क और पाठ, छवि और वीडियो इनपुट के साथ Moonshot के ट्रिलियन पैरामीटर एजेंटिक कोडिंग मॉडल है।

Kimi K2.7 कोड 256K संदर्भ, हमेशा तर्क और पाठ, छवि और वीडियो इनपुट के साथ Moonshot के ट्रिलियन पैरामीटर एजेंटिक कोडिंग मॉडल है।

एक 1,048,576-token संदर्भ प्लस छवि, वीडियो, ऑडियो और पीडीएफ समझ, वेब खोज और टूल कॉल के साथ मेटा फ्रंटियर तर्क मॉडल।

हार्ड तर्क, कोडिंग और अनुसंधान के लिए अद्यतन मल्टी-एजेंट कंडक्टर, विशिष्ट अधिकतम प्रयास, 1M संदर्भ, छवि इनपुट और वेब खोज के साथ।

पाठ, छवि, वीडियो, कोडिंग, टूल उपयोग, GUI समझ और 1M-context वर्कफ़्लो के लिए लागत प्रभावी Qwen3.7 दृष्टि-भाषा मॉडल।

पाठ, छवि, वीडियो, कोडिंग, टूल उपयोग, GUI समझ और 1M-context वर्कफ़्लो के लिए लागत प्रभावी Qwen3.7 दृष्टि-भाषा मॉडल।

Moonshot AIInternationalरिलीज 16 जून 2026Ctx 256Kटेक्स्ट जनरेशनKimi K2.7 कोड हाईस्पीड मूनशॉट के एजेंटिक कोडिंग मॉडल का तेज़-सर्विंग टियर है, जिसमें 256K संदर्भ, हमेशा तर्क और छवि और वीडियो इनपुट शामिल हैं।

1M संदर्भ, छवि इनपुट, फ़ंक्शन कॉलिंग और वेब खोज के साथ हार्ड तर्क, कोडिंग और अनुसंधान के लिए मूल बहु-एजेंट कंडक्टर।

पाठ, छवि, वीडियो, उपकरण उपयोग और एजेंटिक कार्यों के लिए फास्ट Qwen3.7 दृष्टि-भाषा मॉडल, अंतर्निहित कैशिंग और 1M टोकन संदर्भ के साथ।

पाठ, छवि, वीडियो, उपकरण उपयोग और एजेंटिक कार्यों के लिए फास्ट Qwen3.7 दृष्टि-भाषा मॉडल, अंतर्निहित कैशिंग और 1M टोकन संदर्भ के साथ।

मिनिमम एम 3 टेक्स्ट, इमेज और वीडियो इनपुट के साथ कोडिंग, एजेंट और लंबे-context विश्लेषण के लिए एक बहुमॉडल तर्क मॉडल है।

मिनिमम एम 3 टेक्स्ट, इमेज और वीडियो इनपुट के साथ कोडिंग, एजेंट और लंबे-context विश्लेषण के लिए एक बहुमॉडल तर्क मॉडल है।

Qwen3.7 मैक्स कोडिंग, उत्पादकता, लंबे समय तक चलने वाले एजेंटों, गहरी सोच, उपकरण और 1M-token संदर्भ के लिए एक प्रमुख पाठ मॉडल है।

Qwen3.7 मैक्स कोडिंग, उत्पादकता, लंबे समय तक चलने वाले एजेंटों, गहरी सोच, उपकरण और 1M-token संदर्भ के लिए एक प्रमुख पाठ मॉडल है।

कोडिंग, लंबे समय तक चलने वाले एजेंटों और पेशेवर काम के लिए ट्रिलियन पैमाने पर मोई फ्लैगशिप, जिसमें 1M-token संदर्भ में छवि और वीडियो समझ शामिल है।

कोडिंग, लंबे समय तक चलने वाले एजेंटों और पेशेवर काम के लिए ट्रिलियन पैमाने पर मोई फ्लैगशिप, जिसमें 1M-token संदर्भ में छवि और वीडियो समझ शामिल है।
text-to-song और lyric-guided ऑडियो के लिए ओपन सोर्स म्यूजिक जेनरेशन मॉडल, नियंत्रणीय गीत पुनरावृत्ति के लिए फास्ट 8-स्टेप एक्स्ट्रा लार्ज टर्बो inference के साथ।
अपाचे लाइसेंस 4B FLUX.2 Klein छवि उत्पादन और संपादन मॉडल text-to-image, संदर्भ-छवि संपादन और रचनात्मक कार्यप्रवाह समर्थन के साथ।

MiniMaxSingaporeरिलीज 18 मार्च 2026Ctx 200Kटेक्स्ट जनरेशनउच्च गति M2.7 संस्करण मजबूत एजेंट क्षमताओं के साथ मजबूत सामान्य उद्देश्य प्रदर्शन के साथ तेजी से inference के लिए ट्यून किया गया।
सादे-अंग्रेजी आवाज दिशा के साथ रीयलटाइम वॉयस मॉडल, 100+ भाषाओं में एक आवाज की पहचान, और सब-200ms स्ट्रीमिंग time-to-first-audio।
15 भाषाओं में 271+ आवाजों के साथ उप-130ms TTFB आवाज संश्लेषण, अभिव्यक्त प्रोसोडी और निचले विलंबता आवाज एजेंटों के लिए वास्तविक समय SSE स्ट्रीमिंग।
अमीर अभिव्यंजक प्रोडोडी के साथ ब्रॉडकास्ट-गुणवत्ता वाली आवाज संश्लेषण, 15 भाषाओं में 271+ आवाजें, और वास्तविक समय में SSE प्रति-वर्ड टाइमस्टैम्प के साथ स्ट्रीमिंग।
202K संदर्भ, 128K आउटपुट, टूल कॉलिंग, संरचित आउटपुट और कैश सपोर्ट के साथ लॉन्ग-कंड Zhipu AI तर्क मॉडल।

Kimi K2.6 256K संदर्भ, मजबूत कोडिंग और पाठ, छवि और वीडियो इनपुट के साथ एक मूनशॉट मल्टीमॉडल तर्क मॉडल है।

कोडिंग, रिपॉज़िटरी वर्क, टूल यूज़ और फुल-स्टैक कार्यों में प्रमुख लाभ के साथ पोस्ट-प्रशिक्षित 0731 रिलीज़, साथ ही एक 1M संदर्भ विंडो।

MiniMax M2.7 एक सामान्य उद्देश्य तर्क चैट मॉडल है जिसमें इंटरलीव्ड सोच, फंक्शन कॉलिंग और प्रॉम्प्ट कैशिंग शामिल है।
TRELLIS.2 छवि-से-3D मॉडल जो रिज़ॉल्यूशन, बीज, जाल, बनावट और निर्यात नियंत्रण के साथ एक textured GLB परिसंपत्ति में एक संदर्भ छवि बदल जाता है।

Qwen3.5 122B-A10B 256K संदर्भ, कुशल sparse MoE inference, और पाठ, छवि, और वीडियो इनपुट के साथ एक बहुमॉडल तर्क मॉडल है।

Qwen3.5 397B-A17B भाषा, कोड, एजेंट, GUI कार्यों और छवि और वीडियो समझ के लिए एक प्रमुख बहुमॉडल तर्क मॉडल है।

Qwen3.5 35B-A3B sparse MoE रूटिंग, गहरी सोच और पाठ, छवि और वीडियो इनपुट के साथ एक कुशल मूल दृष्टि भाषा मॉडल है।

Qwen3.5 27B तेजी से प्रतिक्रियाओं, 256K संदर्भ, और पाठ, छवि और वीडियो समझ के साथ एक घनी बहुमॉडल तर्क मॉडल है।

Qwen3.6 27B एजेंटिक कोडिंग, STEM तर्क, स्थानिक दृष्टि, OCR, और पाठ, छवि और 256K संदर्भ पर वीडियो समझ में सुधार करता है।

एजेंट कोडिंग, गणित तर्क, स्थानिक समझ, OCR और पाठ, छवि और वीडियो इनपुट के लिए फास्ट Qwen3.6 दृष्टि-भाषा मॉडल।

एजेंट कोडिंग, गणित तर्क, स्थानिक समझ, OCR और पाठ, छवि और वीडियो इनपुट के लिए फास्ट Qwen3.6 दृष्टि-भाषा मॉडल।
जेम्मा 4 26B A4B 256K संदर्भ, पाठ, छवि और वीडियो इनपुट, उपकरण और संरचित आउटपुट के साथ एक Google ओपन मल्टीमॉडल मॉडल है।
Qwen3.5 9B 256K संदर्भ, छवि और वीडियो इनपुट, फ़ंक्शन टूल और संरचित आउटपुट के साथ एक कॉम्पैक्ट मल्टीमॉडल तर्क मॉडल है।

Qwen3.5 4B 256K संदर्भ, छवि और वीडियो इनपुट, फ़ंक्शन टूल और संरचित आउटपुट के साथ एक कम लागत वाली बहुमॉडल तर्क मॉडल है।
Qwen3.6 35B A3B एक 256-expert mixture-of-experts तर्क मॉडल है जिसमें 128K संदर्भ, फंक्शन टूल और सख्त संरचित JSON आउटपुट है।

कोडिंग, तर्क, लंबे पाठ लेखन और सामान्य चैट के लिए मुफ्त हल्के GLM-4.7 पाठ मॉडल।

तर्क, कोडिंग, लॉन्ग-फॉर्म चैट और सामान्य भाषा कार्यों के लिए मुफ्त लाइटवेट GLM-4.5 टेक्स्ट मॉडल।

मूल फंक्शन कॉलिंग के साथ छवि, वीडियो, फ़ाइल और टेक्स्ट समझ के लिए मुफ्त मल्टीमॉडल GLM-4.6V मॉडल।

छवि पीढ़ी और संपादन मॉडल बनाने और पाठ या छवि आदानों से छवियों को संशोधित करने के साथ, inpainting, आभासी कोशिश पर, और शैली नियंत्रण।

वीडियो जनरेशन मॉडल ने पाठ से 2-मिनट मल्टी-शॉट वीडियो का उत्पादन किया और बेहतर गुणवत्ता और स्थिरता के साथ वैकल्पिक छवि संकेत।

बहु भाषा समर्थन और उत्पादन कार्यभार के लिए उन्नत अनुकूलन सेटिंग्स के साथ Nova-3 मॉडल का उपयोग करते हुए भाषण से पाठ ट्रांसक्रिप्शन।

जोड़ी DeepSeek R1 chain-of-thought

ओपन-सोर्स मिक्सचर-ऑफ-एक्स्पर्ट्स एलएलएम ने लंबे समय तक प्रॉम्प्ट में उच्च दक्षता तर्क, कोडिंग और सामान्य भाषा कार्यों के लिए ट्यून किया।

लाइटवेट MoE मॉडल 284B कुल / 13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ, कम विलंबता, लागत प्रभावी उच्च-concurrency उपयोग के लिए ट्यून किया गया।

लाइटवेट MoE मॉडल 284B कुल / 13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ, कम विलंबता, लागत प्रभावी उच्च-concurrency उपयोग के लिए ट्यून किया गया।

लाइटवेट MoE मॉडल 284B कुल / 13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ, कम विलंबता, लागत प्रभावी उच्च-concurrency उपयोग के लिए ट्यून किया गया।

फ्लैगशिप MoE LLM 1.6T कुल / 49B सक्रिय मापदंडों और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ के साथ।

फ्लैगशिप MoE LLM 1.6T कुल / 49B सक्रिय मापदंडों और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ के साथ।

फ्लैगशिप MoE LLM 1.6T कुल / 49B सक्रिय मापदंडों और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ के साथ।

त्वरित LLM-शैली एक प्राकृतिक भाषा के सवाल का जवाब, ताजा Exa वेब खोज परिणाम इनलाइन उद्धरण और स्रोत लिंक के साथ जमीन पर आधारित है।

पृष्ठों को खोजने के लिए वेब सर्च इंजन, एआई एजेंटों के लिए खुले वेब पर समान पृष्ठों, क्रॉलिंग और समर्पित कोड खोज को पुनर्प्राप्त करना।

लो-लेटेंसी text-to-speech सिंगल- और मल्टी-स्पीकर वॉयस और कंट्रोलेबल स्टाइल, एक्सेंट और एक्स्प्रेसिव टोन के साथ उत्पादन ऐप के लिए।

पॉडकास्ट, ऑडियोबुक और ग्राहक समर्थन के लिए उच्च गुणवत्ता वाले टीटीएस पूर्वावलोकन, जिसमें 23+ भाषाओं में एक्सप्रेसिव मल्टी-स्पीकर आवाज शामिल है।

सटीक शैली, स्वर, गति और वितरण के लिए नए ऑडियो टैग के साथ अत्यधिक नियंत्रणीय टीटीएस कथा, सहायकों और आवाज ऐप में।

128K संदर्भ, 140+ भाषाओं के साथ ओपन-सोर्स दृष्टि-भाषा मॉडल, बेहतर math/reasoning, संरचित आउटपुट और फंक्शन कॉलिंग।

डीप-लर्निंग डिटेक्टर जो एआई बनाम मानव, पूरी तरह से मानव, एआई, या मिश्रित रूप में वर्गीकृत सामग्री द्वारा उत्पन्न होने वाले पाठ के कुछ हिस्सों को ध्वजांकित करता है।

वीडियो मॉडल टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, रेफरेंस-टू-वीडियो और वीडियो एडिट मोड को उच्च-fidelity, मोशन-स्मूथ आउटपुट के साथ पेश करता है।

Open-source text-to-image मॉडल ऑन a multimodal mixture-of-Experts आर्किटेक्चर with photorealistic details and strong multilingual text rendering.
मूल 720p आउटपुट (1080p) के साथ 8.3B-parameter वीडियो मॉडल, मजबूत गति सुसंगतता, और 10s तक द्विभाषी शीघ्र समझ।

जनस प्रो 7 बी मॉडल पर ऑटोरिग्रेटिव फ्रेमवर्क जो एक आर्किटेक्चर में बहुमॉडल समझ और छवि पीढ़ी को एकीकृत करता है।

टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, रेफरेंस-टू-वीडियो, संपादन, मूल ध्वनि और मल्टी-सीन संक्रमण के साथ मानक या प्रो मोड में वीडियो मॉडल।

Kling 3.0 मॉडल जो एक संदर्भ छवि से एक चरित्र पर एक संदर्भ वीडियो से गति को स्थानांतरित करता है, मानक 720p और प्रो 1080p स्तरों के साथ।

Iterative AI खोज जो प्रारंभिक परिणाम अपर्याप्त होने पर क्वेरी रखता है, मानक मोड की तुलना में अधिक व्यापक उत्तर लौटाता है।

विस्तृत अवलोकन और उत्तरों के साथ AI-powered वेब खोज, डीप सर्च से तेज़। OpenAI SimpleQA बेंचमार्क पर #1 रैंक।

लागत प्रभावी भाषा मॉडल प्रतिस्पर्धी विलंबता पर सामान्य उत्पादन कार्यभार के लिए मजबूत तर्क और बहुमॉडल प्रदर्शन प्रदान करता है।

मजबूत तर्क, कोडिंग और STEM प्रदर्शन के साथ एंटरप्राइज़-ग्रेड मॉडल, हाइब्रिड, ऑन-प्रेम और इन-वीपीसी तैनाती का समर्थन करता है।

छवि विश्लेषण, प्रोग्रामिंग, गणित और बहुभाषी कार्यों के लिए 128K संदर्भ के साथ 24B-parameter बहुमॉडल मॉडल, कुशल स्थानीय inference के लिए ट्यून किया गया।

हाइब्रिड मॉडल ने निर्देश, रीजनिंग (मैजिस्ट्रल) और देवस्ट्रल परिवारों को एकीकृत किया: 40% कम पूरा होने का समय और 3x थ्रूपुट बनाम स्मॉल 3.

ओपन सोर्स 32B MoE फाउंडेशन मॉडल जो सटीक दोहरी टावर होंठ-सिंक के साथ एक अनुमान चरण में सिंक्रनाइज़ वीडियो और ऑडियो उत्पन्न करता है।

पाठ, छवियों और एक 300K संदर्भ (~30 मिनट वीडियो तक) पर वीडियो के लिए कम लागत वाली मल्टीमॉडल फाउंडेशन मॉडल, गति और वहन के लिए ट्यून किया गया।

एक 1M संदर्भ (लंबी डॉक्स और ~ 90 मिनट क्लिप) पर पाठ, छवियों, दस्तावेजों और वीडियो के लिए फास्ट, लागत प्रभावी मल्टीमॉडल तर्क मॉडल।

Text-only फाउंडेशन मॉडल 128K संदर्भ पर अल्ट्रा-कम विलंबता और लागत के लिए ट्यून किया गया है। संक्षेपण, अनुवाद और 44% कैश छूट के साथ चैट करने के लिए मजबूत।

परिवार में सबसे सक्षम मॉडल। Multimodal text/image

मल्टीमोडल फाउंडेशन मॉडल संतुलन सटीकता, गति और पाठ, छवियों और 300K संदर्भ पर वीडियो (~30 मिनट वीडियो तक) के लिए लागत।

Whisper-1 speech-to-text ट्रांसक्रिप्शन बहुभाषी निगरानी ऑडियो पर प्रशिक्षित किया गया है, जिसमें प्रति फ़ाइल 25 MB अपलोड की सीमा है।

क्लाउड ओपस 4.6 तर्क द्वारा संचालित संस्थागत ग्रेड अनुसंधान, अधिकतम गहराई, बढ़ाया उपकरण पहुंच और व्यापक स्रोत कवरेज के साथ।

बहु-चरण पुनर्प्राप्ति, संश्लेषण और तर्क, स्वायत्त रूप से खोज, पढ़ने और जटिल विषयों में स्रोतों का मूल्यांकन करने के लिए अनुसंधान मॉडल।

सोनार प्रो एक एजेंटिक शोधकर्ता के रूप में: चेन वेब खोज, पूर्ण पृष्ठ प्राप्त करते हैं और लाइव तर्क को स्ट्रीम करते हैं, जटिल प्रश्नों के लिए रणनीति को अनुकूलित करते हैं।

डोमेन, भाषा, दिनांक और अधिक द्वारा फ़िल्टरिंग के साथ रीयल-टाइम वेब खोज। रिटर्न्स खोज परिणाम, नहीं LLM उत्तर; कोई फ़ाइल अपलोड नहीं।

रियल टाइम वेब-कनेक्टेड खोज सटीक उद्धरण और अनुकूलन स्रोतों के साथ up-to-date AI खोज एकीकरण उत्पादन ऐप में।

डबल प्रशस्ति पत्रों और एक बड़ी संदर्भ विंडो के साथ सर्च-ग्राउंड मॉडल, जटिल प्रश्नों के लिए गहराई से, nuanced उत्तर की आवश्यकता होती है।

अनसेंसर्ड ओपन सोर्स R1-1776 पर वेब सर्च के साथ रीजनिंग मॉडल, सिम्पलक्यूए बेंचमार्क पर अग्रणी सर्च इंजन और LLM का प्रदर्शन।

टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और संक्रमण मोड में उच्च विस्तार, द्रव गति और lifelike एनिमेशन के साथ सिनेमाई वीडियो पीढ़ी।

पाठ या 1-2 फ्रेम छवि से वीडियो उत्पन्न करता है 1080p, एकाधिक पहलू अनुपात, 5-10s अवधि, वैकल्पिक सिंक्रनाइज़ ऑडियो के साथ।

क्लास-लीडिंग कॉम्प्लेक्स Chinese/English टेक्स्ट रेंडरिंग, यथार्थवादी बनावट और बहु-छवि फ्यूजन के साथ एकीकृत छवि पीढ़ी और संपादन मॉडल।

Qwen छवि पीढ़ी और आधार और प्रो वेरिएंट, बहुभाषी टाइपोग्राफी, बहु-छवि संदर्भ और नियंत्रणीय 1K या 2K आउटपुट के साथ संपादन।

हाइब्रिड रैखिक-attention प्लस sparse MoE, 1M संदर्भ, और तेजी से multimodal text/image /वीडियो inference के साथ दृष्टि-भाषा मॉडल।

हाइब्रिड रैखिक-attention प्लस sparse MoE, 1M संदर्भ, और तेजी से multimodal text/image /वीडियो inference के साथ दृष्टि-भाषा मॉडल।

Alibaba CloudSingaporeरिलीज 30 मार्च 2026Ctx 256Kटेक्स्ट जनरेशनलागत प्रभावी ओमनी मोडल मॉडल हैंडलिंग पाठ, छवि, ऑडियो और वीडियो, ऑडियो के 3 घंटे और 90+ भाषाओं में 1 घंटे वीडियो के साथ।

Alibaba CloudSingaporeरिलीज 30 मार्च 2026Ctx 256Kटेक्स्ट जनरेशनपाठ, छवि, ऑडियो और वीडियो के लिए फ्लैगशिप ओमनी मोडल मॉडल। 3h ऑडियो, 1h वीडियो, 90+ इनपुट और 30+ आउटपुट भाषाओं, 55 वॉयस टेम्ब्रे।

1M संदर्भ पर पाठ, छवि और वीडियो में कुशल गहरी सोच और दृश्य समझ के लिए हाइब्रिड आर्किटेक्चर के साथ मल्टीमॉडल मॉडल।

1M संदर्भ पर पाठ, छवि और वीडियो में कुशल गहरी सोच और दृश्य समझ के लिए हाइब्रिड आर्किटेक्चर के साथ मल्टीमॉडल मॉडल।

Alibaba CloudSingaporeरिलीज 20 अप्रैल 2026Ctx 256Kटेक्स्ट जनरेशन3.6 श्रृंखला (पाठ-केवल): में सबसे बड़ा पूर्वावलोकन संस्करण बेहतर कोडिंग एजेंट निष्पादन, मजबूत फ्रंट-एंड कौशल और व्यापक लंबी पूंछ ज्ञान।

3.5 से अधिक प्रमुख उन्नयन के साथ दृष्टि-भाषा मॉडल: एजेंटिक और फ्रंट-एंड कोडिंग, मल्टीमोडल मान्यता, OCR, और ऑब्जेक्ट लोकलाइजेशन।

3.5 से अधिक प्रमुख उन्नयन के साथ दृष्टि-भाषा मॉडल: एजेंटिक और फ्रंट-एंड कोडिंग, मल्टीमोडल मान्यता, OCR, और ऑब्जेक्ट लोकलाइजेशन।

तर्क, निर्देश निम्नलिखित और बहुभाषी समर्थन में प्रमुख सुधारों के साथ 256K-context फ्लैगशिप, साथ ही उच्च coding/math सटीकता।

Alibaba CloudSingaporeरिलीज 5 सित॰ 2025Ctx 256Kटेक्स्ट जनरेशनचीनी-अंग्रेजी समझ, जटिल निर्देश, बहुभाषी क्षमता और उपकरण उपयोग में 2.5 श्रृंखला पर प्रमुख लाभ के साथ पूर्वावलोकन रिलीज।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 256Kटेक्स्ट जनरेशनअनुकूली उपकरण उपयोग (अनुसंधान, स्मृति, कोड अनुवादक) और जटिल कार्यों पर उच्च सटीकता के लिए परीक्षण समय स्केलिंग के साथ रीजनिंग मॉडल।

Semantic दस्तावेज़ reranker। प्रासंगिकता द्वारा प्रति क्वेरी 500 उम्मीदवारों को क्रमबद्ध करें, 100+ भाषाओं का समर्थन करता है, और एक कस्टम सॉर्टिंग निर्देश स्वीकार करता है।

मजबूत फ्रंट-एंड परिणाम और एआई कोडिंग टूल और एजेंटों के लिए बहुभाषी प्रोग्रामिंग समर्थन के साथ कोडिंग-ट्यून 256K-context मॉडल।

उच्च आवृत्ति उद्यम कार्यभार के लिए संतुलित सामान्य उद्देश्य मॉडल: सूचना प्रसंस्करण, सामग्री, खोज और डेटा विश्लेषण।

256K संदर्भ, चार तर्क प्रयास मोड और image/video

जटिल तर्क, बहुमॉडल समझ, संरचित पीढ़ी और उपकरण-वर्धित निष्पादन के लिए 256K संदर्भ के साथ फ्लैगशिप सामान्य मॉडल।

स्पीड-ऑप्टिमाइज़्ड 2.0 वीडियो वेरिएंट फॉर सिनेमाटिक क्लिप्स विथ मूल ऑडियो सिंक, कैमरा कंट्रोल, और प्रति रेंडर कम लागत पर स्थिर गति।

पाठ, छवि, ऑडियो या वीडियो इनपुट से सिनेमाई आउटपुट के लिए मल्टीमॉडल वीडियो मॉडल, स्थिर गति और सुसंगत पात्रों के साथ।

एकीकृत बहुमॉडल छवि मॉडल जो प्रस्तुत करने से पहले संकेत के माध्यम से कारण बनता है, उच्च संकल्प और सुसंगत संपादन और ब्रांड दृश्यों का उत्पादन करता है।

text-to-image, 1K, 1.5K और 2K आउटपुट प्लस स्टैंडर्ड या फास्ट प्रॉम्प्ट ऑप्टिमाइज़ेशन के साथ संपादन और मल्टी-रिफरेंस फ्यूजन के लिए प्रीमियम सीडरेम इमेज मॉडल।

लॉन्ग-फॉर्म के लिए ओपन-सोर्स वॉयस मॉडल, बहु-स्पीकर पॉडकास्ट संवाद पैरालैंगिक नियंत्रण (वध, sighs) और शून्य-शॉट वॉयस क्लोनिंग के साथ।

पाठ संकेत से 3 मिनट तक ऑडियो उत्पन्न करता है, text-to-audio और audio-to-audio

Up to-3-minute

WAN 2.2 पर स्थिर वीडियो इन्फिनिटी 2.0 प्रो: लगातार चरित्र आईडी रखने के दौरान सैद्धांतिक रूप से अनंत-लंबाई वीडियो में अभी भी छवियों का विस्तार करता है।

बहु शोध अनुसंधान सहायक जो एक विषय की पड़ताल करता है, सूत्रों का विश्लेषण करता है और उद्धरण के साथ विस्तृत शोध रिपोर्ट उत्पन्न करता है।

वेब खोज क्रॉल, एक्सट्रैक्ट और यूआरएल मैपिंग के साथ तेजी से, संरचित पुनर्प्राप्ति के लिए पृष्ठों और डोमेन डाउनस्ट्रीम पाइपलाइनों के लिए।

चयन करने योग्य आउटपुट आयाम (64-2048) के साथ बहुभाषी टेक्स्ट एम्बेडिंग। प्रति इनपुट 8,192 टोकन तक।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 1Kएम्बेडिंगस्पीड-ऑप्टिमाइज्ड मल्टीमॉडल एम्बेडिंग - विजन-प्लस के समान आकार, 3 × सस्ता image/video tokens।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 1Kएम्बेडिंगमल्टीमॉडल एम्बेडिंग पाठ, छवि और वीडियो इनपुट के लिए स्वतंत्र वेक्टर का उत्पादन करते हैं।

सिनेमाई के लिए मल्टीमॉडल वीडियो जनरेशन मॉडल, देशी ऑडियो विजुअल सिंक (लिप-सिंक, संवाद, संगीत, एसएफएक्स) के साथ बहु-shot कहानियां।

मल्टीमोडल वीडियो मॉडल T2V, I2V, वीडियो संपादन और reference-to-video का समर्थन करता है, जिसमें टेक्स्ट, इमेज या वीडियो इनपुट से उच्च-fidelity आउटपुट होता है।

छवि उत्पादन और संपादन साथी मॉडल: text-to-image, बाउंडिंग बॉक्स संपादन, और सुसंगत छवि सेट, प्रो पर 4K आउटपुट तक।
बहुभाषी एएसआर, अनुवाद, वीएडी, टाइमस्टैम्प, उपशीर्षक, हॉटवर्ड्स और डिकोडर नियंत्रण के साथ नियंत्रित कानाफूसी बड़े v3 टर्बो ट्रांसक्रिप्शन।

स्वायत्त एआई एजेंट जो सबटास्क, कॉल टूल और एपीआई में एक उच्च स्तरीय संकेत बदलता है, और मैनुअल ऑर्केस्ट्रेशन के बिना end-to-end परिणाम वितरित करता है।

टेक्स्ट-टू-वीडियो, image-to-video, और reference-to-video जनरेशन लगातार अक्षरों के लिए सात संदर्भ छवियों तक, 1080p पर 15 सेकंड तक।

एजेंटिक वर्कफ़्लो, जटिल सॉफ्टवेयर इंजीनियरिंग, और लंबे समय तक काम के लिए शीर्ष स्तरीय मॉडल, 1000+ टूल कॉल पर 1M संदर्भ पर काम को बनाए रखने।

1M संदर्भ पर मूल दृश्य और ऑडियो समझ के साथ बहुमॉडल, जिसका कारण है और एजेंटिक वर्कफ़्लो में modalities में कार्य करने के लिए बनाया गया है।

टेक्स्ट, इमेज और reference-to-video को एक मॉडल में रखें। सिनेमाई गति, 9 संदर्भों तक चरित्र स्थिरता, और सिंक्रनाइज़ देशी ऑडियो।

480p और 720p पर देशी ऑडियो, कैमरा नियंत्रण और छवि या वीडियो इनपुट के साथ लघु सिनेमाई क्लिप के लिए सबसे तेज़, सबसे किफायती Seedance 720 स्तर।

छवि और वीडियो इनपुट, टूल कॉलिंग, समायोज्य तर्क प्रयास और 256K संदर्भ के साथ स्टेपफन मल्टीमॉडल रीजनिंग मॉडल।

एजेंटों, कोडिंग, टूल कॉलिंग और लंबे संदर्भ विश्लेषण के लिए स्टेपफन टेक्स्ट रीजनिंग मॉडल।

StepFunInternationalरिलीज 2 अप्रैल 2026Ctx 256Kटेक्स्ट जनरेशनएजेंट-अनुकूलित चरण 3.5 कम और उच्च तर्क प्रयास मोड के साथ फ्लैश संस्करण।

टेक्स्ट आउटपुट और पैरालिंग्विस्टिक समझ के साथ StepFun ऑडियो और टेक्स्ट वार्तालाप मॉडल।

text-to-image और एकल-छवि संपादन के लिए StepFun छवि निर्माण और छवि संपादन मॉडल।

प्रासंगिक StepFun प्राकृतिक भाषा की आवाज दिशा और अभिव्यंजक वितरण के साथ text-to-speech मॉडल।

StepFun आधिकारिक आवाज़, कस्टम क्लोन आवाज़ों और वॉयस टैग नियंत्रण के साथ text-to-speech मॉडल।

चीनी और अंग्रेजी ऑडियो ट्रांसक्रिप्शन के लिए StepFun स्ट्रीमिंग स्पीच रिकग्निशन मॉडल।

इंजीनियरिंग-ग्रेड कोड डिलीवरी, लॉन्ग-होरिजॉन स्वायत्तता और 256K मल्टीमोडल समझ के साथ अगली पीढ़ी के कोडिंग और एजेंट मॉडल।

1,000 से अधिक आवाज़ों, 16 भाषाओं, 20 चीनी बोलियों, प्राकृतिक भाषा वितरण दिशा, और इनलाइन भावना टैग के साथ टियर्ड भाषण संश्लेषण।

मूल स्टीरियो ऑडियो के साथ 2K तक 4 से 15 सेकंड की क्लिप उत्पन्न करता है, एक अनुरोध में पाठ, छवि, वीडियो और ऑडियो संदर्भों का पालन करता है।

OpenAI की फ्लैगशिप इमेज मॉडल जिसमें मजबूत प्रॉम्प्ट फिडेलिटी, कुरकुरा टेक्स्ट रेंडरिंग और 16 संदर्भ छवियों तक निर्देश-आधारित संपादन शामिल है।

Kuaishou के Kling 3.0 वीडियो जनरेटर text-to-video, पहले और आखिरी फ्रेम image-to-video, मूल ऑडियो और 720p, 1080p, या 4K आउटपुट के साथ।

अलीबाबा का वान 2.5 वीडियो मॉडल text-to-video और image-to-video, मूल ऑडियो, वैकल्पिक कस्टम ऑडियो ट्रैक्स और 480p से 1080p आउटपुट के साथ।

मानक और फ्लैश स्तरों, पहले और आखिरी फ्रेम interpolation, और कम लागत पर 1080p आउटपुट के लिए 480p के साथ अलीबाबा का Wan 2.2 वीडियो परिवार।

अलीबाबा की वैन 2.1 वीडियो मॉडल टर्बो और साथ ही साथ text-to-video, image-to-video, और 480p या 720p पर पहले और आखिरी फ्रेम क्लिप के लिए टियर्स के साथ।

अलीबाबा के वान 2.5 छवि मॉडल के साथ text-to-image और लगभग 1.7 मेगापिक्सल पर 3 छवियों तक मल्टी-रिफरेंस संपादन।

अलीबाबा का वान 2.2 text-to-image मॉडल प्लस और फ्लैश स्तरों के साथ और प्रति-छवि मूल्य निर्धारण में 1440x1440 तक।

अलीबाबा की वान 2.1 text-to-image टर्बो और प्लस स्तरों के साथ मॉडल और प्रति-छवि मूल्य निर्धारण में 1440x1440 तक आउटपुट।

30 सेकंड तक सुसंगत क्लिप के लिए लंबे समय तक वीडियो मॉडल, 50 संदर्भ छवियों, वीडियो और ऑडियो क्लिप, मूल ऑडियो, संपादन और विस्तार तक।
140 / 155 मॉडल