
टेक्स्ट-टू-वीडियो और image-to-video सिंक्रनाइज़ किए गए मूल ऑडियो के साथ, 3 से 15 सेकंड के लिए 720p या 1080p पर, पहलू अनुपात और शीघ्र नियंत्रण के साथ।
केवल उसी के लिए भुगतान करें जिसका आप उपयोग करते हैं। कोई सदस्यता लॉक-इन नहीं।
मूल्य निर्धारण सूची
EmpirioLabs मूल्य निर्धारण मॉडल और इकाई के अनुसार भिन्न होता है: टोकन, चित्र, ऑडियो या वीडियो के सेकंड, संदेश, 3 डी संपत्ति और खोज अनुरोध। इंटरैक्टिव मूल्य निर्धारण तालिका वर्तमान कैटलॉग को लोड करती है, जबकि ये प्रतिनिधि दरें क्लाइंट जावास्क्रिप्ट के बिना पठनीय रहती हैं।
छवि इनपुट प्रति छवि $0.05। वीडियो आउटपुट 480p के लिए $0.096 प्रति सेकंड और 720p के लिए $0.168 प्रति सेकंड से शुरू होता है।
लागत प्रभावी लंबे संदर्भ वाले मल्टीमॉडल एपीआई के लिए इनपुट $0.40 प्रति 1M प्रॉम्प्ट टोकन से शुरू होता है।
मल्टीमॉडल रीजनिंग, कोडिंग और एजेंट वर्कलोड के लिए इनपुट $0.30 प्रति 1M प्रॉम्प्ट टोकन से शुरू होता है।
इमेज-टू-3डी पीढ़ी की कीमत प्रति जेनरेट की गई 3डी संपत्ति के लिए है, जिसमें प्रारूप और रिज़ॉल्यूशन नियंत्रण के लिए दस्तावेज़ हैं।
मॉडल API दरें USD में दिखाई और बिल की जाती हैं। पात्र होने पर checkout स्थानीय भुगतान विधियां दिखा सकता है।

टेक्स्ट-टू-वीडियो और image-to-video सिंक्रनाइज़ किए गए मूल ऑडियो के साथ, 3 से 15 सेकंड के लिए 720p या 1080p पर, पहलू अनुपात और शीघ्र नियंत्रण के साथ।

एक 1M टोकन संदर्भ, 128K आउटपुट, समायोज्य तर्क प्रयास, मूल वेब खोज और टूल कॉल के साथ रीजनिंग और कोडिंग मॉडल।
एक 1M टोकन संदर्भ, 128K आउटपुट, समायोज्य तर्क प्रयास, मूल वेब खोज और टूल कॉल के साथ रीजनिंग और कोडिंग मॉडल।

Kimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

Kimi K2.7 कोड 256K संदर्भ, हमेशा तर्क और पाठ, छवि और वीडियो इनपुट के साथ Moonshot के ट्रिलियन पैरामीटर एजेंटिक कोडिंग मॉडल है।

Kimi K2.7 कोड 256K संदर्भ, हमेशा तर्क और पाठ, छवि और वीडियो इनपुट के साथ Moonshot के ट्रिलियन पैरामीटर एजेंटिक कोडिंग मॉडल है।

1M टोकन संदर्भ, छवि और वीडियो समझ, उद्धृत स्रोतों के साथ अंतर्निहित वेब खोज और टूल कॉलिंग के साथ मेटा फ्रंटियर रीजनिंग मॉडल।

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

पाठ, छवि, वीडियो, कोडिंग, टूल उपयोग, GUI समझ और 1M-context वर्कफ़्लो के लिए लागत प्रभावी Qwen3.7 दृष्टि-भाषा मॉडल।

पाठ, छवि, वीडियो, कोडिंग, टूल उपयोग, GUI समझ और 1M-context वर्कफ़्लो के लिए लागत प्रभावी Qwen3.7 दृष्टि-भाषा मॉडल।

Moonshot AIInternationalरिलीज 16 जून 2026Ctx 256Kटेक्स्ट जनरेशनKimi K2.7 कोड हाईस्पीड मूनशॉट के एजेंटिक कोडिंग मॉडल का तेज़-सर्विंग टियर है, जिसमें 256K संदर्भ, हमेशा तर्क और छवि और वीडियो इनपुट शामिल हैं।

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

मिनिमम एम 3 टेक्स्ट, इमेज और वीडियो इनपुट के साथ कोडिंग, एजेंट और लंबे-context विश्लेषण के लिए एक बहुमॉडल तर्क मॉडल है।

मिनिमम एम 3 टेक्स्ट, इमेज और वीडियो इनपुट के साथ कोडिंग, एजेंट और लंबे-context विश्लेषण के लिए एक बहुमॉडल तर्क मॉडल है।

Qwen3.7 मैक्स कोडिंग, उत्पादकता, लंबे समय तक चलने वाले एजेंटों, गहरी सोच, उपकरण और 1M-token संदर्भ के लिए एक प्रमुख पाठ मॉडल है।

Qwen3.7 मैक्स कोडिंग, उत्पादकता, लंबे समय तक चलने वाले एजेंटों, गहरी सोच, उपकरण और 1M-token संदर्भ के लिए एक प्रमुख पाठ मॉडल है।
text-to-song और lyric-guided ऑडियो के लिए ओपन सोर्स म्यूजिक जेनरेशन मॉडल, नियंत्रणीय गीत पुनरावृत्ति के लिए फास्ट 8-स्टेप एक्स्ट्रा लार्ज टर्बो inference के साथ।
अपाचे लाइसेंस 4B FLUX.2 Klein छवि उत्पादन और संपादन मॉडल text-to-image, संदर्भ-छवि संपादन और रचनात्मक कार्यप्रवाह समर्थन के साथ।

MiniMaxSingaporeरिलीज 18 मार्च 2026Ctx 200Kटेक्स्ट जनरेशनउच्च गति M2.7 संस्करण मजबूत एजेंट क्षमताओं के साथ मजबूत सामान्य उद्देश्य प्रदर्शन के साथ तेजी से inference के लिए ट्यून किया गया।
सादे-अंग्रेजी आवाज दिशा के साथ रीयलटाइम वॉयस मॉडल, 100+ भाषाओं में एक आवाज की पहचान, और सब-200ms स्ट्रीमिंग time-to-first-audio।
15 भाषाओं में 271+ आवाजों के साथ उप-130ms TTFB आवाज संश्लेषण, अभिव्यक्त प्रोसोडी और निचले विलंबता आवाज एजेंटों के लिए वास्तविक समय SSE स्ट्रीमिंग।
अमीर अभिव्यंजक प्रोडोडी के साथ ब्रॉडकास्ट-गुणवत्ता वाली आवाज संश्लेषण, 15 भाषाओं में 271+ आवाजें, और वास्तविक समय में SSE प्रति-वर्ड टाइमस्टैम्प के साथ स्ट्रीमिंग।
202K संदर्भ, 128K आउटपुट, टूल कॉलिंग, संरचित आउटपुट और कैश सपोर्ट के साथ लॉन्ग-कंड Zhipu AI तर्क मॉडल।

Kimi K2.6 256K संदर्भ, मजबूत कोडिंग और पाठ, छवि और वीडियो इनपुट के साथ एक मूनशॉट मल्टीमॉडल तर्क मॉडल है।

MiniMax M2.7 एक सामान्य उद्देश्य तर्क चैट मॉडल है जिसमें इंटरलीव्ड सोच, फंक्शन कॉलिंग और प्रॉम्प्ट कैशिंग शामिल है।
TRELLIS.2 छवि-से-3D मॉडल जो रिज़ॉल्यूशन, बीज, जाल, बनावट और निर्यात नियंत्रण के साथ एक textured GLB परिसंपत्ति में एक संदर्भ छवि बदल जाता है।

Qwen3.5 122B-A10B 256K संदर्भ, कुशल sparse MoE inference, और पाठ, छवि, और वीडियो इनपुट के साथ एक बहुमॉडल तर्क मॉडल है।

Qwen3.5 397B-A17B भाषा, कोड, एजेंट, GUI कार्यों और छवि और वीडियो समझ के लिए एक प्रमुख बहुमॉडल तर्क मॉडल है।

Qwen3.5 35B-A3B sparse MoE रूटिंग, गहरी सोच और पाठ, छवि और वीडियो इनपुट के साथ एक कुशल मूल दृष्टि भाषा मॉडल है।

Qwen3.5 27B तेजी से प्रतिक्रियाओं, 256K संदर्भ, और पाठ, छवि और वीडियो समझ के साथ एक घनी बहुमॉडल तर्क मॉडल है।

Qwen3.6 27B एजेंटिक कोडिंग, STEM तर्क, स्थानिक दृष्टि, OCR, और पाठ, छवि और 256K संदर्भ पर वीडियो समझ में सुधार करता है।

एजेंट कोडिंग, गणित तर्क, स्थानिक समझ, OCR और पाठ, छवि और वीडियो इनपुट के लिए फास्ट Qwen3.6 दृष्टि-भाषा मॉडल।

एजेंट कोडिंग, गणित तर्क, स्थानिक समझ, OCR और पाठ, छवि और वीडियो इनपुट के लिए फास्ट Qwen3.6 दृष्टि-भाषा मॉडल।
जेम्मा 4 26B A4B 256K संदर्भ, पाठ, छवि और वीडियो इनपुट, उपकरण और संरचित आउटपुट के साथ एक Google ओपन मल्टीमॉडल मॉडल है।
Qwen3.5 9B 256K संदर्भ, छवि और वीडियो इनपुट, फ़ंक्शन टूल और संरचित आउटपुट के साथ एक कॉम्पैक्ट मल्टीमॉडल तर्क मॉडल है।

Qwen3.5 4B 256K संदर्भ, छवि और वीडियो इनपुट, फ़ंक्शन टूल और संरचित आउटपुट के साथ एक कम लागत वाली बहुमॉडल तर्क मॉडल है।
Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

कोडिंग, तर्क, लंबे पाठ लेखन और सामान्य चैट के लिए मुफ्त हल्के GLM-4.7 पाठ मॉडल।

तर्क, कोडिंग, लॉन्ग-फॉर्म चैट और सामान्य भाषा कार्यों के लिए मुफ्त लाइटवेट GLM-4.5 टेक्स्ट मॉडल।

मूल फंक्शन कॉलिंग के साथ छवि, वीडियो, फ़ाइल और टेक्स्ट समझ के लिए मुफ्त मल्टीमॉडल GLM-4.6V मॉडल।

छवि पीढ़ी और संपादन मॉडल बनाने और पाठ या छवि आदानों से छवियों को संशोधित करने के साथ, inpainting, आभासी कोशिश पर, और शैली नियंत्रण।

वीडियो जनरेशन मॉडल ने पाठ से 2-मिनट मल्टी-शॉट वीडियो का उत्पादन किया और बेहतर गुणवत्ता और स्थिरता के साथ वैकल्पिक छवि संकेत।

बहु भाषा समर्थन और उत्पादन कार्यभार के लिए उन्नत अनुकूलन सेटिंग्स के साथ Nova-3 मॉडल का उपयोग करते हुए भाषण से पाठ ट्रांसक्रिप्शन।

जोड़ी DeepSeek R1 chain-of-thought

ओपन-सोर्स एलएलएम ने लीन 4 में औपचारिक प्रेक्षण में विशेषज्ञता प्राप्त की, जो एक पुनरावर्ती प्रेक्षण पाइपलाइन पर बनाया गया।

ओपन-सोर्स मिक्सचर-ऑफ-एक्स्पर्ट्स एलएलएम ने लंबे समय तक प्रॉम्प्ट में उच्च दक्षता तर्क, कोडिंग और सामान्य भाषा कार्यों के लिए ट्यून किया।

लाइटवेट MoE मॉडल 284B कुल / 13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ, कम विलंबता, लागत प्रभावी उच्च-concurrency उपयोग के लिए ट्यून किया गया।

लाइटवेट MoE मॉडल 284B कुल / 13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ, कम विलंबता, लागत प्रभावी उच्च-concurrency उपयोग के लिए ट्यून किया गया।

लाइटवेट MoE मॉडल 284B कुल / 13B सक्रिय मापदंडों और मूल 1M संदर्भ के साथ, कम विलंबता, लागत प्रभावी उच्च-concurrency उपयोग के लिए ट्यून किया गया।

फ्लैगशिप MoE LLM 1.6T कुल / 49B सक्रिय मापदंडों और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ के साथ।

फ्लैगशिप MoE LLM 1.6T कुल / 49B सक्रिय मापदंडों और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ के साथ।

फ्लैगशिप MoE LLM 1.6T कुल / 49B सक्रिय मापदंडों और उन्नत गणित, तार्किक अनुमान और विशेष कोडिंग के लिए मूल 1M संदर्भ के साथ।

त्वरित LLM-शैली एक प्राकृतिक भाषा के सवाल का जवाब, ताजा Exa वेब खोज परिणाम इनलाइन उद्धरण और स्रोत लिंक के साथ जमीन पर आधारित है।

पृष्ठों को खोजने के लिए वेब सर्च इंजन, एआई एजेंटों के लिए खुले वेब पर समान पृष्ठों, क्रॉलिंग और समर्पित कोड खोज को पुनर्प्राप्त करना।

लो-लेटेंसी text-to-speech सिंगल- और मल्टी-स्पीकर वॉयस और कंट्रोलेबल स्टाइल, एक्सेंट और एक्स्प्रेसिव टोन के साथ उत्पादन ऐप के लिए।

पॉडकास्ट, ऑडियोबुक और ग्राहक समर्थन के लिए उच्च गुणवत्ता वाले टीटीएस पूर्वावलोकन, जिसमें 23+ भाषाओं में एक्सप्रेसिव मल्टी-स्पीकर आवाज शामिल है।

सटीक शैली, स्वर, गति और वितरण के लिए नए ऑडियो टैग के साथ अत्यधिक नियंत्रणीय टीटीएस कथा, सहायकों और आवाज ऐप में।

128K संदर्भ, 140+ भाषाओं के साथ ओपन-सोर्स दृष्टि-भाषा मॉडल, बेहतर math/reasoning, संरचित आउटपुट और फंक्शन कॉलिंग।

डीप-लर्निंग डिटेक्टर जो एआई बनाम मानव, पूरी तरह से मानव, एआई, या मिश्रित रूप में वर्गीकृत सामग्री द्वारा उत्पन्न होने वाले पाठ के कुछ हिस्सों को ध्वजांकित करता है।

वीडियो मॉडल टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, रेफरेंस-टू-वीडियो और वीडियो एडिट मोड को उच्च-fidelity, मोशन-स्मूथ आउटपुट के साथ पेश करता है।

Open-source text-to-image मॉडल ऑन a multimodal mixture-of-Experts आर्किटेक्चर with photorealistic details and strong multilingual text rendering.
मूल 720p आउटपुट (1080p) के साथ 8.3B-parameter वीडियो मॉडल, मजबूत गति सुसंगतता, और 10s तक द्विभाषी शीघ्र समझ।

जनस प्रो 7 बी मॉडल पर ऑटोरिग्रेटिव फ्रेमवर्क जो एक आर्किटेक्चर में बहुमॉडल समझ और छवि पीढ़ी को एकीकृत करता है।

टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, रेफरेंस-टू-वीडियो, संपादन, मूल ध्वनि और मल्टी-सीन संक्रमण के साथ मानक या प्रो मोड में वीडियो मॉडल।

Kling 3.0 मॉडल जो एक संदर्भ छवि से एक चरित्र पर एक संदर्भ वीडियो से गति को स्थानांतरित करता है, मानक 720p और प्रो 1080p स्तरों के साथ।

Iterative AI खोज जो प्रारंभिक परिणाम अपर्याप्त होने पर क्वेरी रखता है, मानक मोड की तुलना में अधिक व्यापक उत्तर लौटाता है।

विस्तृत अवलोकन और उत्तरों के साथ AI-powered वेब खोज, डीप सर्च से तेज़। OpenAI SimpleQA बेंचमार्क पर #1 रैंक।

लागत प्रभावी भाषा मॉडल प्रतिस्पर्धी विलंबता पर सामान्य उत्पादन कार्यभार के लिए मजबूत तर्क और बहुमॉडल प्रदर्शन प्रदान करता है।

मजबूत तर्क, कोडिंग और STEM प्रदर्शन के साथ एंटरप्राइज़-ग्रेड मॉडल, हाइब्रिड, ऑन-प्रेम और इन-वीपीसी तैनाती का समर्थन करता है।

छवि विश्लेषण, प्रोग्रामिंग, गणित और बहुभाषी कार्यों के लिए 128K संदर्भ के साथ 24B-parameter बहुमॉडल मॉडल, कुशल स्थानीय inference के लिए ट्यून किया गया।

हाइब्रिड मॉडल ने निर्देश, रीजनिंग (मैजिस्ट्रल) और देवस्ट्रल परिवारों को एकीकृत किया: 40% कम पूरा होने का समय और 3x थ्रूपुट बनाम स्मॉल 3.

ओपन सोर्स 32B MoE फाउंडेशन मॉडल जो सटीक दोहरी टावर होंठ-सिंक के साथ एक अनुमान चरण में सिंक्रनाइज़ वीडियो और ऑडियो उत्पन्न करता है।

पाठ, छवियों और एक 300K संदर्भ (~30 मिनट वीडियो तक) पर वीडियो के लिए कम लागत वाली मल्टीमॉडल फाउंडेशन मॉडल, गति और वहन के लिए ट्यून किया गया।

एक 1M संदर्भ (लंबी डॉक्स और ~ 90 मिनट क्लिप) पर पाठ, छवियों, दस्तावेजों और वीडियो के लिए फास्ट, लागत प्रभावी मल्टीमॉडल तर्क मॉडल।

Text-only फाउंडेशन मॉडल 128K संदर्भ पर अल्ट्रा-कम विलंबता और लागत के लिए ट्यून किया गया है। संक्षेपण, अनुवाद और 44% कैश छूट के साथ चैट करने के लिए मजबूत।

परिवार में सबसे सक्षम मॉडल। Multimodal text/image

मल्टीमोडल फाउंडेशन मॉडल संतुलन सटीकता, गति और पाठ, छवियों और 300K संदर्भ पर वीडियो (~30 मिनट वीडियो तक) के लिए लागत।

Whisper-1 speech-to-text ट्रांसक्रिप्शन बहुभाषी निगरानी ऑडियो पर प्रशिक्षित किया गया है, जिसमें प्रति फ़ाइल 25 MB अपलोड की सीमा है।

क्लाउड ओपस 4.6 तर्क द्वारा संचालित संस्थागत ग्रेड अनुसंधान, अधिकतम गहराई, बढ़ाया उपकरण पहुंच और व्यापक स्रोत कवरेज के साथ।

बहु-चरण पुनर्प्राप्ति, संश्लेषण और तर्क, स्वायत्त रूप से खोज, पढ़ने और जटिल विषयों में स्रोतों का मूल्यांकन करने के लिए अनुसंधान मॉडल।

सोनार प्रो एक एजेंटिक शोधकर्ता के रूप में: चेन वेब खोज, पूर्ण पृष्ठ प्राप्त करते हैं और लाइव तर्क को स्ट्रीम करते हैं, जटिल प्रश्नों के लिए रणनीति को अनुकूलित करते हैं।

डोमेन, भाषा, दिनांक और अधिक द्वारा फ़िल्टरिंग के साथ रीयल-टाइम वेब खोज। रिटर्न्स खोज परिणाम, नहीं LLM उत्तर; कोई फ़ाइल अपलोड नहीं।

रियल टाइम वेब-कनेक्टेड खोज सटीक उद्धरण और अनुकूलन स्रोतों के साथ up-to-date AI खोज एकीकरण उत्पादन ऐप में।

डबल प्रशस्ति पत्रों और एक बड़ी संदर्भ विंडो के साथ सर्च-ग्राउंड मॉडल, जटिल प्रश्नों के लिए गहराई से, nuanced उत्तर की आवश्यकता होती है।

अनसेंसर्ड ओपन सोर्स R1-1776 पर वेब सर्च के साथ रीजनिंग मॉडल, सिम्पलक्यूए बेंचमार्क पर अग्रणी सर्च इंजन और LLM का प्रदर्शन।

टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और संक्रमण मोड में उच्च विस्तार, द्रव गति और lifelike एनिमेशन के साथ सिनेमाई वीडियो पीढ़ी।

पाठ या 1-2 फ्रेम छवि से वीडियो उत्पन्न करता है 1080p, एकाधिक पहलू अनुपात, 5-10s अवधि, वैकल्पिक सिंक्रनाइज़ ऑडियो के साथ।

क्लास-लीडिंग कॉम्प्लेक्स Chinese/English टेक्स्ट रेंडरिंग, यथार्थवादी बनावट और बहु-छवि फ्यूजन के साथ एकीकृत छवि पीढ़ी और संपादन मॉडल।

हाइब्रिड रैखिक-attention प्लस sparse MoE, 1M संदर्भ, और तेजी से multimodal text/image /वीडियो inference के साथ दृष्टि-भाषा मॉडल।

हाइब्रिड रैखिक-attention प्लस sparse MoE, 1M संदर्भ, और तेजी से multimodal text/image /वीडियो inference के साथ दृष्टि-भाषा मॉडल।

Alibaba CloudSingaporeरिलीज 30 मार्च 2026Ctx 256Kटेक्स्ट जनरेशनलागत प्रभावी ओमनी मोडल मॉडल हैंडलिंग पाठ, छवि, ऑडियो और वीडियो, ऑडियो के 3 घंटे और 90+ भाषाओं में 1 घंटे वीडियो के साथ।

Alibaba CloudSingaporeरिलीज 30 मार्च 2026Ctx 256Kटेक्स्ट जनरेशनपाठ, छवि, ऑडियो और वीडियो के लिए फ्लैगशिप ओमनी मोडल मॉडल। 3h ऑडियो, 1h वीडियो, 90+ इनपुट और 30+ आउटपुट भाषाओं, 55 वॉयस टेम्ब्रे।

1M संदर्भ पर पाठ, छवि और वीडियो में कुशल गहरी सोच और दृश्य समझ के लिए हाइब्रिड आर्किटेक्चर के साथ मल्टीमॉडल मॉडल।

1M संदर्भ पर पाठ, छवि और वीडियो में कुशल गहरी सोच और दृश्य समझ के लिए हाइब्रिड आर्किटेक्चर के साथ मल्टीमॉडल मॉडल।

Alibaba CloudSingaporeरिलीज 20 अप्रैल 2026Ctx 256Kटेक्स्ट जनरेशन3.6 श्रृंखला (पाठ-केवल): में सबसे बड़ा पूर्वावलोकन संस्करण बेहतर कोडिंग एजेंट निष्पादन, मजबूत फ्रंट-एंड कौशल और व्यापक लंबी पूंछ ज्ञान।

3.5 से अधिक प्रमुख उन्नयन के साथ दृष्टि-भाषा मॉडल: एजेंटिक और फ्रंट-एंड कोडिंग, मल्टीमोडल मान्यता, OCR, और ऑब्जेक्ट लोकलाइजेशन।

3.5 से अधिक प्रमुख उन्नयन के साथ दृष्टि-भाषा मॉडल: एजेंटिक और फ्रंट-एंड कोडिंग, मल्टीमोडल मान्यता, OCR, और ऑब्जेक्ट लोकलाइजेशन।

तर्क, निर्देश निम्नलिखित और बहुभाषी समर्थन में प्रमुख सुधारों के साथ 256K-context फ्लैगशिप, साथ ही उच्च coding/math सटीकता।

Alibaba CloudSingaporeरिलीज 5 सित॰ 2025Ctx 256Kटेक्स्ट जनरेशनचीनी-अंग्रेजी समझ, जटिल निर्देश, बहुभाषी क्षमता और उपकरण उपयोग में 2.5 श्रृंखला पर प्रमुख लाभ के साथ पूर्वावलोकन रिलीज।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 256Kटेक्स्ट जनरेशनअनुकूली उपकरण उपयोग (अनुसंधान, स्मृति, कोड अनुवादक) और जटिल कार्यों पर उच्च सटीकता के लिए परीक्षण समय स्केलिंग के साथ रीजनिंग मॉडल।

Semantic दस्तावेज़ reranker। प्रासंगिकता द्वारा प्रति क्वेरी 500 उम्मीदवारों को क्रमबद्ध करें, 100+ भाषाओं का समर्थन करता है, और एक कस्टम सॉर्टिंग निर्देश स्वीकार करता है।

मजबूत फ्रंट-एंड परिणाम और एआई कोडिंग टूल और एजेंटों के लिए बहुभाषी प्रोग्रामिंग समर्थन के साथ कोडिंग-ट्यून 256K-context मॉडल।

उच्च आवृत्ति उद्यम कार्यभार के लिए संतुलित सामान्य उद्देश्य मॉडल: सूचना प्रसंस्करण, सामग्री, खोज और डेटा विश्लेषण।

256K संदर्भ, चार तर्क प्रयास मोड और image/video

जटिल तर्क, बहुमॉडल समझ, संरचित पीढ़ी और उपकरण-वर्धित निष्पादन के लिए 256K संदर्भ के साथ फ्लैगशिप सामान्य मॉडल।

स्पीड-ऑप्टिमाइज़्ड 2.0 वीडियो वेरिएंट फॉर सिनेमाटिक क्लिप्स विथ मूल ऑडियो सिंक, कैमरा कंट्रोल, और प्रति रेंडर कम लागत पर स्थिर गति।

पाठ, छवि, ऑडियो या वीडियो इनपुट से सिनेमाई आउटपुट के लिए मल्टीमॉडल वीडियो मॉडल, स्थिर गति और सुसंगत पात्रों के साथ।

एकीकृत बहुमॉडल छवि मॉडल जो प्रस्तुत करने से पहले संकेत के माध्यम से कारण बनता है, उच्च संकल्प और सुसंगत संपादन और ब्रांड दृश्यों का उत्पादन करता है।

विस्तृत text-to-image, एकल-छवि संपादन और 1K और 2K आउटपुट के साथ बहु-संदर्भ संलयन के लिए प्रीमियम सीड्रीम छवि मॉडल।

लॉन्ग-फॉर्म के लिए ओपन-सोर्स वॉयस मॉडल, बहु-स्पीकर पॉडकास्ट संवाद पैरालैंगिक नियंत्रण (वध, sighs) और शून्य-शॉट वॉयस क्लोनिंग के साथ।

पाठ संकेत से 3 मिनट तक ऑडियो उत्पन्न करता है, text-to-audio और audio-to-audio

Up to-3-minute

WAN 2.2 पर स्थिर वीडियो इन्फिनिटी 2.0 प्रो: लगातार चरित्र आईडी रखने के दौरान सैद्धांतिक रूप से अनंत-लंबाई वीडियो में अभी भी छवियों का विस्तार करता है।

बहु शोध अनुसंधान सहायक जो एक विषय की पड़ताल करता है, सूत्रों का विश्लेषण करता है और उद्धरण के साथ विस्तृत शोध रिपोर्ट उत्पन्न करता है।

वेब खोज क्रॉल, एक्सट्रैक्ट और यूआरएल मैपिंग के साथ तेजी से, संरचित पुनर्प्राप्ति के लिए पृष्ठों और डोमेन डाउनस्ट्रीम पाइपलाइनों के लिए।

चयन करने योग्य आउटपुट आयाम (64-2048) के साथ बहुभाषी टेक्स्ट एम्बेडिंग। प्रति इनपुट 8,192 टोकन तक।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 1024एम्बेडिंगस्पीड-ऑप्टिमाइज्ड मल्टीमॉडल एम्बेडिंग - विजन-प्लस के समान आकार, 3 × सस्ता image/video tokens।

Alibaba CloudSingaporeरिलीज 23 सित॰ 2025Ctx 1024एम्बेडिंगमल्टीमॉडल एम्बेडिंग पाठ, छवि और वीडियो इनपुट के लिए स्वतंत्र वेक्टर का उत्पादन करते हैं।
सिनेमाई के लिए मल्टीमॉडल वीडियो जनरेशन मॉडल, देशी ऑडियो विजुअल सिंक (लिप-सिंक, संवाद, संगीत, एसएफएक्स) के साथ बहु-shot कहानियां।

मल्टीमोडल वीडियो मॉडल T2V, I2V, वीडियो संपादन और reference-to-video का समर्थन करता है, जिसमें टेक्स्ट, इमेज या वीडियो इनपुट से उच्च-fidelity आउटपुट होता है।

छवि उत्पादन और संपादन साथी मॉडल: text-to-image, बाउंडिंग बॉक्स संपादन, और सुसंगत छवि सेट, प्रो पर 4K आउटपुट तक।
बहुभाषी एएसआर, अनुवाद, वीएडी, टाइमस्टैम्प, उपशीर्षक, हॉटवर्ड्स और डिकोडर नियंत्रण के साथ नियंत्रित कानाफूसी बड़े v3 टर्बो ट्रांसक्रिप्शन।

स्वायत्त एआई एजेंट जो सबटास्क, कॉल टूल और एपीआई में एक उच्च स्तरीय संकेत बदलता है, और मैनुअल ऑर्केस्ट्रेशन के बिना end-to-end परिणाम वितरित करता है।

इमेज-टू-वीडियो मॉडल जो तत्काल-निर्देशित गति के साथ एक स्रोत छवि को दर्शाता है, सात पहलू अनुपात में 480p या 720p पर 15 सेकंड तक।

एजेंटिक वर्कफ़्लो, जटिल सॉफ्टवेयर इंजीनियरिंग, और लंबे समय तक काम के लिए शीर्ष स्तरीय मॉडल, 1000+ टूल कॉल पर 1M संदर्भ पर काम को बनाए रखने।

1M संदर्भ पर मूल दृश्य और ऑडियो समझ के साथ बहुमॉडल, जिसका कारण है और एजेंटिक वर्कफ़्लो में modalities में कार्य करने के लिए बनाया गया है।

टेक्स्ट, इमेज और reference-to-video को एक मॉडल में रखें। सिनेमाई गति, 9 संदर्भों तक चरित्र स्थिरता, और सिंक्रनाइज़ देशी ऑडियो।

480p और 720p पर देशी ऑडियो, कैमरा नियंत्रण और छवि या वीडियो इनपुट के साथ लघु सिनेमाई क्लिप के लिए सबसे तेज़, सबसे किफायती Seedance 720 स्तर।

छवि और वीडियो इनपुट, टूल कॉलिंग, समायोज्य तर्क प्रयास और 256K संदर्भ के साथ स्टेपफन मल्टीमॉडल रीजनिंग मॉडल।

एजेंटों, कोडिंग, टूल कॉलिंग और लंबे संदर्भ विश्लेषण के लिए स्टेपफन टेक्स्ट रीजनिंग मॉडल।

StepFunInternationalरिलीज 2 अप्रैल 2026Ctx 256Kटेक्स्ट जनरेशनएजेंट-अनुकूलित चरण 3.5 कम और उच्च तर्क प्रयास मोड के साथ फ्लैश संस्करण।

टेक्स्ट आउटपुट और पैरालिंग्विस्टिक समझ के साथ StepFun ऑडियो और टेक्स्ट वार्तालाप मॉडल।

text-to-image और एकल-छवि संपादन के लिए StepFun छवि निर्माण और छवि संपादन मॉडल।

प्रासंगिक StepFun प्राकृतिक भाषा की आवाज दिशा और अभिव्यंजक वितरण के साथ text-to-speech मॉडल।

StepFun आधिकारिक आवाज़, कस्टम क्लोन आवाज़ों और वॉयस टैग नियंत्रण के साथ text-to-speech मॉडल।

चीनी और अंग्रेजी ऑडियो ट्रांसक्रिप्शन के लिए StepFun स्ट्रीमिंग स्पीच रिकग्निशन मॉडल।

Next-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Tiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 मॉडल