
التحويل إلى نص إلى فيديو image-to-video مع صوت أصلي متزامن، بدقة 720p أو 1080p لمدة 3 إلى 15 ثانية، مع نسبة العرض إلى الارتفاع والتحكم في التوجيه.
ادفع فقط مقابل ما تستخدمه. لا يوجد قفل اشتراك.
كتالوج التسعير
تختلف أسعار EmpirioLabs حسب النموذج والوحدة: الرموز، الصور، ثوان من الصوت أو الفيديو، الرسائل، الأصول ثلاثية الأبعاد، وطلبات البحث. جدول التسعير التفاعلي يحمل الكتالوج الحالي، بينما تبقى هذه الأسعار التمثيلية قابلة للقراءة بدون وجود جافاسكريبت للعميل.
إدخال الصورة $0.05 لكل صورة. يبدأ إخراج الفيديو عند $0.096 في الثانية لبدقة 480p و$0.168 في الثانية لبدقة 720p.
يبدأ الإدخال من $0.40 لكل مليون رمز مطالبة لواجهة برمجة تطبيقات متعددة الوسائط طويلة السياق فعالة من حيث التكلفة.
يبدأ الإدخال من $0.30 لكل مليون رمز مطالبة للتفكير متعدد الوسائط، والترميز، وأعباء عمل الوكلاء.
يتم تسعير توليد الصور إلى ثلاثية الأبعاد لكل أصل ثلاثي الأبعاد مولد، مع مستندات للتحكم في التنسيق والدقة.
تعرض أسعار واجهة API للنماذج وتتم فوترتها بالدولار الأمريكي. قد يعرض checkout وسائل دفع محلية عندما تكون مؤهلة.

التحويل إلى نص إلى فيديو image-to-video مع صوت أصلي متزامن، بدقة 720p أو 1080p لمدة 3 إلى 15 ثانية، مع نسبة العرض إلى الارتفاع والتحكم في التوجيه.

نموذج التفكير والترميز مع سياق رمز بحجم 1 مليون، مخرج 128K، جهد التفكير القابل للتعديل، البحث الأصلي على الويب، واستدعاء الأدوات.
نموذج التفكير والترميز مع سياق رمز بحجم 1 مليون، مخرج 128K، جهد التفكير القابل للتعديل، البحث الأصلي على الويب، واستدعاء الأدوات.

Kimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

Moonshot AIInternationalتاريخ الإصدار 16 يونيو 2026السياق 256Kتوليد النصوصKimi K2.7 Code هو نموذج الترميز الوكيل من Moonshot الذي يضم تريليون معاملات، مع سياق 256 كيلوبايت، وتفكير دائم التشغيل، ومدخلات نصية وصورة وفيديو.

Kimi K2.7 Code هو نموذج الترميز الوكيل من Moonshot الذي يضم تريليون معاملات، مع سياق 256 كيلوبايت، وتفكير دائم التشغيل، ومدخلات نصية وصورة وفيديو.

نموذج التفكير الحدودي الفوقي مع سياق رمز بمقدار 1M، وفهم للصور والفيديو، وبحث ويب مدمج مع مصادر مستشهدة، واستدعاء الأدوات.

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

نموذج لغة رؤية فعال من حيث التكلفة في Qwen3.7 للنصوص، والصور، والفيديو، والترميز، واستخدام الأدوات، وفهم واجهة المستخدم الرسومية، وسير عمل السياق 1M.

نموذج لغة رؤية فعال من حيث التكلفة في Qwen3.7 للنصوص، والصور، والفيديو، والترميز، واستخدام الأدوات، وفهم واجهة المستخدم الرسومية، وسير عمل السياق 1M.

Moonshot AIInternationalتاريخ الإصدار 16 يونيو 2026السياق 256Kتوليد النصوصKimi K2.7 Code Highspeed هو المستوى الأسرع خدمة في نموذج الترميز الوكيل من Moonshot، مع سياق 256K، وتفكير دائم التشغيل، وإدخال الصور والفيديو.

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Alibaba CloudSingaporeتاريخ الإصدار 15 يوليو 2026السياق 1Mتوليد النصوصFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

ميني ماكس M3 هو نموذج استدلالي متعدد الوسائط للبرمجة، والوكلاء، وتحليل السياق الطويل باستخدام إدخال النصوص والصور والفيديو.

ميني ماكس M3 هو نموذج استدلالي متعدد الوسائط للبرمجة، والوكلاء، وتحليل السياق الطويل باستخدام إدخال النصوص والصور والفيديو.

Qwen3.7 Max هو نموذج نصي رائد للبرمجة، والإنتاجية، والوكلاء المستمرين على قيد الحياة، والتفكير العميق، والأدوات، وسياق الرمز بمليون واحد.

Qwen3.7 Max هو نموذج نصي رائد للبرمجة، والإنتاجية، والوكلاء المستمرين على قيد الحياة، والتفكير العميق، والأدوات، وسياق الرمز بمليون واحد.
نموذج إنتاج الموسيقى مفتوح المصدر للصوت text-to-song والصوت الموجه بالكلمات، مع استنتاج سريع XL Turbo بثماني خطوات لتكرار الأغنية القابل للتحكم فيه.

نموذج 4B FLUX.2 Klein لتوليد وتحرير الصور مرخص من Apache مع دعم text-to-image وتحرير الصور المرجعية وسير العمل الإبداعي.

MiniMaxSingaporeتاريخ الإصدار 18 مارس 2026السياق 200Kتوليد النصوصنسخة M2.7 عالية السرعة مضبوطة على الاستدلال السريع مع أداء عام قوي وقدرات وكلاء قوية.
نموذج صوتي في الوقت الحقيقي مع توجيه صوتي باللغة الإنجليزية البسيطة، وهوية صوتية واحدة عبر 100+ لغة، وبث time-to-first-audio أقل من 200 مللي ثانية.
توليف صوتي TTFB بسرعة أقل من 130 مللي ثانية مع 271+ صوتا عبر 15 لغة، وعرض تعبيري، وبث SSE في الوقت الحقيقي لوكلاء الصوت منخفضي التأخير.
توليف صوتي بجودة البث مع غنية تعبيرية، 271+ صوتا عبر 15 لغة، وبث SSE في الوقت الحقيقي مع طوابع زمنية لكل كلمة.
نموذج التفكير الذكاء الاصطناعي طويل السياق من Zhipu مع سياق 202K، وإخراج 128K، واستدعاء الأدوات، والمخرجات المنظمة، ودعم الكاش.

Kimi K2.6 هو نموذج استدلال متعدد الوسائط من Moonshot مع سياق 256K، وترميز قوي، ومدخلات نصية وصورة وفيديو.

MiniMax M2.7 هو نموذج دردشة للاستدلال عام الغرض مع التفكير المتداخل، واستدعاء الوظائف، والتخزين المؤقت للطلبات.
نموذج TRELLIS.2 من الصورة إلى ثلاثية الأبعاد يحول صورة مرجعية إلى أصل GLB مملموس مع دقة، وبذرة، وشبكة، وملمس، وتحكم في التصدير.

Alibaba CloudChinaتاريخ الإصدار 24 فبراير 2026السياق 256Kتوليد النصوصQwen3.5 122B-A10B هو نموذج استدلال متعدد الوسائط مع سياق 256K، واستدلال MoE متفرق وفعال، ومدخلات نصية وصورة وفيديو.

Alibaba CloudChinaتاريخ الإصدار 16 فبراير 2026السياق 256Kتوليد النصوصQwen3.5 397B-A17B هو نموذج استدلالي متعدد الوسائط رائد للغة، والشيفرة، والوكلاء، ومهام واجهة الرسوم، وفهم الصور والفيديو.

Alibaba CloudChinaتاريخ الإصدار 24 فبراير 2026السياق 256Kتوليد النصوصQwen3.5 35B-A3B هو نموذج لغة رؤية أصلي فعال مع توجيه MoE متفرق، والتفكير العميق، وإدخال النصوص والصور والفيديو.

Qwen3.5 27B هو نموذج استدلال متعدد الوسائط كثيف مع استجابات سريعة، وسياق 256K، وفهم للنصوص والصور والفيديو.

يحسن Qwen3.6 27B الترميز الوكيل، والتفكير في STEM، والرؤية المكانية، والحرمان البصري الضوئي (OCR)، وفهم النصوص والصور والفيديو على سياق 256K.

Alibaba CloudSingaporeتاريخ الإصدار 16 أبريل 2026السياق 1Mتوليد النصوصنموذج لغة الرؤية السريع Qwen3.6 للبرمجة الوكالية، والتفكير الرياضي، والفهم المكاني، والحرج الضوئي (OCR)، وإدخال النص والصورة والفيديو.

نموذج لغة الرؤية السريع Qwen3.6 للبرمجة الوكالية، والتفكير الرياضي، والفهم المكاني، والحرج الضوئي (OCR)، وإدخال النص والصورة والفيديو.

Gemma 4 26B A4B هو نموذج متعدد الوسائط مفتوح من Google مزود بمدخلات وسياق ونص وصور وفيديو 256K، وأدوات، ومخرجات منظمة.

Qwen3.5 9B هو نموذج استدلال متعدد الوسائط مضغوط يحتوي على سياق، مدخل صور وفيديو، وأدوات دوال 256K، ومخرج منظم.

Qwen3.5 4B هو نموذج استدلال متعدد الوسائط منخفض التكلفة مع 256K سياق، ومدخلات صور وفيديو، وأدوات وظيفية، ومخرجات منظمة.

Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

نموذج نص خفيف الوزن GLM-4.7 مجاني للبرمجة، والتفكير، والكتابة طويلة السياق، والدردشة العامة.

نموذج نصي خفيف الوزن مجاني GLM-4.5 للتفكير، البرمجة، الدردشة الطويلة، ومهام اللغة العامة.

نموذج GLM-4.6V متعدد الوسائط مجاني لفهم الصور والفيديو والملفات والنصوص مع استدعاء الدوال الأصلية.

إنشاء الصور وتحريرها في نموذج إنشاء وتعديل الصور من مدخلات نصية أو صورية، مع التحكم في الرسم الداخلي، والتجربة الافتراضية، والتحكم في الأسلوب.

نموذج توليد الفيديو ينتج فيديوهات متعددة اللقطات تصل إلى دقيقتين من النص وتوجيهات الصور الاختيارية مع جودة وثبات محسنين.

نسخ الكلام إلى نص باستخدام نموذج Nova-3 مع دعم متعدد اللغات وإعدادات متقدمة قابلة للتخصيص لأعباء العمل الإنتاجية.

يجمع بين DeepSeek R1 chain-of-thought المنطق مع إنثروبيك كلود الإبداعي وتوليد الشيفرة خلف واجهة موحدة تتحكم بها البيانات.

تخصصت نماذج اللغة المفتوحة المصدر في إثبات النظريات الرسمية في Lean 4، مبنية على خط أنابيب لإثبات النظريات التكرارية.

نموذج اللغة الكبير المفتوح المصدر Mix-of-Experts مصمم خصيصا لمهام التفكير والبرمجة واللغة العامة عالية الكفاءة عبر المحفزات الطويلة.

نموذج MoE خفيف الوزن بإجمالي 284 مليار / 13 مليار معلمة نشطة وسياق أصلي 1M، مضبوط للاستخدام منخفض التأخير وفعال من حيث التكلفة وعالي التزامن.

نموذج MoE خفيف الوزن بإجمالي 284 مليار / 13 مليار معلمة نشطة وسياق أصلي 1M، مضبوط للاستخدام منخفض التأخير وفعال من حيث التكلفة وعالي التزامن.

نموذج MoE خفيف الوزن بإجمالي 284 مليار / 13 مليار معلمة نشطة وسياق أصلي 1M، مضبوط للاستخدام منخفض التأخير وفعال من حيث التكلفة وعالي التزامن.

نموذج اللغة الكبير لوزارة السحر مع 1.6 تسانا إجمالا / 49 مليار معلمة نشطة وسياق أصلي بحجم 1M للرياضيات المتقدمة، والاستدلال المنطقي، والترميز المتخصص.

نموذج اللغة الكبير لوزارة السحر مع 1.6 تسانا إجمالا / 49 مليار معلمة نشطة وسياق أصلي بحجم 1M للرياضيات المتقدمة، والاستدلال المنطقي، والترميز المتخصص.

نموذج اللغة الكبير لوزارة السحر مع 1.6 تسانا إجمالا / 49 مليار معلمة نشطة وسياق أصلي بحجم 1M للرياضيات المتقدمة، والاستدلال المنطقي، والترميز المتخصص.

إجابة سريعة على طريقة نموذج اللغة الكبيرة على سؤال بلغة طبيعية، مستندة إلى نتائج بحث Exa الجديدة على الويب مع استشهادات وروابط مصادر.

محرك بحث ويب للعثور على الصفحات، واسترجاع الصفحات المشابهة، والزحف، والبحث المخصص في الكود عبر الويب المفتوح لعملاء الذكاء الاصطناعي.

text-to-speech منخفض التأخير مع أصوات مكبرات صوت واحدة ومتعددة وأسلوب ولهجة ونبرة تعبيرية قابلة للتحكم في تطبيقات الإنتاج.

معاينة TTS عالية الجودة للبودكاست، والكتب الصوتية، ودعم العملاء، مع أصوات معبرة متعددة مكبرات الصوت عبر 23+ لغة.

TTS قابل للتحكم بدرجة عالية مع علامات صوتية جديدة لأسلوب دقيق، ونبرة، وسرعة، وأداء عبر السرد والمساعدين وتطبيقات الصوت.

نموذج لغة رؤية مفتوح المصدر مع سياق 128K، و140+ لغة، وmath/reasoning محسنة، ومخرجات منظمة، واستدعاء للوظائف.

text-to-speech مبنية على نماذج اللغة الكبيرة مع استنساخ صوتي بدون لقطة من 3 إلى 10 ثوان من الصوت وإخراج قابل للتحكم في التعبير عن المشاعر عبر التعلم المعزز متعدد المكافآت.

كاشف التعلم العميق الذي يحدد أجزاء من النص التي من المحتمل أن يكون مولدا بواسطة الذكاء الاصطناعي مقابل الإنسان، ويصنف المحتوى إلى إنسان بالكامل، أو ذكاء اصطناعي، أو مختلط.

نموذج الفيديو يقدم أوضاع تحويل النص إلى فيديو، الصورة إلى فيديو، المرجع إلى الفيديو، وتحرير الفيديو مع إخراج عالي الدقة وسلس الحركة.

نموذج text-to-image مفتوح المصدر على بنية متعددة الوسائط مزيج من الخبراء مع تفاصيل فوتوغرافية واقعية وعرض نصوص قوي متعدد اللغات.
نموذج فيديو بمعاملة 8.3 مليار مع إخراج أصلي 720p (قابل للترقية إلى 1080p)، وتماسك حركتي قوي، وفهم للأوامر ثنائية اللغة حتى 10 ثوان.

إطار عمل ذاتي الانحدار على نموذج Janus Pro 7B الذي يوحد الفهم متعدد الوسائط وتوليد الصور في بنية واحدة.

نموذج الفيديو في أوضاع Standard أو Pro مع التحويل من النص إلى الفيديو، الصورة إلى الفيديو، المرجع إلى الفيديو، التحرير، الصوت الأصلي، والانتقالات متعددة المشاهد.

نموذج Kling 3.0 الذي ينقل الحركة من فيديو مرجعي إلى شخصية من صورة مرجعية، مع مستويات قياسية 720p وPro 1080p.

بحث ذكاء اصطناعي تكراري يستمر في الاستعلام عندما تكون النتائج الأولية غير كافية، مما يعيد إجابات أكثر شمولا من الوضع القياسي.

بحث ويب مدعوم بالذكاء الاصطناعي مع نظرة عامة وإجابات مفصلة أسرع من البحث العميق. يحتل المرتبة #1 في اختبار OpenAI SimpleQA.

نموذج لغوي فعال من حيث التكلفة يقدم تفكيرا قويا وأداء متعدد الوسائط لأعباء الإنتاج العامة عند زمن استجابة تنافسي.

نموذج مؤسسي بأداء قوي في المنطق، والترميز، وSTEM، يدعم النشر الهجين والمحلي والداخل في VPC.

نموذج متعدد الوسائط ب24 مليار معامل مع سياق 128K لتحليل الصور، البرمجة، الرياضيات، والمهام متعددة اللغات، ومضبوط لاستنتاج محلي فعال.

النموذج الهجين الذي يوحد عائلات التعليم، الاستدلال (الماجسترال)، والديفسترال: وقت إكمال أقل بنسبة 40٪ ومعدل إنتاجية 3 أضعاف مقارنة ب Small 3.

نموذج أساس MoE مفتوح المصدر 32B ينتج فيديو وصوتيا متزامنين في خطوة استدلالية واحدة مع مزامنة شفاه دقيقة مزدوجة البرج.

نموذج أساس متعدد الوسائط منخفض التكلفة للنص والصور والفيديو على سياق 300K (حتى ~30 دقيقة فيديو)، مضبوط للسرعة والأسعار المعقولة.

نموذج استدلالي متعدد الوسائط سريع وفعال من حيث التكلفة للنصوص، والصور، والوثائق، والفيديو على سياق مدته 1M (وثائق طويلة ومقاطع ~90 دقيقة).

نموذج الأساس النصي فقط مضبوط لتأخير وتكلفة منخفضة جدا على سياق 128K. قوي للتلخيص والترجمة والدردشة مع خصم 44٪ على الكاش.

أكثر عارضة أزياء كفاءة في العائلة. text/image/فيديو متعدد الوسائط على سياق 1 مليون مع chain-of-thought المنطق عبر الأدوات ومصادر البيانات.

نموذج الأساس متعدد الوسائط يوازن بين الدقة والسرعة والتكلفة للنص والصور والفيديو على سياق 300K (حتى ~30 دقيقة فيديو).

كان Whisper-1 speech-to-text النسخ، مدربا على صوت متعدد اللغات تحت إشراف، مع حد رفع 25 ميجابايت لكل ملف.

بحث مؤسسي مدعوم بمنطق كلود أوبوس 4.6، مع أقصى عمق، وتحسين الوصول إلى الأدوات، وتغطية واسعة للمصادر.

نموذج بحثي لاسترجاع متعدد الخطوات، والتركيب، والتفكير، مع البحث الذاتي، والقراءة والتقييم الذاتية للمصادر عبر مواضيع معقدة.

سونار برو كباحث وكيل: يقوم بسلسلة عمليات البحث على الويب، وجلب الصفحات الكاملة، وبث الاستدلال الحي، مع تكييف الاستراتيجية للاستعلامات المعقدة.

بحث في الوقت الحقيقي على الويب مع تصفية حسب المجال، اللغة، التاريخ، والمزيد. يعيد نتائج البحث، وليس ردود نماذج اللغة الكبيرة (LLM); لا رفع ملفات.

بحث متصل بالويب في الوقت الحقيقي مع استشهادات دقيقة ومصادر قابلة للتخصيص لتكامل البحث up-to-date الذكي في تطبيقات الإنتاج.

نموذج قائم على البحث مع ضعف عدد الاستشهادات ونافذة سياق أكبر، مضبوط للاستفسارات المعقدة التي تحتاج إلى إجابات معمقة ودقيقة.

نموذج التفكير على R1-1776 مفتوح المصدر غير خاضع للرقابة مع البحث على الويب، متفوقا على محركات البحث الرائدة ونماذج اللغة الكبيرة في معيار SimpleQA.

توليد الفيديو السينمائي في أوضاع تحويل النص إلى فيديو، الصورة إلى الفيديو، والانتقال مع تفاصيل عالية، حركة سلسة، ورسوم متحركة واقعية.

يولد فيديوهات من نص أو من صور 1-2 إطار حتى 1080p، نسب عرض إلى ارتفاع متعددة، مدة 5-10 ثوان، مع خيار الصوت المتزامن.

نموذج موحد لتوليد وتحرير الصور مع عرض نص معقد Chinese/English رائد الفئة، وقوام واقعي، ودمج صور متعددة.

Alibaba CloudSingaporeتاريخ الإصدار 24 فبراير 2026السياق 1Mتوليد النصوصنموذج الرؤية واللغة مع تركيز خطي هجين بالإضافة إلى MoE متفرق، وسياق 1M سياق، واستنتاج text/image/فيديو متعدد الوسائط سريع.

نموذج الرؤية واللغة مع تركيز خطي هجين بالإضافة إلى MoE متفرق، وسياق 1M سياق، واستنتاج text/image/فيديو متعدد الوسائط سريع.

Alibaba CloudSingaporeتاريخ الإصدار 30 مارس 2026السياق 256Kتوليد النصوصنموذج متعدد الوسائط وفعال من حيث التكلفة يتعامل مع النص والصورة والصوت والفيديو، مع ما يصل إلى 3 ساعات من الصوت وساعة واحدة من الفيديو عبر 90+ لغة.

Alibaba CloudSingaporeتاريخ الإصدار 30 مارس 2026السياق 256Kتوليد النصوصالنموذج الرائد متعدد الوسائط للنص والصورة والصوت والفيديو. صوت 3H، فيديو 1H، 90+ مدخل و30+ لغة إخراج، 55 صوت صوتي.

Alibaba CloudSingaporeتاريخ الإصدار 16 فبراير 2026السياق 1Mتوليد النصوصنموذج متعدد الوسائط مع هندسة هجينة للتفكير العميق الفعال والفهم البصري عبر النص والصورة والفيديو على سياق 1 مليون.

نموذج متعدد الوسائط مع هندسة هجينة للتفكير العميق الفعال والفهم البصري عبر النص والصورة والفيديو على سياق 1 مليون.

Alibaba CloudSingaporeتاريخ الإصدار 20 أبريل 2026السياق 256Kتوليد النصوصأكبر نسخة معاينة في سلسلة 3.6 (نصية فقط): تحسين تنفيذ وكيل البرمجة، مهارات واجهة أمامية أقوى، ومعرفة أوسع بالذيل الطويل.

نموذج لغة الرؤية مع ترقيات كبيرة على الإصدار 3.5: الترميز الوكيل والواجهة الأمامية، التعرف متعدد الوسائط، التعرف الضوئي على الحرار، وتحديد موقع الكائنات.

نموذج لغة الرؤية مع ترقيات كبيرة على الإصدار 3.5: الترميز الوكيل والواجهة الأمامية، التعرف متعدد الوسائط، التعرف الضوئي على الحرار، وتحديد موقع الكائنات.

رائد في سياق 256K مع تحسينات كبيرة في التفكير، واتباع التعليمات، والدعم متعدد اللغات، بالإضافة إلى دقة coding/math أعلى.

Alibaba CloudSingaporeتاريخ الإصدار 5 سبتمبر 2025السياق 256Kتوليد النصوصإصدار المعاينة مع مكاسب كبيرة مقارنة بسلسلة 2.5 في الفهم الصيني-الإنجليزي، والتعليمات المعقدة، والقدرة على تعدد اللغات، واستخدام الأدوات.

Alibaba CloudSingaporeتاريخ الإصدار 23 سبتمبر 2025السياق 256Kتوليد النصوصنموذج الاستدلال باستخدام أداة تكيفية (بحث، ذاكرة، مفسر شيفرة) وتوسيع وقت الاختبار لزيادة الدقة في المهام المعقدة.

Alibaba CloudSingaporeتاريخ الإصدار 5 يونيو 2025السياق 4000المعادون الترتيبإعادة ترتيب المستندات الدلالية. يرتب حتى 500 مرشح لكل استعلام حسب الصلة، ويدعم 100+ لغة، ويقبل تعليمات فرز مخصصة.

نموذج 256K السياق المضبوط بالبرمجة مع نتائج قوية في الواجهة الأمامية ودعم البرمجة متعددة اللغات لأدوات ووكلاء البرمجة بالذكاء الاصطناعي.

نموذج متوازن للأغراض العامة لأعباء العمل عالية التردد في المؤسسات: معالجة المعلومات، المحتوى، البحث، وتحليل البيانات.

نموذج متعدد الوسائط يركز على الكمون مع سياق 256 كيلوبايت، وأربعة أوضاع جهد استدلالية، وفهم image/video للاستخدام عالي التزامن.

نموذج عام رائد مع سياق 256K للتفكير المعقد، والفهم متعدد الوسائط، والتوليد المنظم، والتنفيذ المعزز بالأدوات.

نسخة فيديو 2.0 محسنة للسرعة للمقاطع السينمائية مع مزامنة صوتية أصلية، وتحكم بالكاميرا، وحركة مستقرة بتكلفة أقل لكل عرض.

نموذج فيديو متعدد الوسائط لإخراج سينمائي من مدخلات نصية أو صورة أو صوت أو فيديو، مع حركة مستقرة وحروف متسقة.

نموذج صورة متعدد الوسائط موحد يستعرض التعليمات قبل العرض، مما ينتج تعديلات عالية الدقة ومتسقة ورسومات للعلامة التجارية.

نموذج صور Seedream المميز لتحرير text-to-image مفصل، وتحرير صورة واحدة، ودمج متعدد المراجع مع إخراج 1K و2K.

نموذج صوتي مفتوح المصدر لحوارات بودكاست طويلة الشكل متعددة مكبرات الصوت مع تحكم شبه لغوي (ضحك، تنهدات) واستنساخ صوتي بدون فرصة.

يولد صوتا يصل إلى 3 دقائق من التعليمات النصية، ويدعم text-to-audio وaudio-to-audio مع إمكانية تعديل المدة، والخطوات، ومقياس CFG.

الصوت to-3-minute النص مع text-to-audio وaudio-to-audio وطلاء صوتي لإنتاج الموسيقى، تصميم الصوت، وإعادة المزج.

Stable Video Infinity 2.0 Pro على WAN 2.2: يمدد الصور الثابتة إلى فيديو نظري لا نهائي الطول مع الحفاظ على معرفات الأحرف الثابتة.

مساعد بحث متعدد البحث يستكشف موضوعا، يحلل المصادر، وينتج تقريرا بحثيا مفصلا مع الاستشهادات.

البحث على الويب مع الزحف والاستخراج ورسم خرائط الروابط لاسترجاع سريع ومنظم عبر الصفحات والنطاقات لخطوط الأنابيب اللاحقة.

Alibaba CloudSingaporeتاريخ الإصدار 4 يونيو 2025السياق 8192التضميناتتضمين نص متعدد اللغات مع أبعاد إخراج قابلة للاختيار (64–2048). حتى 8,192 رمزا لكل إدخال.

Alibaba CloudSingaporeتاريخ الإصدار 23 سبتمبر 2025السياق 1024التضميناتتضمين متعدد الوسائط محسن للسرعة, بنفس شكل Vision-Plus، 3× رموز image/video أرخص.

Alibaba CloudSingaporeتاريخ الإصدار 23 سبتمبر 2025السياق 1024التضميناتالتضمين متعدد الوسائط ينتج متجهات مستقلة لمدخلات النص والصورة والفيديو.

نموذج توليد الفيديو متعدد الوسائط للقصص السينمائية متعددة اللقطات مع التزامن الصوتي والبصري الأصلي (مزامنة الشفاه، الحوار، الموسيقى، المؤثرات الصوتية).

نموذج فيديو متعدد الوسائط يدعم T2V وI2V وتحرير الفيديو وreference-to-video، مع إخراج عالي الدقة من مدخلات النص أو الصورة أو الفيديو.

نموذج المرافق لتوليد الصور وتحريرها: text-to-image، وتعديلات الصناديق المحدودة، ومجموعات صور متماسكة، مع إخراج يصل إلى 4K على Pro.
نسخ Whisper Large v3 Turbo متحكم به مع ASR متعدد اللغات، ترجمة، VAD، طوابع زمنية، ترجمة، كلمات ساخنة، وضوابط فك الترميز.

وكيل ذكاء اصطناعي مستقل يحول تنبيها عالي المستوى إلى مهام فرعية، يستدعي الأدوات وواجهات برمجة التطبيقات، ويحقق نتائج end-to-end دون تنسيق يدوي.

نموذج الصورة إلى الفيديو الذي يتحرك صورة المصدر بحركة موجهة بالطلب، حتى 15 ثانية بدقة 480p أو 720p عبر سبع نسب إلى ارتفاع.

نموذج من الدرجة الأولى لسير العمل الوكالتي، وهندسة البرمجيات المعقدة، والمهام البعيدة، ويستمر في العمل عبر 1000+ استدعاء أدوات في سياق مليون واحد.

نموذج متعدد الوسائط مع فهم بصري وصوتي أصلي على سياق 1 ميلي، مصمم للتفكير والعمل عبر الأساليب في سير العمل الوكيلي.

النص، والصورة، وreference-to-video في نموذج واحد. حركة سينمائية، اتساق الشخصيات عبر ما يصل إلى 9 مراجع، وصوت متزامن محلي.

أسرع وأرخص مستوى Seedance 2.0 للمقاطع السينمائية القصيرة مع صوت وتحكم بالكاميرا ومدخلات صوت أو فيديو أصلية بدقة 480p و720p.

StepFunInternationalتاريخ الإصدار 28 مايو 2026السياق 256Kتوليد النصوصنموذج التفكير متعدد الوسائط من StepFun مع إدخال الصور والفيديو، استدعاء الأدوات، جهد التفكير القابل للتعديل، وسياق 256K.

StepFunInternationalتاريخ الإصدار 12 فبراير 2026السياق 256Kتوليد النصوصنموذج التفكير النصي StepFun للوكلاء، والترميز، واستدعاء الأدوات، والتحليل طويل السياق.

StepFunInternationalتاريخ الإصدار 2 أبريل 2026السياق 256Kتوليد النصوصنسخة فلاش 3.5 المحسنة للوكيل مع أوضاع جهد منطقي منخفض وعالي.

نموذج StepFun للصوت والنصوص مع إخراج النص والفهم اللالغوي.

نموذج توليد الصور وتحرير الصور من StepFun لتحرير الصور text-to-image وصورة واحدة.

نموذج StepFun السياقي text-to-speech مع توجيه صوتي باللغة الطبيعية وأداء تعبيري.

نموذج StepFun text-to-speech مع أصوات رسمية، أصوات مستنسخة مخصصة، وتحكم في علامات الصوت.

نموذج التعرف على الكلام من StepFun للبث الصوتي الصيني والإنجليزي.

Next-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Tiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 النماذج