
البرمجة والنموذج الوكيلي مع سياق رمز بقيمة 1 مليون، مخرج 128 كيلوبايت، تفكير دائم التفكير بجهد منخفض أو عالي أو قصوى، بحث ويب أصلي، واستدعاء أدوات.
ادفع حسب الاستخدام، أو اختر خطة مع بدلات أسبوعية.
كتالوج التسعير
تختلف أسعار EmpirioLabs حسب النموذج والوحدة: الرموز، الصور، ثوان من الصوت أو الفيديو، الرسائل، الأصول ثلاثية الأبعاد، وطلبات البحث. جدول التسعير التفاعلي يحمل الكتالوج الحالي، بينما تبقى هذه الأسعار التمثيلية قابلة للقراءة بدون وجود جافاسكريبت للعميل.
إدخال الصورة $0.05 لكل صورة. يبدأ إخراج الفيديو عند $0.096 في الثانية لبدقة 480p و$0.168 في الثانية لبدقة 720p.
يبدأ الإدخال من $0.40 لكل مليون رمز مطالبة لواجهة برمجة تطبيقات متعددة الوسائط طويلة السياق فعالة من حيث التكلفة.
يبدأ الإدخال من $0.30 لكل مليون رمز مطالبة للتفكير متعدد الوسائط، والترميز، وأعباء عمل الوكلاء.
يتم تسعير توليد الصور إلى ثلاثية الأبعاد لكل أصل ثلاثي الأبعاد مولد، مع مستندات للتحكم في التنسيق والدقة.
تعرض أسعار واجهة API للنماذج وتتم فوترتها بالدولار الأمريكي. قد يعرض checkout وسائل دفع محلية عندما تكون مؤهلة.
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4.1 Flash
GLM 5.3 Flash
Qwen3.8 Flash
Qwen3.8 27B
Muse Glimmer 30B
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
ميني ماكس M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 FlashمجانيThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V FlashمجانيThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 FlashمجانيThis model is free to run, so using it never draws from your weekly allowance.
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Fugu Max
Fugu Ultra v2.0
Qwen3.8 Max 0902
Muse Spark 1.3
GLM 5.3
DeepSeek V4 Pro 0813
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
كوين 3.7 بلس
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

البرمجة والنموذج الوكيلي مع سياق رمز بقيمة 1 مليون، مخرج 128 كيلوبايت، تفكير دائم التفكير بجهد منخفض أو عالي أو قصوى، بحث ويب أصلي، واستدعاء أدوات.

التحويل إلى نص إلى فيديو image-to-video مع صوت أصلي متزامن، بدقة 720p أو 1080p لمدة 3 إلى 15 ثانية، مع نسبة العرض إلى الارتفاع والتحكم في التوجيه.

نموذج فلاش متعدد الوسائط أصليا مع سياق رمز 1M، وإدخال صور وفيديو، وتفكير دائم التشغيل، وبحث ويب أصلي، واستدعاء الأدوات.

نموذج التفكير والترميز مع سياق رمز بحجم 1 مليون، مخرج 128K، جهد التفكير القابل للتعديل، البحث الأصلي على الويب، واستدعاء الأدوات.
نموذج التفكير والترميز مع سياق رمز بحجم 1 مليون، مخرج 128K، جهد التفكير القابل للتعديل، البحث الأصلي على الويب، واستدعاء الأدوات.

نموذج التفكير والترميز مع سياق رمز بحجم 1 مليون، مخرج 128K، جهد التفكير القابل للتعديل، البحث الأصلي على الويب، واستدعاء الأدوات.

Kimi K3 هو نموذج التفكير الرائد في Moonshot مع سياق رمز بقيمة 1M، وتفكير دائم التشغيل، وبحث ويب أصلي، ومدخلات نصية وصورة وفيديو (Mods).

نموذج الاستدلال الحدودي المحدث من ميتا مع 1,048,576 رمزا في السياق، والصور، والفيديو، والصوت، وفهم PDF، والبحث على الويب، واستدعاء الأدوات.

Moonshot AIInternationalتاريخ الإصدار 16 يونيو 2026السياق 256Kتوليد النصوصKimi K2.7 Code هو نموذج الترميز الوكيل من Moonshot الذي يضم تريليون معاملات، مع سياق 256 كيلوبايت، وتفكير دائم التشغيل، ومدخلات نصية وصورة وفيديو.

Kimi K2.7 Code هو نموذج الترميز الوكيل من Moonshot الذي يضم تريليون معاملات، مع سياق 256 كيلوبايت، وتفكير دائم التشغيل، ومدخلات نصية وصورة وفيديو.

نموذج التفكير الحدودي الميتا مع سياق مكون من 1,048,576 رمزا بالإضافة إلى فهم الصور والفيديو والصوت وملفات PDF، والبحث على الويب، واستدعاء الأدوات.

تم تحديث موصل الوكلاء المتعدد للاستدلال الدقيق، والترميز، والبحث، مع أقصى جهد واضح، وسياق 1 ميال، وإدخال صور، وبحث على الويب.

نموذج لغة رؤية فعال من حيث التكلفة في Qwen3.7 للنصوص، والصور، والفيديو، والترميز، واستخدام الأدوات، وفهم واجهة المستخدم الرسومية، وسير عمل السياق 1M.

نموذج لغة رؤية فعال من حيث التكلفة في Qwen3.7 للنصوص، والصور، والفيديو، والترميز، واستخدام الأدوات، وفهم واجهة المستخدم الرسومية، وسير عمل السياق 1M.

Moonshot AIInternationalتاريخ الإصدار 16 يونيو 2026السياق 256Kتوليد النصوصKimi K2.7 Code Highspeed هو المستوى الأسرع خدمة في نموذج الترميز الوكيل من Moonshot، مع سياق 256K، وتفكير دائم التشغيل، وإدخال الصور والفيديو.

موصل متعدد الوكلاء أصلي للاستدلال الصارم، والترميز، والبحث، مع سياق 1M فقط، وإدخال صورة، واستدعاء الدوال، والبحث على الويب.

Alibaba CloudSingaporeتاريخ الإصدار 15 يوليو 2026السياق 1Mتوليد النصوصنموذج لغة الرؤية السريع Qwen3.7 للنص والصورة والفيديو واستخدام الأدوات والمهام الوكالية، مع تخزين مؤقت ضمني وسياق رمز بحجم 1M.

نموذج لغة الرؤية السريع Qwen3.7 للنص والصورة والفيديو واستخدام الأدوات والمهام الوكالية، مع تخزين مؤقت ضمني وسياق رمز بحجم 1M.

ميني ماكس M3 هو نموذج استدلالي متعدد الوسائط للبرمجة، والوكلاء، وتحليل السياق الطويل باستخدام إدخال النصوص والصور والفيديو.

ميني ماكس M3 هو نموذج استدلالي متعدد الوسائط للبرمجة، والوكلاء، وتحليل السياق الطويل باستخدام إدخال النصوص والصور والفيديو.

Qwen3.7 Max هو نموذج نصي رائد للبرمجة، والإنتاجية، والوكلاء المستمرين على قيد الحياة، والتفكير العميق، والأدوات، وسياق الرمز بمليون واحد.

Qwen3.7 Max هو نموذج نصي رائد للبرمجة، والإنتاجية، والوكلاء المستمرين على قيد الحياة، والتفكير العميق، والأدوات، وسياق الرمز بمليون واحد.

نموذج رائد بحجم تريليون من وزارة الطاقة للبرمجة، ووكلاء الأفق الطويل، والعمل المهني، مع فهم للصور والفيديو عبر سياق بمليون رمز.

نموذج رائد بحجم تريليون من وزارة الطاقة للبرمجة، ووكلاء الأفق الطويل، والعمل المهني، مع فهم للصور والفيديو عبر سياق بمليون رمز.

Alibaba CloudSingaporeتاريخ الإصدار 26 أغسطس 2026السياق 1Mتوليد النصوصنموذج لغة الرؤية السريع Qwen3.8 للبرمجة، والوكلاء، والفهم البصري، مع إدخال الصور والفيديو، وخمس أدوات مدمجة، وسياق رمز بقيمة 1M فقط.

Alibaba CloudSingaporeتاريخ الإصدار 2 سبتمبر 2026السياق 1Mتوليد النصوصتم ترقية لقاط Qwen3.8 Max مع ترميز أقوى، وتشغيل وكلاء متعدد الأدوات أكثر استقرارا، ورؤية أكثر وضوحا للرسم البياني والمستند عبر سياق 1M رمز.
نموذج إنتاج الموسيقى مفتوح المصدر للصوت text-to-song والصوت الموجه بالكلمات، مع استنتاج سريع XL Turbo بثماني خطوات لتكرار الأغنية القابل للتحكم فيه.

نموذج 4B FLUX.2 Klein لتوليد وتحرير الصور مرخص من Apache مع دعم text-to-image وتحرير الصور المرجعية وسير العمل الإبداعي.

MiniMaxSingaporeتاريخ الإصدار 18 مارس 2026السياق 200Kتوليد النصوصنسخة M2.7 عالية السرعة مضبوطة على الاستدلال السريع مع أداء عام قوي وقدرات وكلاء قوية.
نموذج صوتي في الوقت الحقيقي يأخذ اتجاه التوصيل باللغة الإنجليزية البسيطة، ويحمل هوية صوتية واحدة عبر 200+ لغة، ويبث مع طوابع زمنية للكلمات.
توليف صوتي TTFB بسرعة أقل من 130 مللي ثانية مع 271+ صوتا عبر 15 لغة، وعرض تعبيري، وبث SSE في الوقت الحقيقي لوكلاء الصوت منخفضي التأخير.
توليف صوتي بجودة البث مع غنية تعبيرية، 271+ صوتا عبر 15 لغة، وبث SSE في الوقت الحقيقي مع طوابع زمنية لكل كلمة.
نموذج التفكير الذكاء الاصطناعي طويل السياق من Zhipu مع سياق 202K، وإخراج 128K، واستدعاء الأدوات، والمخرجات المنظمة، ودعم الكاش.

Kimi K2.6 هو نموذج استدلال متعدد الوسائط من Moonshot مع سياق 256K، وترميز قوي، ومدخلات نصية وصورة وفيديو.

DeepSeekGermanyتاريخ الإصدار 31 يوليو 2026السياق 1Mتوليد النصوصإصدار 0731 بعد التدريب مع مكاسب كبيرة في البرمجة، والعمل في المستودعات، واستخدام الأدوات، ومهام التكديس الكامل، بالإضافة إلى نافذة سياق لمدة 1 مليون.

DeepSeekUnited Statesتاريخ الإصدار 31 يوليو 2026السياق 1Mتوليد النصوصإصدار 0731 بعد التدريب مع مكاسب كبيرة في البرمجة، والعمل في المستودعات، واستخدام الأدوات، ومهام التكديس الكامل، بالإضافة إلى نافذة سياق لمدة 1 مليون.
تولد أغاني ستيريو كاملة من كلمات الأغاني وطلب الأسلوب، مع تحكم في المدة والبذور والصيغة حتى 5 دقائق.

DeepSeekSingaporeتاريخ الإصدار 13 أغسطس 2026السياق 1Mتوليد النصوصالإصدار الرسمي ل 0813 Pro مع مكاسب كبيرة في البرمجة، والعمل في المستودعات، واستخدام الأدوات، ومهام الوكلاء، بالإضافة إلى التفكير الهجين ونافذة سياق لمدة 1 مليون.

نموذج التفكير الوكيلي طويل الأفق من ميتا مع سياق وفهم للصور، الفيديو، وملفات PDF، والبحث على الويب، واستدعاء الأدوات يضم 1,048,576 رمزا.
توليف صوتي في الوقت الحقيقي يعتمد على تأخير الكمون، يحمل هوية صوتية واحدة عبر 200+ لغة، ومصمم لأعباء العمل عالية الحجم في البث.

DeepSeekSingaporeتاريخ الإصدار 10 سبتمبر 2026السياق 1Mتوليد النصوصالنموذج الرائد خفيف الوزن لمعمارية DeepSeek الجديدة مع فهم للصور الأصلية، والتفكير الهجين، وسياق 1 مليون، ورموز إخراج تصل إلى 384 كيلوبايت.

MiniMax M2.7 هو نموذج دردشة للاستدلال عام الغرض مع التفكير المتداخل، واستدعاء الوظائف، والتخزين المؤقت للطلبات.
نموذج TRELLIS.2 من الصورة إلى ثلاثية الأبعاد يحول صورة مرجعية إلى أصل GLB مملموس مع دقة، وبذرة، وشبكة، وملمس، وتحكم في التصدير.

Alibaba CloudChinaتاريخ الإصدار 24 فبراير 2026السياق 256Kتوليد النصوصQwen3.5 122B-A10B هو نموذج استدلال متعدد الوسائط مع سياق 256K، واستدلال MoE متفرق وفعال، ومدخلات نصية وصورة وفيديو.

Alibaba CloudChinaتاريخ الإصدار 16 فبراير 2026السياق 256Kتوليد النصوصQwen3.5 397B-A17B هو نموذج استدلالي متعدد الوسائط رائد للغة، والشيفرة، والوكلاء، ومهام واجهة الرسوم، وفهم الصور والفيديو.

Alibaba CloudChinaتاريخ الإصدار 24 فبراير 2026السياق 256Kتوليد النصوصQwen3.5 35B-A3B هو نموذج لغة رؤية أصلي فعال مع توجيه MoE متفرق، والتفكير العميق، وإدخال النصوص والصور والفيديو.

Qwen3.5 27B هو نموذج استدلال متعدد الوسائط كثيف مع استجابات سريعة، وسياق 256K، وفهم للنصوص والصور والفيديو.

مستدل متعدد الوسائط مع سياق 256K، وإدخال صور وفيديو، وأدوات وظيفية، وJSON منظم، وتفكير افتراضي.

يحسن Qwen3.6 27B الترميز الوكيل، والتفكير في STEM، والرؤية المكانية، والحرمان البصري الضوئي (OCR)، وفهم النصوص والصور والفيديو على سياق 256K.

Alibaba CloudSingaporeتاريخ الإصدار 16 أبريل 2026السياق 1Mتوليد النصوصنموذج لغة الرؤية السريع Qwen3.6 للبرمجة الوكالية، والتفكير الرياضي، والفهم المكاني، والحرج الضوئي (OCR)، وإدخال النص والصورة والفيديو.

نموذج لغة الرؤية السريع Qwen3.6 للبرمجة الوكالية، والتفكير الرياضي، والفهم المكاني، والحرج الضوئي (OCR)، وإدخال النص والصورة والفيديو.

Gemma 4 26B A4B هو نموذج متعدد الوسائط مفتوح من Google مزود بمدخلات وسياق ونص وصور وفيديو 256K، وأدوات، ومخرجات منظمة.

نموذج وكيل مفتوح 30B ميتا مع فهم للصور، وسياق 128K، واستدعاء الأدوات، ومخرجات منظمة، وقوة استدلال يمكن التحكم فيه.

Qwen3.5 9B هو نموذج استدلال متعدد الوسائط مضغوط يحتوي على سياق، مدخل صور وفيديو، وأدوات دوال 256K، ومخرج منظم.

Qwen3.5 4B هو نموذج استدلال متعدد الوسائط منخفض التكلفة مع 256K سياق، ومدخلات صور وفيديو، وأدوات وظيفية، ومخرجات منظمة.

Qwen3.6 35B A3B هو نموذج استدلال mixture-of-experts مكون من 256 خبير مع سياق 128K وأدوات دوال ومخرجات JSON منظمة صارمة.

نموذج نص خفيف الوزن GLM-4.7 مجاني للبرمجة، والتفكير، والكتابة طويلة السياق، والدردشة العامة.

نموذج نصي خفيف الوزن مجاني GLM-4.5 للتفكير، البرمجة، الدردشة الطويلة، ومهام اللغة العامة.

نموذج GLM-4.6V متعدد الوسائط مجاني لفهم الصور والفيديو والملفات والنصوص مع استدعاء الدوال الأصلية.

إنشاء الصور وتحريرها في نموذج إنشاء وتعديل الصور من مدخلات نصية أو صورية، مع التحكم في الرسم الداخلي، والتجربة الافتراضية، والتحكم في الأسلوب.

نموذج توليد الفيديو ينتج فيديوهات متعددة اللقطات تصل إلى دقيقتين من النص وتوجيهات الصور الاختيارية مع جودة وثبات محسنين.

نسخ الكلام إلى نص باستخدام نموذج Nova-3 مع دعم متعدد اللغات وإعدادات متقدمة قابلة للتخصيص لأعباء العمل الإنتاجية.

يجمع بين DeepSeek R1 chain-of-thought المنطق مع إنثروبيك كلود الإبداعي وتوليد الشيفرة خلف واجهة موحدة تتحكم بها البيانات.

نموذج اللغة الكبير المفتوح المصدر Mix-of-Experts مصمم خصيصا لمهام التفكير والبرمجة واللغة العامة عالية الكفاءة عبر المحفزات الطويلة.

نموذج MoE خفيف الوزن بإجمالي 284 مليار / 13 مليار معلمة نشطة وسياق أصلي 1M، مضبوط للاستخدام منخفض التأخير وفعال من حيث التكلفة وعالي التزامن.

نموذج MoE خفيف الوزن بإجمالي 284 مليار / 13 مليار معلمة نشطة وسياق أصلي 1M، مضبوط للاستخدام منخفض التأخير وفعال من حيث التكلفة وعالي التزامن.

نموذج MoE خفيف الوزن بإجمالي 284 مليار / 13 مليار معلمة نشطة وسياق أصلي 1M، مضبوط للاستخدام منخفض التأخير وفعال من حيث التكلفة وعالي التزامن.

DeepSeekUnited Statesتاريخ الإصدار 24 أبريل 2026السياق 1Mتوليد النصوصنموذج MoE خفيف الوزن بإجمالي 284 مليار / 13 مليار معلمة نشطة وسياق أصلي 1M، مضبوط للاستخدام منخفض التأخير وفعال من حيث التكلفة وعالي التزامن.

نموذج اللغة الكبير لوزارة السحر مع 1.6 تسانا إجمالا / 49 مليار معلمة نشطة وسياق أصلي بحجم 1M للرياضيات المتقدمة، والاستدلال المنطقي، والترميز المتخصص.

نموذج اللغة الكبير لوزارة السحر مع 1.6 تسانا إجمالا / 49 مليار معلمة نشطة وسياق أصلي بحجم 1M للرياضيات المتقدمة، والاستدلال المنطقي، والترميز المتخصص.

نموذج اللغة الكبير لوزارة السحر مع 1.6 تسانا إجمالا / 49 مليار معلمة نشطة وسياق أصلي بحجم 1M للرياضيات المتقدمة، والاستدلال المنطقي، والترميز المتخصص.

DeepSeekUnited Statesتاريخ الإصدار 24 أبريل 2026السياق 1Mتوليد النصوصنموذج اللغة الكبير لوزارة السحر مع 1.6 تسانا إجمالا / 49 مليار معلمة نشطة وسياق أصلي بحجم 1M للرياضيات المتقدمة، والاستدلال المنطقي، والترميز المتخصص.

إجابة سريعة على طريقة نموذج اللغة الكبيرة على سؤال بلغة طبيعية، مستندة إلى نتائج بحث Exa الجديدة على الويب مع استشهادات وروابط مصادر.

محرك بحث ويب للعثور على الصفحات، واسترجاع الصفحات المشابهة، والزحف، والبحث المخصص في الكود عبر الويب المفتوح لعملاء الذكاء الاصطناعي.

text-to-speech منخفض التأخير مع أصوات مكبرات صوت واحدة ومتعددة وأسلوب ولهجة ونبرة تعبيرية قابلة للتحكم في تطبيقات الإنتاج.

معاينة TTS عالية الجودة للبودكاست، والكتب الصوتية، ودعم العملاء، مع أصوات معبرة متعددة مكبرات الصوت عبر 23+ لغة.

TTS قابل للتحكم بدرجة عالية مع علامات صوتية جديدة لأسلوب دقيق، ونبرة، وسرعة، وأداء عبر السرد والمساعدين وتطبيقات الصوت.

نموذج لغة رؤية مفتوح المصدر مع سياق 128K، و140+ لغة، وmath/reasoning محسنة، ومخرجات منظمة، واستدعاء للوظائف.

text-to-speech مبنية على نماذج اللغة الكبيرة مع استنساخ صوتي بدون لقطة من 3 إلى 10 ثوان من الصوت وإخراج قابل للتحكم في التعبير عن المشاعر عبر التعلم المعزز متعدد المكافآت.

كاشف التعلم العميق الذي يحدد أجزاء من النص التي من المحتمل أن يكون مولدا بواسطة الذكاء الاصطناعي مقابل الإنسان، ويصنف المحتوى إلى إنسان بالكامل، أو ذكاء اصطناعي، أو مختلط.

نموذج الفيديو يقدم أوضاع تحويل النص إلى فيديو، الصورة إلى فيديو، المرجع إلى الفيديو، وتحرير الفيديو مع إخراج عالي الدقة وسلس الحركة.

نموذج text-to-image مفتوح المصدر على بنية متعددة الوسائط مزيج من الخبراء مع تفاصيل فوتوغرافية واقعية وعرض نصوص قوي متعدد اللغات.
نموذج فيديو بمعاملة 8.3 مليار مع إخراج أصلي 720p (قابل للترقية إلى 1080p)، وتماسك حركتي قوي، وفهم للأوامر ثنائية اللغة حتى 10 ثوان.

إطار عمل ذاتي الانحدار على نموذج Janus Pro 7B الذي يوحد الفهم متعدد الوسائط وتوليد الصور في بنية واحدة.

نموذج الفيديو في أوضاع Standard أو Pro مع التحويل من النص إلى الفيديو، الصورة إلى الفيديو، المرجع إلى الفيديو، التحرير، الصوت الأصلي، والانتقالات متعددة المشاهد.

نموذج Kling 3.0 الذي ينقل الحركة من فيديو مرجعي إلى شخصية من صورة مرجعية، مع مستويات قياسية 720p وPro 1080p.

بحث ذكاء اصطناعي تكراري يستمر في الاستعلام عندما تكون النتائج الأولية غير كافية، مما يعيد إجابات أكثر شمولا من الوضع القياسي.

بحث ويب مدعوم بالذكاء الاصطناعي مع نظرة عامة وإجابات مفصلة أسرع من البحث العميق. يحتل المرتبة #1 في اختبار OpenAI SimpleQA.

نموذج متعدد الوسائط ب24 مليار معامل مع سياق 128K لتحليل الصور، البرمجة، الرياضيات، والمهام متعددة اللغات، ومضبوط لاستنتاج محلي فعال.

النموذج الهجين الذي يوحد عائلات التعليم، الاستدلال (الماجسترال)، والديفسترال: وقت إكمال أقل بنسبة 40٪ ومعدل إنتاجية 3 أضعاف مقارنة ب Small 3.

نموذج أساس MoE مفتوح المصدر 32B ينتج فيديو وصوتيا متزامنين في خطوة استدلالية واحدة مع مزامنة شفاه دقيقة مزدوجة البرج.

نموذج أساس متعدد الوسائط منخفض التكلفة للنص والصور والفيديو على سياق 300K (حتى ~30 دقيقة فيديو)، مضبوط للسرعة والأسعار المعقولة.

نموذج استدلالي متعدد الوسائط سريع وفعال من حيث التكلفة للنصوص، والصور، والوثائق، والفيديو على سياق مدته 1M (وثائق طويلة ومقاطع ~90 دقيقة).

نموذج الأساس النصي فقط مضبوط لتأخير وتكلفة منخفضة جدا على سياق 128K. قوي للتلخيص والترجمة والدردشة مع خصم 44٪ على الكاش.

نموذج الأساس متعدد الوسائط يوازن بين الدقة والسرعة والتكلفة للنص والصور والفيديو على سياق 300K (حتى ~30 دقيقة فيديو).

كان Whisper-1 speech-to-text النسخ، مدربا على صوت متعدد اللغات تحت إشراف، مع حد رفع 25 ميجابايت لكل ملف.

بحث مؤسسي مدعوم بمنطق كلود أوبوس 4.6، مع أقصى عمق، وتحسين الوصول إلى الأدوات، وتغطية واسعة للمصادر.

نموذج بحثي لاسترجاع متعدد الخطوات، والتركيب، والتفكير، مع البحث الذاتي، والقراءة والتقييم الذاتية للمصادر عبر مواضيع معقدة.

سونار برو كباحث وكيل: يقوم بسلسلة عمليات البحث على الويب، وجلب الصفحات الكاملة، وبث الاستدلال الحي، مع تكييف الاستراتيجية للاستعلامات المعقدة.

بحث في الوقت الحقيقي على الويب مع تصفية حسب المجال، اللغة، التاريخ، والمزيد. يعيد نتائج البحث، وليس ردود نماذج اللغة الكبيرة (LLM); لا رفع ملفات.

بحث متصل بالويب في الوقت الحقيقي مع استشهادات دقيقة ومصادر قابلة للتخصيص لتكامل البحث up-to-date الذكي في تطبيقات الإنتاج.

نموذج قائم على البحث مع ضعف عدد الاستشهادات ونافذة سياق أكبر، مضبوط للاستفسارات المعقدة التي تحتاج إلى إجابات معمقة ودقيقة.

نموذج التفكير على R1-1776 مفتوح المصدر غير خاضع للرقابة مع البحث على الويب، متفوقا على محركات البحث الرائدة ونماذج اللغة الكبيرة في معيار SimpleQA.

توليد الفيديو السينمائي في أوضاع تحويل النص إلى فيديو، الصورة إلى الفيديو، والانتقال مع تفاصيل عالية، حركة سلسة، ورسوم متحركة واقعية.

يولد فيديوهات من نص أو من صور 1-2 إطار حتى 1080p، نسب عرض إلى ارتفاع متعددة، مدة 5-10 ثوان، مع خيار الصوت المتزامن.

نموذج موحد لتوليد وتحرير الصور مع عرض نص معقد Chinese/English رائد الفئة، وقوام واقعي، ودمج صور متعددة.

توليد وتحرير الصور من Qwen باستخدام نسخ Base وPro، والطباعة متعددة اللغات، ومراجع متعددة الصور، ومخرج قابل للتحكم ب 1K أو 2K.

Alibaba CloudSingaporeتاريخ الإصدار 24 فبراير 2026السياق 1Mتوليد النصوصنموذج الرؤية واللغة مع تركيز خطي هجين بالإضافة إلى MoE متفرق، وسياق 1M سياق، واستنتاج text/image/فيديو متعدد الوسائط سريع.

نموذج الرؤية واللغة مع تركيز خطي هجين بالإضافة إلى MoE متفرق، وسياق 1M سياق، واستنتاج text/image/فيديو متعدد الوسائط سريع.

Alibaba CloudSingaporeتاريخ الإصدار 30 مارس 2026السياق 256Kتوليد النصوصنموذج متعدد الوسائط وفعال من حيث التكلفة يتعامل مع النص والصورة والصوت والفيديو، مع ما يصل إلى 3 ساعات من الصوت وساعة واحدة من الفيديو عبر 90+ لغة.

Alibaba CloudSingaporeتاريخ الإصدار 30 مارس 2026السياق 256Kتوليد النصوصالنموذج الرائد متعدد الوسائط للنص والصورة والصوت والفيديو. صوت 3H، فيديو 1H، 90+ مدخل و30+ لغة إخراج، 55 صوت صوتي.

Alibaba CloudSingaporeتاريخ الإصدار 16 فبراير 2026السياق 1Mتوليد النصوصنموذج متعدد الوسائط مع هندسة هجينة للتفكير العميق الفعال والفهم البصري عبر النص والصورة والفيديو على سياق 1 مليون.

نموذج متعدد الوسائط مع هندسة هجينة للتفكير العميق الفعال والفهم البصري عبر النص والصورة والفيديو على سياق 1 مليون.

Alibaba CloudSingaporeتاريخ الإصدار 20 أبريل 2026السياق 256Kتوليد النصوصأكبر نسخة معاينة في سلسلة 3.6 (نصية فقط): تحسين تنفيذ وكيل البرمجة، مهارات واجهة أمامية أقوى، ومعرفة أوسع بالذيل الطويل.

نموذج لغة الرؤية مع ترقيات كبيرة على الإصدار 3.5: الترميز الوكيل والواجهة الأمامية، التعرف متعدد الوسائط، التعرف الضوئي على الحرار، وتحديد موقع الكائنات.

نموذج لغة الرؤية مع ترقيات كبيرة على الإصدار 3.5: الترميز الوكيل والواجهة الأمامية، التعرف متعدد الوسائط، التعرف الضوئي على الحرار، وتحديد موقع الكائنات.

رائد في سياق 256K مع تحسينات كبيرة في التفكير، واتباع التعليمات، والدعم متعدد اللغات، بالإضافة إلى دقة coding/math أعلى.

Alibaba CloudSingaporeتاريخ الإصدار 5 سبتمبر 2025السياق 256Kتوليد النصوصإصدار المعاينة مع مكاسب كبيرة مقارنة بسلسلة 2.5 في الفهم الصيني-الإنجليزي، والتعليمات المعقدة، والقدرة على تعدد اللغات، واستخدام الأدوات.

Alibaba CloudSingaporeتاريخ الإصدار 23 سبتمبر 2025السياق 256Kتوليد النصوصنموذج الاستدلال باستخدام أداة تكيفية (بحث، ذاكرة، مفسر شيفرة) وتوسيع وقت الاختبار لزيادة الدقة في المهام المعقدة.

Alibaba CloudSingaporeتاريخ الإصدار 5 يونيو 2025السياق 4Kالمعادون الترتيبإعادة ترتيب المستندات الدلالية. يرتب حتى 500 مرشح لكل استعلام حسب الصلة، ويدعم 100+ لغة، ويقبل تعليمات فرز مخصصة.

نموذج 256K السياق المضبوط بالبرمجة مع نتائج قوية في الواجهة الأمامية ودعم البرمجة متعددة اللغات لأدوات ووكلاء البرمجة بالذكاء الاصطناعي.

نموذج متوازن للأغراض العامة لأعباء العمل عالية التردد في المؤسسات: معالجة المعلومات، المحتوى، البحث، وتحليل البيانات.

نموذج متعدد الوسائط يركز على الكمون مع سياق 256 كيلوبايت، وأربعة أوضاع جهد استدلالية، وفهم image/video للاستخدام عالي التزامن.

نموذج عام رائد مع سياق 256K للتفكير المعقد، والفهم متعدد الوسائط، والتوليد المنظم، والتنفيذ المعزز بالأدوات.

نسخة فيديو 2.0 محسنة للسرعة للمقاطع السينمائية مع مزامنة صوتية أصلية، وتحكم بالكاميرا، وحركة مستقرة بتكلفة أقل لكل عرض.

نموذج فيديو متعدد الوسائط لإخراج سينمائي من مدخلات نصية أو صورة أو صوت أو فيديو، مع حركة مستقرة وحروف متسقة.

نموذج صورة متعدد الوسائط موحد يستعرض التعليمات قبل العرض، مما ينتج تعديلات عالية الدقة ومتسقة ورسومات للعلامة التجارية.

نموذج صور Seedream المميز الذي يقسم صورة واحدة إلى طبقات قابلة للتعديل، ويعدل بواسطة إحداثيات أو علامة تخطيط، ويدمج حتى 10 مراجع.

نموذج صوتي مفتوح المصدر لحوارات بودكاست طويلة الشكل متعددة مكبرات الصوت مع تحكم شبه لغوي (ضحك، تنهدات) واستنساخ صوتي بدون فرصة.

يولد صوتا يصل إلى 3 دقائق من التعليمات النصية، ويدعم text-to-audio وaudio-to-audio مع إمكانية تعديل المدة، والخطوات، ومقياس CFG.

الصوت to-3-minute النص مع text-to-audio وaudio-to-audio وطلاء صوتي لإنتاج الموسيقى، تصميم الصوت، وإعادة المزج.

Stable Video Infinity 2.0 Pro على WAN 2.2: يمدد الصور الثابتة إلى فيديو نظري لا نهائي الطول مع الحفاظ على معرفات الأحرف الثابتة.

مساعد بحث متعدد البحث يستكشف موضوعا، يحلل المصادر، وينتج تقريرا بحثيا مفصلا مع الاستشهادات.

البحث على الويب مع الزحف والاستخراج ورسم خرائط الروابط لاسترجاع سريع ومنظم عبر الصفحات والنطاقات لخطوط الأنابيب اللاحقة.

Alibaba CloudSingaporeتاريخ الإصدار 4 يونيو 2025السياق 8Kالتضميناتتضمين نص متعدد اللغات مع أبعاد إخراج قابلة للاختيار (64–2048). حتى 8,192 رمزا لكل إدخال.

Alibaba CloudSingaporeتاريخ الإصدار 23 سبتمبر 2025السياق 1Kالتضميناتتضمين متعدد الوسائط محسن للسرعة، نفس شكل Vision-Plus، 3× رموز image/video أرخص.

Alibaba CloudSingaporeتاريخ الإصدار 23 سبتمبر 2025السياق 1Kالتضميناتالتضمين متعدد الوسائط ينتج متجهات مستقلة لمدخلات النص والصورة والفيديو.

نموذج توليد الفيديو متعدد الوسائط للقصص السينمائية متعددة اللقطات مع التزامن الصوتي والبصري الأصلي (مزامنة الشفاه، الحوار، الموسيقى، المؤثرات الصوتية).

نموذج فيديو متعدد الوسائط يدعم T2V وI2V وتحرير الفيديو وreference-to-video، مع إخراج عالي الدقة من مدخلات النص أو الصورة أو الفيديو.

نموذج المرافق لتوليد الصور وتحريرها: text-to-image، وتعديلات الصناديق المحدودة، ومجموعات صور متماسكة، مع إخراج يصل إلى 4K على Pro.
نسخ Whisper Large v3 Turbo متحكم به مع ASR متعدد اللغات، ترجمة، VAD، طوابع زمنية، ترجمة، كلمات ساخنة، وضوابط فك الترميز.

وكيل ذكاء اصطناعي مستقل يحول تنبيها عالي المستوى إلى مهام فرعية، يستدعي الأدوات وواجهات برمجة التطبيقات، ويحقق نتائج end-to-end دون تنسيق يدوي.

التحويل إلى نص إلى فيديو، image-to-video، وتوليد reference-to-video مع ما يصل إلى سبع صور مرجعية لأحرف متسقة، حتى 15 ثانية بدقة 1080p.

نموذج من الدرجة الأولى لسير العمل الوكالتي، وهندسة البرمجيات المعقدة، والمهام البعيدة، ويستمر في العمل عبر 1000+ استدعاء أدوات في سياق مليون واحد.

نموذج متعدد الوسائط مع فهم بصري وصوتي أصلي على سياق 1 ميلي، مصمم للتفكير والعمل عبر الأساليب في سير العمل الوكيلي.

النص، والصورة، وreference-to-video في نموذج واحد. حركة سينمائية، اتساق الشخصيات عبر ما يصل إلى 9 مراجع، وصوت متزامن محلي.

أسرع وأرخص مستوى Seedance 2.0 للمقاطع السينمائية القصيرة مع صوت وتحكم بالكاميرا ومدخلات صوت أو فيديو أصلية بدقة 480p و720p.

StepFunInternationalتاريخ الإصدار 28 مايو 2026السياق 256Kتوليد النصوصنموذج التفكير متعدد الوسائط من StepFun مع إدخال الصور والفيديو، استدعاء الأدوات، جهد التفكير القابل للتعديل، وسياق 256K.

StepFunInternationalتاريخ الإصدار 12 فبراير 2026السياق 256Kتوليد النصوصنموذج التفكير النصي StepFun للوكلاء، والترميز، واستدعاء الأدوات، والتحليل طويل السياق.

StepFunInternationalتاريخ الإصدار 2 أبريل 2026السياق 256Kتوليد النصوصنسخة فلاش 3.5 المحسنة للوكيل مع أوضاع جهد منطقي منخفض وعالي.

نموذج StepFun للصوت والنصوص مع إخراج النص والفهم اللالغوي.

نموذج توليد الصور وتحرير الصور من StepFun لتحرير الصور text-to-image وصورة واحدة.

نموذج StepFun السياقي text-to-speech مع توجيه صوتي باللغة الطبيعية وأداء تعبيري.

نموذج StepFun text-to-speech مع أصوات رسمية، أصوات مستنسخة مخصصة، وتحكم في علامات الصوت.

نموذج التعرف على الكلام من StepFun للبث الصوتي الصيني والإنجليزي.

الجيل القادم من الترميز ونموذج الوكيل مع تسليم برمجيات هندسية، واستقلالية بعيدة الأفق، وفهم متعدد الوسائط بسعة 256 كيلوبايت.

تركيب الكلام الطبقي مع أكثر من 1000 صوت، 16 لغة، 20 لهجة صينية، توجيه للتعبير باللغة الطبيعية، وعلامات المشاعر الداخلية.

يولد مقاطع تتراوح مدتها من 4 إلى 15 ثانية بدقة تصل إلى 2K مع صوت ستيريو الأصلي، متبعا الإشارات النصية والصورة والفيديو والصوت في طلب واحد.

نموذج الصور الرائد من OpenAI يتميز بدقة عالية للمطالبات، وعرض نص واضح، وتحرير قائم على التعليمات عبر ما يصل إلى 16 صورة مرجعية.

مولد فيديو Kling 3.0 من Kuaisho مع text-to-video وأول وآخر image-to-video إطار، وصوت أصلي، ومخرج 720p أو 1080p أو 4K.

نموذج فيديو وان 2.5 من علي بابا مع text-to-video وimage-to-video، وصوت أصلي، ومسارات صوتية مخصصة اختيارية، ومخرج من 480p إلى 1080p.

عائلة فيديو وان 2.2 من علي بابا مع مستويات قياسية وفلاش، واستيفاء أول وأخير، وإخراج 480p إلى 1080p بتكلفة منخفضة.

نموذج فيديو وان 2.1 من علي بابا مع طبقة توربو وطبقات إضافية لمقاطع الإطارات text-to-video وimage-to-video وأول وآخر إطارات بدقة 480p أو 720p.

نموذج صورة وان 2.5 من علي بابا مع تحرير text-to-image ومتعدد المراجع يصل إلى 3 صور بسرعة حوالي 1.7 ميجابكسل.

نموذج text-to-image وان 2.2 من علي بابا مع مستويات بلس وفلاش ومخرج يصل إلى 1440x1440 بسعر منخفض لكل صورة.

نموذج وان 2.1 من علي بابا text-to-image مع طبقات توربو وطبقات بلس ومخرج يصل إلى 1440x1440 بسعر منخفض لكل صورة.

نموذج فيديو طويل الشكل للمقاطع المتماسكة حتى 30 ثانية، مع ما يصل إلى 50 صورة مرجعية، فيديو، ومقطع صوتي، وصوت أصلي، وتحرير، وتمديد.

التحويل من النص إلى صورة بالإضافة إلى تحرير متعدد المراجع مع ما يصل إلى خمس صور مصدر، ومستويات جودة تلقائية أو مثبتة، ودقة إخراج 1K أو 2K.

يولد الفيديو من النص، الصور، الإطارات الأولى والأخيرة، أو حتى سبعة مراجع، مع صوت أصلي، وقصات متعددة اللقطات، وامتداد المقطع.

نموذج فيديو سينمائي لأعمال الحركة والمؤثرات، من النص أو الصور أو الإطارات الأولى والأخيرة أو المراجع، مع صوت متزامن أصلي.

يربط حركة الفم في فيديو موجود مع مسار صوتي مرفوع أو مع نص ينطق به أحد أربعة عشر صوتا مدمجا.
يحول صورة واحدة إلى فيديو أفاتار يتكلم، مدفوع بمسار صوتي مرفوع أو نص منطوق بصوت مدمج.

ستة تحويلات فيديو في نموذج واحد: تحرير التوجيه، إعادة التصميم، تبديل الموضوع، نقل الحركة، رفع التكبير، والمؤثرات الصوتية المولدة.

توليد صوتي ومرئي مشترك مع مزامنة شفاه بميلي ثانية، حوار بست لغات، حركات كاميرا سينمائية، وإخراج حتى 1080p.

إنشاء وتحرير صور عالية الدقة مع ما يصل إلى 14 صورة مرجعية، وعرض نص قوي، وإخراج 2K أو 4K بسعر ثابت واحد.

توليد وتحرير موحد للصور مع ما يصل إلى 14 صورة مرجعية، مجموعات دفعية تصل إلى 15، وإخراج 1K إلى 4K بسعر ثابت واحد لكل صورة.

محرك Rodin Gen-2 الذي يحول موجه نصي أو حتى خمس صور مرجعية إلى أصول ثلاثية الأبعاد إنتاجية باستخدام مواد PBR وشبكات رباعية أو خام.

صورة تركز على الإنتاج مع خامات واعية للبنية، ومستويات دقة 1536 و1536 Pro، ودمج ما يصل إلى مليوني وجه، وخمس صيغ تصدير.

ByteDanceMalaysiaتاريخ الإصدار 28 يونيو 2025السياق 8Kالتضميناتتضمين متعدد الوسائط يدمج النص والصور والفيديو في متجه بعد واحد 1024 أو 2048 للبحث والاسترجاع عبر الوسائط.

إنتاج فيديو شامل لمدة تصل إلى 30 ثانية مع صوت أصلي، مراجع متعددة الوسائط (صور، فيديو، صوت، ملفات، روابط ويب)، ومستوى Prime سريع.

موصل متعدد الوكلاء وفعال من حيث التكلفة يجمع فريقا خبراء بالحجم المناسب لكل مهمة، مع 1 مليون سياق، وإدخال صور، وبحث على الويب.

موصل رائد متعدد الوكلاء لأصعب أعمال التفكير، والترميز، والبحث، مع 1M سياق، وإدخال صور، وبحث على الويب.
163 / 182 النماذج