
GLM 5.3
Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.
تصفح الكتالوج الكامل للنماذج عبر النصوص، والصور، والصوت، والفيديو، وثلاثي الأبعاد، والمزيد.
كتالوج النماذج
تصفح النصوص والصور والفيديو والصوت وثلاثي الأبعاد، والبحث، ونقاط نهاية الوكلاء بأسعار pay-as-you-go. يقوم الكتالوج التفاعلي بتحميل التوفر الحالي من EmpirioLabs، وهذه المستندات النموذجية قابلة للزحف بدون جافا سكريبت من العميل.
image-to-video xAI بحركة موجهة بالطلب، وصوت أصلي، ومخرج 480p أو 720p، ومقاطع تصل إلى 15 ثانية.
توليد الفيديو متعدد الوسائط للمقاطع السينمائية من مدخلات نصية أو صورة أو صوت أو فيديو.
توليد وتحرير موحد للصور لصور إبداعية عالية الدقة وعلامات تجارية ومنتجات.
نموذج لغة رؤية فعال من حيث التكلفة للنصوص، والصور، والفيديو، والبرمجة، والأدوات، وسير العمل في سياق 1M.
نموذج رائد طويل السياق للبرمجة، والإنتاجية، والوكلاء المستمرين على الطويل، والتفكير العميق، واستخدام الأدوات.
التفكير متعدد الوسائط للبرمجة، والوكلاء، وتحليل السياق الطويل، ومدخلات النصوص والصور والفيديو.
التفكير المتعدد الوسائط من Moonshot مع دعم قوي للبرمجة، وسياق 256K، وإدخال الصور والفيديو.
التفكير طويل السياق مع استدعاء الأدوات، الإخراج الهيكلي، دعم ذاكرة التخزين المؤقت، وإخراج 128K.
توليد الصورة إلى ثلاثي الأبعاد يحول صورة مرجعية إلى أصل GLB ملمس.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Alibaba CloudMultimodal reasoner with 256K context, image and video input, function tools, structured JSON, and thinking on by default.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

DeepSeekOfficial 0813 Pro release with major gains across coding, repository work, tool use, and agent tasks, plus hybrid thinking and a 1M context window.
Text-to-image plus multi-reference editing with up to three source images, selectable quality tiers, and 1K or 2K output resolution.

Meta AIنموذج وكيل مفتوح 30B ميتا مع فهم للصور، وسياق 128K، واستدعاء الأدوات، ومخرجات منظمة، وقوة استدلال يمكن التحكم فيه.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Z.aiنموذج التفكير والترميز مع سياق رمز بحجم 1 مليون، مخرج 128K، جهد التفكير القابل للتعديل، البحث الأصلي على الويب، واستدعاء الأدوات.

Moonshot AI(كيمي كي 3) هي نموذج (مونشوت) العقلي الرئيسي بسياق واحد أمتار، التفكير دائماً، البحث الوطني على الإنترنت، والنص، والصورة، ومدخلات الفيديو.

Meta AIنموذج (ميتا) المُحدّث للتبرّر الحدوديّ بسياق مكوّن من 048، 576 1، صورة، فيديو، سمعية،

Moonshot AIKimi K2.7 Code هو نموذج الترميز الوكيل من Moonshot الذي يضم تريليون معاملات، مع سياق 256 كيلوبايت، وتفكير دائم التشغيل، ومدخلات نصية وصورة وفيديو.

Meta AIMeta Border reasoning model with a 048,576-token context plus image, video, audio, and PDF understanding, web search, and tool calling.

Black Forest Labsنموذج 4B FLUX.2 Klein لتوليد وتحرير الصور مرخص من Apache مع دعم text-to-image وتحرير الصور المرجعية وسير العمل الإبداعي.

Amazonإنشاء الصور وتحريرها في نموذج إنشاء وتعديل الصور من مدخلات نصية أو صورية، مع التحكم في الرسم الداخلي، والتجربة الافتراضية، والتحكم في الأسلوب.

Tencentنموذج text-to-image مفتوح المصدر على بنية متعددة الوسائط مزيج من الخبراء مع تفاصيل فوتوغرافية واقعية وعرض نصوص قوي متعدد اللغات.

DeepSeekإطار عمل ذاتي الانحدار على نموذج Janus Pro 7B الذي يوحد الفهم متعدد الوسائط وتوليد الصور في بنية واحدة.

Alibaba Cloudنموذج موحد لتوليد وتحرير الصور مع عرض نص معقد Chinese/English رائد الفئة، وقوام واقعي، ودمج صور متعددة.

Alibaba Cloud:: توليد الصور والتحرير مع متغيرات القاعدة والبرو، والطباعة المتعددة اللغات، والإشارات المتعددة الأهداف، والناتج الذي يمكن التحكم فيه من 1K أو 2K.

Kling AIالتحويل إلى نص إلى فيديو image-to-video مع صوت أصلي متزامن، بدقة 720p أو 1080p لمدة 3 إلى 15 ثانية، مع نسبة العرض إلى الارتفاع والتحكم في التوجيه.

Amazonنموذج توليد الفيديو ينتج فيديوهات متعددة اللقطات تصل إلى دقيقتين من النص وتوجيهات الصور الاختيارية مع جودة وثبات محسنين.

Alibaba Cloudنموذج الفيديو يقدم أوضاع تحويل النص إلى فيديو، الصورة إلى فيديو، المرجع إلى الفيديو، وتحرير الفيديو مع إخراج عالي الدقة وسلس الحركة.

Tencentنموذج فيديو بمعاملة 8.3 مليار مع إخراج أصلي 720p (قابل للترقية إلى 1080p)، وتماسك حركتي قوي، وفهم للأوامر ثنائية اللغة حتى 10 ثوان.

Kling AIنموذج الفيديو في أوضاع Standard أو Pro مع التحويل من النص إلى الفيديو، الصورة إلى الفيديو، المرجع إلى الفيديو، التحرير، الصوت الأصلي، والانتقالات متعددة المشاهد.

Kling AIنموذج Kling 3.0 الذي ينقل الحركة من فيديو مرجعي إلى شخصية من صورة مرجعية، مع مستويات قياسية 720p وPro 1080p.

ACE-Stepنموذج إنتاج الموسيقى مفتوح المصدر للصوت text-to-song والصوت الموجه بالكلمات، مع استنتاج سريع XL Turbo بثماني خطوات لتكرار الأغنية القابل للتحكم فيه.

Inworldنموذج صوتي في الوقت الحقيقي مع توجيه صوتي باللغة الإنجليزية البسيطة، وهوية صوتية واحدة عبر 100+ لغة، وبث time-to-first-audio أقل من 200 مللي ثانية.

Inworldتوليف صوتي TTFB بسرعة أقل من 130 مللي ثانية مع 271+ صوتا عبر 15 لغة، وعرض تعبيري، وبث SSE في الوقت الحقيقي لوكلاء الصوت منخفضي التأخير.

Inworldتوليف صوتي بجودة البث مع غنية تعبيرية، 271+ صوتا عبر 15 لغة، وبث SSE في الوقت الحقيقي مع طوابع زمنية لكل كلمة.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

Googletext-to-speech منخفض التأخير مع أصوات مكبرات صوت واحدة ومتعددة وأسلوب ولهجة ونبرة تعبيرية قابلة للتحكم في تطبيقات الإنتاج.

Deepgramنسخ الكلام إلى نص باستخدام نموذج Nova-3 مع دعم متعدد اللغات وإعدادات متقدمة قابلة للتخصيص لأعباء العمل الإنتاجية.

OpenAIكان Whisper-1 speech-to-text النسخ، مدربا على صوت متعدد اللغات تحت إشراف، مع حد رفع 25 ميجابايت لكل ملف.

OpenAIنسخ Whisper Large v3 Turbo متحكم به مع ASR متعدد اللغات، ترجمة، VAD، طوابع زمنية، ترجمة، كلمات ساخنة، وضوابط فك الترميز.

StepFunنموذج التعرف على الكلام من StepFun للبث الصوتي الصيني والإنجليزي.

Exaإجابة سريعة على طريقة نموذج اللغة الكبيرة على سؤال بلغة طبيعية، مستندة إلى نتائج بحث Exa الجديدة على الويب مع استشهادات وروابط مصادر.

Exaمحرك بحث ويب للعثور على الصفحات، واسترجاع الصفحات المشابهة، والزحف، والبحث المخصص في الكود عبر الويب المفتوح لعملاء الذكاء الاصطناعي.

Linkupبحث ذكاء اصطناعي تكراري يستمر في الاستعلام عندما تكون النتائج الأولية غير كافية، مما يعيد إجابات أكثر شمولا من الوضع القياسي.

Linkupبحث ويب مدعوم بالذكاء الاصطناعي مع نظرة عامة وإجابات مفصلة أسرع من البحث العميق. يحتل المرتبة #1 في اختبار OpenAI SimpleQA.

Perplexityبحث مؤسسي مدعوم بمنطق كلود أوبوس 4.6، مع أقصى عمق، وتحسين الوصول إلى الأدوات، وتغطية واسعة للمصادر.

Perplexityنموذج بحثي لاسترجاع متعدد الخطوات، والتركيب، والتفكير، مع البحث الذاتي، والقراءة والتقييم الذاتية للمصادر عبر مواضيع معقدة.

Microsoftنموذج TRELLIS.2 من الصورة إلى ثلاثية الأبعاد يحول صورة مرجعية إلى أصل GLB مملموس مع دقة، وبذرة، وشبكة، وملمس، وتحكم في التصدير.

DeemosRodin Gen-2 engine that turns a text prompt or up to five reference images into production 3D assets with PBR materials and quad or raw meshes.

Hitem3DProduction-focused image-to-3D with structure-aware textures, 1536 and 1536 Pro precision tiers, meshes up to two million faces, and five export formats.

Alibaba Cloudتضمين نص متعدد اللغات مع أبعاد إخراج قابلة للاختيار (64–2048). حتى 8,192 رمزا لكل إدخال.

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba Cloudالتضمين متعدد الوسائط ينتج متجهات مستقلة لمدخلات النص والصورة والفيديو.

ByteDanceMultimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.

Alibaba Cloudإعادة ترتيب المستندات الدلالية. يرتب حتى 500 مرشح لكل استعلام حسب الصلة، ويدعم 100+ لغة، ويقبل تعليمات فرز مخصصة.

GPTZeroكاشف التعلم العميق الذي يحدد أجزاء من النص التي من المحتمل أن يكون مولدا بواسطة الذكاء الاصطناعي مقابل الإنسان، ويصنف المحتوى إلى إنسان بالكامل، أو ذكاء اصطناعي، أو مختلط.

Manusوكيل ذكاء اصطناعي مستقل يحول تنبيها عالي المستوى إلى مهام فرعية، يستدعي الأدوات وواجهات برمجة التطبيقات، ويحقق نتائج end-to-end دون تنسيق يدوي.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.