
GLM 5.3
Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.
Parcourez le catalogue complet des modèles: texte, image, audio, vidéo, 3D et plus encore.
Catalogue de modèles
Parcourez les points de terminaison texte, image, vidéo, audio, 3D, recherche et agents avec pay-as-you-go prix. Le catalogue interactif charge la disponibilité actuelle d’EmpirioLabs, et ces documents modèles sont accessibles sans JavaScript client.
xAI image-to-video avec des mouvements guidés par prompt, audio natif, sortie 480p ou 720p, et des clips jusqu’à 15 secondes.
Génération vidéo multimodale pour des extraits cinématiques à partir de texte, d’image, d’audio ou d’entrées vidéo.
Génération et édition d’images unifiées pour des visuels créatifs, de marque et produits haute résolution.
Modèle de vision de langage économique pour le texte, l’image, la vidéo, le codage, les outils et les flux de travail contextuels 1M.
Modèle phare à long contexte pour le codage, la productivité, les agents à long terme, la réflexion approfondie et l’utilisation des outils.
Raisonnement multimodal pour le codage, les agents, l’analyse en contexte long, ainsi que l’entrée de texte, d’image et de vidéo.
Moonshot raisonnement multimodal avec un fort support du codage, contexte 256K, et entrées image et vidéo.
Raisonnement en contexte long avec appel d’outils, sortie structurée, support du cache et sortie 128K.
Génération image en 3D qui transforme une image de référence en un asset GLB texturé.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Alibaba CloudMultimodal reasoner with 256K context, image and video input, function tools, structured JSON, and thinking on by default.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

DeepSeekOfficial 0813 Pro release with major gains across coding, repository work, tool use, and agent tasks, plus hybrid thinking and a 1M context window.
Text-to-image plus multi-reference editing with up to three source images, selectable quality tiers, and 1K or 2K output resolution.

Meta AIModèle agent 30B ouvert Meta avec compréhension de l’image, contexte 128K, appel d’outils, sortie structurée et force de raisonnement contrôlable.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Z.aiModèle de raisonnement et de codage avec un contexte de jeton 1M, sortie 128K, effort de raisonnement ajustable, recherche web native et appel d’outils.

Moonshot AIKimi K3 est le modèle phare de raisonnement de Moonshot avec un contexte de jeton 1M, une pensée toujours active, une recherche web native, ainsi que des entrées texte, image et vidéo.

Meta AILe modèle de raisonnement de frontière mis à jour de Meta avec un contexte de 1 048 576 jetons, une compréhension de l’image, de la vidéo, de l’audio et du PDF, une recherche web et un appel d’outils.

Moonshot AILe code Kimi K2.7 est le modèle de codage agent à un billion de paramètres de Moonshot avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées texte, image et vidéo.

Meta AIModèle de raisonnement de la meta-frontière avec un contexte de 1 048 576 jetons, plus une compréhension d’images, de vidéos, d’audio et de PDF, de recherche web et d’appel d’outils.

Black Forest LabsModèle de génération et d’édition d’images Klein 4B FLUX.2 sous licence Apache avec text-to-image, retouche d’images de référence et support de flux de travail créatif.

AmazonLa génération et l’édition d’images modèlent la création et la modification d’images à partir de texte ou d’entrées d’images, avec inpainting, essais virtuels et contrôles de style.

TencentModèle text-to-image open source sur une architecture multimodale Mixture-of-Experts, avec un niveau de détail photoréaliste et un rendu textuel multilingue puissant.

DeepSeekCadre autorégressif sur le modèle Janus Pro 7B qui unifie la compréhension multimodale et la génération d’images en une seule architecture.

Alibaba CloudModèle unifié de génération et d’édition d’images avec un rendu de texte Chinese/English complexe de premier plan, des textures réalistes et une fusion multi-images.

Alibaba CloudGénération et édition d’images Qwen avec variantes Base et Pro, typographie multilingue, références multi-images, et sortie contrôlable en 1K ou 2K.

Kling AITexte en vidéo et image-to-video avec audio natif synchronisé, en 720p ou 1080p pendant 3 à 15 secondes, avec contrôle au format et aux invites.

AmazonModèle de génération vidéo produisant jusqu’à 2 minutes de vidéos multi-plans à partir de texte et d’images optionnelles, avec une qualité et une cohérence améliorées.

Alibaba CloudModèle vidéo proposant des modes Text-to-Video, Image-to-Video, Reference-to-Video et Édition Vidéo avec une sortie haute fidélité et fluide au mouvement.

TencentModèle vidéo à paramètres 8,3B avec sortie native 720p (upscalable en 1080p), forte cohérence de mouvement et compréhension bilingue des prompts jusqu’à 10 secondes.

Kling AIModèle vidéo en modes Standard ou Pro avec Texte en Vidéo, Image-Vidéo, Référence en Vidéo, Montage, son natif et transitions multi-scènes.

Kling AIModèle Kling 3.0 qui transfère le mouvement d’une vidéo de référence vers un caractère issu d’une image de référence, avec des patiers Standard 720p et Pro 1080p.

ACE-StepModèle de génération musicale open source pour l’audio guidé par text-to-song et paroles, avec une inférence XL Turbo rapide en 8 étapes pour une itération contrôlable des chansons.

InworldModèle de voix en temps réel avec une direction en anglais simple, une identité vocale unique sur 100+ langues, et time-to-first-audio en streaming sous 200 ms.

InworldSynthèse vocale TTFB en moins de 130 ms avec 271+ voix réparties dans 15 langues, prosodie expressive et streaming SSE en temps réel pour agents vocaux à faible latence.

InworldSynthèse vocale de qualité broadcast avec prosodie expressive riche, 271+ voix dans 15 langues, et streaming SSE en temps réel avec horodatages par mot.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

GoogleFaible latence text-to-speech avec voix à un ou plusieurs haut-parleurs, ainsi qu’un style, un accent et un ton expressif contrôlables pour les applications de production.

DeepgramLa transcription vocale en texte utilisant le modèle Nova-3 avec prise en charge multilingue et réglages avancés personnalisables pour les charges de production.

OpenAIWhisper-1 speech-to-text transcription entraînée sur un audio supervisé multilingue, avec une limite de téléversement de 25 Mo par fichier.

OpenAITranscription contrôlée Whisper Large v3 Turbo avec ASR multilingue, traduction, VAD, horodatages, sous-titres, hotwords et contrôles décodeurs.

StepFunModèle de reconnaissance vocale en streaming StepFun pour la transcription audio chinoise et anglaise.

ExaRéponse rapide de type LLM à une question en langage naturel, fondée sur de nouveaux résultats de recherche exa web avec des citations en ligne et des liens sources.

ExaMoteur de recherche web pour trouver des pages, récupérer des pages similaires, explorer et rechercher du code dédié sur le web ouvert pour les agents IA.

LinkupRecherche itérative par IA qui continue de rechercher lorsque les résultats initiaux sont insuffisants, en renvoyant des réponses plus complètes que le mode Standard.

LinkupRecherche web propulsée par l’IA avec des aperçus détaillés et des réponses, plus rapide que la recherche profonde. Il se classe #1 sur le benchmark OpenAI SimpleQA.

PerplexityRecherche de niveau institutionnel propulsée par le raisonnement Claude Opus 4.6, avec une profondeur maximale, un accès amélioré aux outils et une couverture source étendue.

PerplexityModèle de recherche pour la récupération, la synthèse et le raisonnement en plusieurs étapes, en recherchant, lisant et évaluant de manière autonome les sources sur des sujets complexes.

MicrosoftTRELLIS.2 modèle image-de-3D qui transforme une image de référence en un asset GLB texturé avec des contrôles de résolution, de graine, de maillage, de texture et d’exportation.

DeemosRodin Gen-2 engine that turns a text prompt or up to five reference images into production 3D assets with PBR materials and quad or raw meshes.

Hitem3DProduction-focused image-to-3D with structure-aware textures, 1536 and 1536 Pro precision tiers, meshes up to two million faces, and five export formats.

Alibaba CloudIntégration de texte multilingue avec dimensions de sortie sélectionnables (64–2048). Jusqu’à 8 192 jetons par entrée.

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba CloudL’intégration multimodale produisant des vecteurs indépendants pour le texte, l’image et les entrées vidéo.

ByteDanceMultimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.

Alibaba CloudReclasseur sémantique de documents. Trie jusqu’à 500 candidats par requête selon leur pertinence, prend en charge 100+ langages et accepte une instruction de tri personnalisée.

GPTZeroDétecteur d’apprentissage profond qui signale les parties de texte probablement générées par l’IA par rapport à l’humain, classant le contenu comme entièrement humain, IA ou mixte.

ManusAgent IA autonome qui transforme une invite de haut niveau en sous-tâches, appelle des outils et des API, et délivre end-to-end résultats sans orchestration manuelle.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.