
Muse Glimmer 30B
Meta AIModèle agent 30B ouvert Meta avec compréhension de l’image, contexte 128K, appel d’outils, sortie structurée et force de raisonnement contrôlable.
Parcourez le catalogue complet des modèles: texte, image, audio, vidéo, 3D et plus encore.
Catalogue de modèles
Parcourez les points de terminaison texte, image, vidéo, audio, 3D, recherche et agents avec pay-as-you-go prix. Le catalogue interactif charge la disponibilité actuelle d’EmpirioLabs, et ces documents modèles sont accessibles sans JavaScript client.
xAI image-to-video avec des mouvements guidés par prompt, audio natif, sortie 480p ou 720p, et des clips jusqu’à 15 secondes.
Génération vidéo multimodale pour des extraits cinématiques à partir de texte, d’image, d’audio ou d’entrées vidéo.
Génération et édition d’images unifiées pour des visuels créatifs, de marque et produits haute résolution.
Modèle de vision de langage économique pour le texte, l’image, la vidéo, le codage, les outils et les flux de travail contextuels 1M.
Modèle phare à long contexte pour le codage, la productivité, les agents à long terme, la réflexion approfondie et l’utilisation des outils.
Raisonnement multimodal pour le codage, les agents, l’analyse en contexte long, ainsi que l’entrée de texte, d’image et de vidéo.
Moonshot raisonnement multimodal avec un fort support du codage, contexte 256K, et entrées image et vidéo.
Raisonnement en contexte long avec appel d’outils, sortie structurée, support du cache et sortie 128K.
Génération image en 3D qui transforme une image de référence en un asset GLB texturé.

Meta AIModèle agent 30B ouvert Meta avec compréhension de l’image, contexte 128K, appel d’outils, sortie structurée et force de raisonnement contrôlable.

ByteDanceModèle vidéo long pour des clips cohérents jusqu’à 30 secondes, avec jusqu’à 50 images de référence, vidéos et extraits audio, audio natif, montage et extension.

Meta AILe modèle de raisonnement de frontière mis à jour de Meta avec un contexte de 1 048 576 jetons, une compréhension de l’image, de la vidéo, de l’audio et du PDF, une recherche web et un appel d’outils.

Alibaba CloudGénération et édition d’images Qwen avec variantes Base et Pro, typographie multilingue, références multi-images, et sortie contrôlable en 1K ou 2K.

MiniMaxGénère des clips de 4 à 15 secondes jusqu’à 2K avec un audio stéréo natif, suivant des références texte, image, vidéo et audio dans une seule requête.

Alibaba CloudUn modèle phare du MoE à l’échelle d’un billion pour le codage, les agents à long horizon et le travail professionnel, avec une compréhension image et vidéo dans un contexte à 1 million de jetons.

Z.aiModèle de raisonnement et de codage avec un contexte de jeton 1M, sortie 128K, effort de raisonnement ajustable, recherche web native et appel d’outils.

Moonshot AIKimi K3 est le modèle phare de raisonnement de Moonshot avec un contexte de jeton 1M, une pensée toujours active, une recherche web native, ainsi que des entrées texte, image et vidéo.

Meta AILe modèle de raisonnement de frontière mis à jour de Meta avec un contexte de 1 048 576 jetons, une compréhension de l’image, de la vidéo, de l’audio et du PDF, une recherche web et un appel d’outils.

Moonshot AILe code Kimi K2.7 est le modèle de codage agent à un billion de paramètres de Moonshot avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées texte, image et vidéo.

Meta AIModèle de raisonnement de la meta-frontière avec un contexte de 1 048 576 jetons, plus une compréhension d’images, de vidéos, d’audio et de PDF, de recherche web et d’appel d’outils.

Sakana AIConducteur multi-agent mis à jour pour le raisonnement approfondi, le codage et la recherche, avec un effort maximal distinct, un contexte 1M, une saisie d’images et une recherche web.

Black Forest LabsModèle de génération et d’édition d’images Klein 4B FLUX.2 sous licence Apache avec text-to-image, retouche d’images de référence et support de flux de travail créatif.

AmazonLa génération et l’édition d’images modèlent la création et la modification d’images à partir de texte ou d’entrées d’images, avec inpainting, essais virtuels et contrôles de style.

TencentModèle text-to-image open source sur une architecture multimodale Mixture-of-Experts, avec un niveau de détail photoréaliste et un rendu textuel multilingue puissant.

DeepSeekCadre autorégressif sur le modèle Janus Pro 7B qui unifie la compréhension multimodale et la génération d’images en une seule architecture.

Alibaba CloudModèle unifié de génération et d’édition d’images avec un rendu de texte Chinese/English complexe de premier plan, des textures réalistes et une fusion multi-images.

Alibaba CloudGénération et édition d’images Qwen avec variantes Base et Pro, typographie multilingue, références multi-images, et sortie contrôlable en 1K ou 2K.

Kling AITexte en vidéo et image-to-video avec audio natif synchronisé, en 720p ou 1080p pendant 3 à 15 secondes, avec contrôle au format et aux invites.

AmazonModèle de génération vidéo produisant jusqu’à 2 minutes de vidéos multi-plans à partir de texte et d’images optionnelles, avec une qualité et une cohérence améliorées.

Alibaba CloudModèle vidéo proposant des modes Text-to-Video, Image-to-Video, Reference-to-Video et Édition Vidéo avec une sortie haute fidélité et fluide au mouvement.

TencentModèle vidéo à paramètres 8,3B avec sortie native 720p (upscalable en 1080p), forte cohérence de mouvement et compréhension bilingue des prompts jusqu’à 10 secondes.

Kling AIModèle vidéo en modes Standard ou Pro avec Texte en Vidéo, Image-Vidéo, Référence en Vidéo, Montage, son natif et transitions multi-scènes.

Kling AIModèle Kling 3.0 qui transfère le mouvement d’une vidéo de référence vers un caractère issu d’une image de référence, avec des patiers Standard 720p et Pro 1080p.

ACE-StepModèle de génération musicale open source pour l’audio guidé par text-to-song et paroles, avec une inférence XL Turbo rapide en 8 étapes pour une itération contrôlable des chansons.

InworldModèle de voix en temps réel avec une direction en anglais simple, une identité vocale unique sur 100+ langues, et time-to-first-audio en streaming sous 200 ms.

InworldSynthèse vocale TTFB en moins de 130 ms avec 271+ voix réparties dans 15 langues, prosodie expressive et streaming SSE en temps réel pour agents vocaux à faible latence.

InworldSynthèse vocale de qualité broadcast avec prosodie expressive riche, 271+ voix dans 15 langues, et streaming SSE en temps réel avec horodatages par mot.

GoogleFaible latence text-to-speech avec voix à un ou plusieurs haut-parleurs, ainsi qu’un style, un accent et un ton expressif contrôlables pour les applications de production.

GoogleAperçu TTS de haute qualité pour podcasts, livres audio et support client, avec des voix expressives multi-haut-parleurs dans 23+ langues.

DeepgramLa transcription vocale en texte utilisant le modèle Nova-3 avec prise en charge multilingue et réglages avancés personnalisables pour les charges de production.

OpenAIWhisper-1 speech-to-text transcription entraînée sur un audio supervisé multilingue, avec une limite de téléversement de 25 Mo par fichier.

OpenAITranscription contrôlée Whisper Large v3 Turbo avec ASR multilingue, traduction, VAD, horodatages, sous-titres, hotwords et contrôles décodeurs.

StepFunModèle de reconnaissance vocale en streaming StepFun pour la transcription audio chinoise et anglaise.

ExaRéponse rapide de type LLM à une question en langage naturel, fondée sur de nouveaux résultats de recherche exa web avec des citations en ligne et des liens sources.

ExaMoteur de recherche web pour trouver des pages, récupérer des pages similaires, explorer et rechercher du code dédié sur le web ouvert pour les agents IA.

LinkupRecherche itérative par IA qui continue de rechercher lorsque les résultats initiaux sont insuffisants, en renvoyant des réponses plus complètes que le mode Standard.

LinkupRecherche web propulsée par l’IA avec des aperçus détaillés et des réponses, plus rapide que la recherche profonde. Il se classe #1 sur le benchmark OpenAI SimpleQA.

PerplexityRecherche de niveau institutionnel propulsée par le raisonnement Claude Opus 4.6, avec une profondeur maximale, un accès amélioré aux outils et une couverture source étendue.

PerplexityModèle de recherche pour la récupération, la synthèse et le raisonnement en plusieurs étapes, en recherchant, lisant et évaluant de manière autonome les sources sur des sujets complexes.

MicrosoftTRELLIS.2 modèle image-de-3D qui transforme une image de référence en un asset GLB texturé avec des contrôles de résolution, de graine, de maillage, de texture et d’exportation.

Alibaba CloudIntégration de texte multilingue avec dimensions de sortie sélectionnables (64–2048). Jusqu’à 8 192 jetons par entrée.

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba CloudL’intégration multimodale produisant des vecteurs indépendants pour le texte, l’image et les entrées vidéo.

Alibaba CloudReclasseur sémantique de documents. Trie jusqu’à 500 candidats par requête selon leur pertinence, prend en charge 100+ langages et accepte une instruction de tri personnalisée.

GPTZeroDétecteur d’apprentissage profond qui signale les parties de texte probablement générées par l’IA par rapport à l’humain, classant le contenu comme entièrement humain, IA ou mixte.

ManusAgent IA autonome qui transforme une invite de haut niveau en sous-tâches, appelle des outils et des API, et délivre end-to-end résultats sans orchestration manuelle.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.