
Texte en vidéo et image-to-video avec audio natif synchronisé, en 720p ou 1080p pendant 3 à 15 secondes, avec contrôle au format et aux invites.
Payez au fur et à mesure, ou choisissez un plan avec des allocations hebdomadaires.
Catalogue tarifaire
La tarification d’EmpirioLabs varie selon le modèle et l’unité: jetons, images, secondes audio ou vidéo, messages, ressources 3D et requêtes de recherche. La table de tarification interactive charge le catalogue actuel, tandis que ces taux représentatifs restent lisibles sans JavaScript client.
L’entrée d’image $0.05 par image. La sortie vidéo commence à $0.096 par seconde pour le 480p et à $0.168 par seconde pour le 720p.
L’entrée commence à $0.40 par 1M de jetons d’invite pour une API multimodale à long contexte rentable.
L’entrée commence à $0.30 par jetons d’invite de 1 million pour le raisonnement multimodal, le codage et les charges de travail d’agents.
La génération image vers 3D est tarifée par actif 3D généré, avec des documents pour les contrôles de format et de résolution.
Les tarifs de l'API des modèles sont affichés et facturés en USD. Le checkout peut afficher des moyens de paiement locaux lorsqu'ils sont éligibles.
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
MiniMax M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 FlashGratuitThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V FlashGratuitThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 FlashGratuitThis model is free to run, so using it never draws from your weekly allowance.
Mistral Medium 3
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 Plus
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
Mistral Medium 3.1
Nova Premier 1.0
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

Texte en vidéo et image-to-video avec audio natif synchronisé, en 720p ou 1080p pendant 3 à 15 secondes, avec contrôle au format et aux invites.

Modèle de raisonnement et de codage avec un contexte de jeton 1M, sortie 128K, effort de raisonnement ajustable, recherche web native et appel d’outils.

Modèle de raisonnement et de codage avec un contexte de jeton 1M, sortie 128K, effort de raisonnement ajustable, recherche web native et appel d’outils.

Moonshot AIInternationalPublié 15 juil. 2026Ctx 1MGénération de texteKimi K3 est le modèle phare de raisonnement de Moonshot avec un contexte de jeton 1M, une pensée toujours active, une recherche web native, ainsi que des entrées texte, image et vidéo.

Le modèle de raisonnement de frontière mis à jour de Meta avec un contexte de 1 048 576 jetons, une compréhension de l’image, de la vidéo, de l’audio et du PDF, une recherche web et un appel d’outils.

Moonshot AIInternationalPublié 16 juin 2026Ctx 256KGénération de texteLe code Kimi K2.7 est le modèle de codage agent à un billion de paramètres de Moonshot avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées texte, image et vidéo.

Moonshot AIGermanyPublié 16 juin 2026Ctx 256KGénération de texteLe code Kimi K2.7 est le modèle de codage agent à un billion de paramètres de Moonshot avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées texte, image et vidéo.

Modèle de raisonnement de la meta-frontière avec un contexte de 1 048 576 jetons, plus une compréhension d’images, de vidéos, d’audio et de PDF, de recherche web et d’appel d’outils.

Conducteur multi-agent mis à jour pour le raisonnement approfondi, le codage et la recherche, avec un effort maximal distinct, un contexte 1M, une saisie d’images et une recherche web.

Alibaba CloudSingaporePublié 1 juin 2026Ctx 1MGénération de texteModèle vision-langage Qwen3.7 économique pour le texte, l’image, la vidéo, le codage, l’utilisation d’outils, la compréhension de l’interface graphique et les flux de travail contextuels 1M.

Modèle vision-langage Qwen3.7 économique pour le texte, l’image, la vidéo, le codage, l’utilisation d’outils, la compréhension de l’interface graphique et les flux de travail contextuels 1M.

Moonshot AIInternationalPublié 16 juin 2026Ctx 256KGénération de texteKimi K2.7 Code Highspeed est la couche de service plus rapide du modèle de codage agent de Moonshot, avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées image et vidéo.

Conducteur multi-agent original pour le raisonnement approfondi, le codage et la recherche, avec contexte 1M, saisie d’image, appel de fonctions et recherche web.

Alibaba CloudSingaporePublié 15 juil. 2026Ctx 1MGénération de texteModèle de vision-langage rapide Qwen3.7 pour le texte, l’image, la vidéo, l’utilisation d’outils et les tâches agentiques, avec mise en cache implicite et un contexte de jeton 1M.

Alibaba CloudChinaPublié 15 juil. 2026Ctx 1MGénération de texteModèle de vision-langage rapide Qwen3.7 pour le texte, l’image, la vidéo, l’utilisation d’outils et les tâches agentiques, avec mise en cache implicite et un contexte de jeton 1M.

MiniMax M3 est un modèle de raisonnement multimodal pour le codage, les agents et l’analyse en contexte long avec saisie texte, image et vidéo.

MiniMax M3 est un modèle de raisonnement multimodal pour le codage, les agents et l’analyse en contexte long avec saisie texte, image et vidéo.

Alibaba CloudSingaporePublié 21 mai 2026Ctx 1MGénération de texteQwen3.7 Max est un modèle textuel phare pour le codage, la productivité, les agents de longue durée, la réflexion approfondie, les outils et le contexte 1M-token.

Qwen3.7 Max est un modèle textuel phare pour le codage, la productivité, les agents de longue durée, la réflexion approfondie, les outils et le contexte 1M-token.

Alibaba CloudSingaporePublié 3 août 2026Ctx 1MGénération de texteUn modèle phare du MoE à l’échelle d’un billion pour le codage, les agents à long horizon et le travail professionnel, avec une compréhension image et vidéo dans un contexte à 1 million de jetons.

Un modèle phare du MoE à l’échelle d’un billion pour le codage, les agents à long horizon et le travail professionnel, avec une compréhension image et vidéo dans un contexte à 1 million de jetons.
Modèle de génération musicale open source pour l’audio guidé par text-to-song et paroles, avec une inférence XL Turbo rapide en 8 étapes pour une itération contrôlable des chansons.

Modèle de génération et d’édition d’images Klein 4B FLUX.2 sous licence Apache avec text-to-image, retouche d’images de référence et support de flux de travail créatif.

MiniMaxSingaporePublié 18 mars 2026Ctx 200KGénération de texteVariante M2.7 à grande vitesse réglée pour une inférence rapide, avec de fortes performances polyvalentes et de fortes capacités agentiques.
Modèle de voix en temps réel avec une direction en anglais simple, une identité vocale unique sur 100+ langues, et time-to-first-audio en streaming sous 200 ms.
Synthèse vocale TTFB en moins de 130 ms avec 271+ voix réparties dans 15 langues, prosodie expressive et streaming SSE en temps réel pour agents vocaux à faible latence.
Synthèse vocale de qualité broadcast avec prosodie expressive riche, 271+ voix dans 15 langues, et streaming SSE en temps réel avec horodatages par mot.

Modèle de raisonnement IA Zhipu à long contexte avec contexte 202K, sortie 128K, appel d’outils, sortie structurée et support du cache.

Kimi K2.6 est un modèle de raisonnement multimodal Moonshot avec un contexte 256K, un codage fort, ainsi que des entrées texte, image et vidéo.

DeepSeekGermanyPublié 31 juil. 2026Ctx 1MGénération de texteVersion 0731 post-entraînée avec des gains majeurs en codage, travail sur dépôt, utilisation d’outils et tâches full-stack, plus une fenêtre contextuelle de 1M.

MiniMaxSingaporePublié 18 mars 2026Ctx 200KGénération de texteMiniMax M2.7 est un modèle de chat de raisonnement polyvalent avec pensée entrelacée, appels de fonctions et mise en cache par prompts.
TRELLIS.2 modèle image-de-3D qui transforme une image de référence en un asset GLB texturé avec des contrôles de résolution, de graine, de maillage, de texture et d’exportation.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 256KGénération de texteQwen3.5 122B-A10B est un modèle de raisonnement multimodal avec un contexte 256K, une inférence MoE efficace et parcimonie, ainsi qu’une entrée texte, image et vidéo.

Alibaba CloudChinaPublié 16 févr. 2026Ctx 256KGénération de texteQwen3.5 397B-A17B est un modèle de raisonnement multimodal phare pour le langage, le code, les agents, les tâches d’interface graphique, ainsi que la compréhension d’images et de vidéos.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 256KGénération de texteQwen3.5 35B-A3B est un modèle natif-vision-langue efficace avec un routage MoE clairsemé, une réflexion approfondie, ainsi qu’une entrée texte, image et vidéo.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 256KGénération de texteQwen3.5 27B est un modèle de raisonnement multimodal dense avec des réponses rapides, un contexte 256K, ainsi qu’une compréhension du texte, de l’image et de la vidéo.

Alibaba CloudChinaPublié 22 avr. 2026Ctx 256KGénération de texteQwen3.6 27B améliore le codage agentique, le raisonnement STEM, la vision spatiale, la reconnaissance optique de caractère, ainsi que la compréhension du texte, de l’image et de la vidéo dans un contexte 256K.

Alibaba CloudSingaporePublié 16 avr. 2026Ctx 1MGénération de texteModèle vision-langage Fast Qwen3.6 pour le codage agentique, le raisonnement mathématique, la compréhension spatiale, la reconnaissance optique de personnage, ainsi que l’entrée de texte, d’image et de vidéo.

Alibaba CloudChinaPublié 16 avr. 2026Ctx 1MGénération de texteModèle vision-langage Fast Qwen3.6 pour le codage agentique, le raisonnement mathématique, la compréhension spatiale, la reconnaissance optique de personnage, ainsi que l’entrée de texte, d’image et de vidéo.

Gemma 4 26B A4B est un modèle multimodal ouvert Google avec 256K contexte, texte, image et entrées vidéo, outils et sorties structurées.

Qwen3.5 9B est un modèle de raisonnement multimodal compact avec 256K contexte, entrée image et vidéo, outils fonctionnels et sortie structurée.

Qwen3.5 4B est un modèle de raisonnement multimodal à faible coût avec 256K contexte, entrée image et vidéo, outils fonctionnels et sortie structurée.

Qwen3.6 35B A3B est un modèle de raisonnement mixture-of-experts expert en 256 avec un contexte 128K, des outils fonctionnels et une sortie JSON strictement structurée.

Modèle texte GLM-4.7 léger gratuit pour le codage, le raisonnement, l’écriture en contexte long et le chat général.

Modèle texte GLM-4.5 léger gratuit pour le raisonnement, le codage, le chat long format et les tâches linguistiques générales.

Modèle multimodal GLM-4.6V gratuit pour la compréhension d’images, vidéos, fichiers et texte avec appel de fonction natif.

La génération et l’édition d’images modèlent la création et la modification d’images à partir de texte ou d’entrées d’images, avec inpainting, essais virtuels et contrôles de style.

Modèle de génération vidéo produisant jusqu’à 2 minutes de vidéos multi-plans à partir de texte et d’images optionnelles, avec une qualité et une cohérence améliorées.

La transcription vocale en texte utilisant le modèle Nova-3 avec prise en charge multilingue et réglages avancés personnalisables pour les charges de production.

Associe DeepSeek R1 chain-of-thought raisonnement avec Anthropic Claude créatif et génération de code derrière une interface unifiée contrôlée par les données.

DeepSeekSingaporePublié 1 déc. 2025Ctx 128KGénération de texteLLM open source Mixture-of-Experts, adapté pour un raisonnement efficace, du codage et des tâches générales de langage à travers des prompts longs.

DeepSeekGermanyPublié 24 avr. 2026Ctx 1MGénération de texteModèle MoE léger avec 284 B de paramètres totaux / 13 milliards de paramètres actifs et un contexte natif 1M, ajusté pour une utilisation à faible latence et à haute concurrence économique.

DeepSeekSingaporePublié 24 avr. 2026Ctx 1MGénération de texteModèle MoE léger avec 284 B de paramètres totaux / 13 milliards de paramètres actifs et un contexte natif 1M, ajusté pour une utilisation à faible latence et à haute concurrence économique.

DeepSeekChinaPublié 24 avr. 2026Ctx 1MGénération de texteModèle MoE léger avec 284 B de paramètres totaux / 13 milliards de paramètres actifs et un contexte natif 1M, ajusté pour une utilisation à faible latence et à haute concurrence économique.

DeepSeekGermanyPublié 24 avr. 2026Ctx 1MGénération de texteLLM MoE phare avec 1,6T au total / 49B de paramètres actifs et un contexte natif 1M pour les mathématiques avancées, l’inférence logique et le codage spécialisé.

DeepSeekSingaporePublié 24 avr. 2026Ctx 1MGénération de texteLLM MoE phare avec 1,6T au total / 49B de paramètres actifs et un contexte natif 1M pour les mathématiques avancées, l’inférence logique et le codage spécialisé.

LLM MoE phare avec 1,6T au total / 49B de paramètres actifs et un contexte natif 1M pour les mathématiques avancées, l’inférence logique et le codage spécialisé.

Réponse rapide de type LLM à une question en langage naturel, fondée sur de nouveaux résultats de recherche exa web avec des citations en ligne et des liens sources.

Moteur de recherche web pour trouver des pages, récupérer des pages similaires, explorer et rechercher du code dédié sur le web ouvert pour les agents IA.

Faible latence text-to-speech avec voix à un ou plusieurs haut-parleurs, ainsi qu’un style, un accent et un ton expressif contrôlables pour les applications de production.

Aperçu TTS de haute qualité pour podcasts, livres audio et support client, avec des voix expressives multi-haut-parleurs dans 23+ langues.

TTS hautement contrôlable avec de nouvelles balises audio pour un style, un ton, un rythme et une livraison précis via narration, assistants et applications vocales.

Modèle de langage visionnaire open source avec contexte 128K, 140+ langues, math/reasoning amélioré, sorties structurées et appel de fonctions.

text-to-speech basées sur LLM avec clonage vocal zéro shot de 3 à 10 secondes d’audio et une sortie contrôlable et expressive émotionnelle via RL multi-récompenses.

Détecteur d’apprentissage profond qui signale les parties de texte probablement générées par l’IA par rapport à l’humain, classant le contenu comme entièrement humain, IA ou mixte.

Modèle vidéo proposant des modes Text-to-Video, Image-to-Video, Reference-to-Video et Édition Vidéo avec une sortie haute fidélité et fluide au mouvement.

Modèle text-to-image open source sur une architecture multimodale Mixture-of-Experts, avec un niveau de détail photoréaliste et un rendu textuel multilingue puissant.

Modèle vidéo à paramètres 8,3B avec sortie native 720p (upscalable en 1080p), forte cohérence de mouvement et compréhension bilingue des prompts jusqu’à 10 secondes.

Cadre autorégressif sur le modèle Janus Pro 7B qui unifie la compréhension multimodale et la génération d’images en une seule architecture.

Modèle vidéo en modes Standard ou Pro avec Texte en Vidéo, Image-Vidéo, Référence en Vidéo, Montage, son natif et transitions multi-scènes.

Modèle Kling 3.0 qui transfère le mouvement d’une vidéo de référence vers un caractère issu d’une image de référence, avec des patiers Standard 720p et Pro 1080p.

Recherche itérative par IA qui continue de rechercher lorsque les résultats initiaux sont insuffisants, en renvoyant des réponses plus complètes que le mode Standard.

Recherche web propulsée par l’IA avec des aperçus détaillés et des réponses, plus rapide que la recherche profonde. Il se classe #1 sur le benchmark OpenAI SimpleQA.

Modèle de langage économique offrant un raisonnement solide et des performances multimodales pour les charges de travail générales en production à latence concurrentielle.

Mistral AIPublié 12 août 2025Ctx 131KGénération de texteModèle de niveau entreprise avec un raisonnement solide, un codage et des performances STEM, supportant les déploiements hybrides, locaux et intégrés au VPC.

Modèle multimodal à 24B paramètres avec un contexte 128K pour l’analyse d’images, la programmation, les mathématiques et les tâches multilingues, ajusté pour une inférence locale efficace.

Modèle hybride unifiant les familles Instruct, Raisonnement (Magistral) et Devstral: 40 % de temps d’achèvement inférieur et débit 3x supérieur à Petit 3.

Modèle de fondation MoE open source 32B qui génère des vidéos et des sons synchronisés en une seule étape d’inférence avec une synchronisation labiale précise à double tour.

Modèle de fondation multimodal à faible coût pour texte, images et vidéo sur un contexte 300K (jusqu’à ~30 minutes vidéo), ajusté pour la rapidité et l’accessibilité.

Modèle de raisonnement multimodal rapide et économique pour texte, images, documents et vidéo sur un contexte 1M (longs documents et clips de ~90 min).

Modèle de fondation uniquement textuel, ajusté pour une latence et un coût ultra-bas sur un contexte de 128K. Fort pour la synthèse, la traduction et le chat avec une réduction de 44 % sur le cache.

Le modèle le plus compétent de la famille. text/image/vidéo multimodale dans un contexte 1M avec chain-of-thought raisonnement à travers outils et sources de données.

Modèle de fondation multimodal équilibrant précision, rapidité et coût pour le texte, les images et la vidéo sur un contexte de 300K (jusqu’à ~30 min de vidéo).

Whisper-1 speech-to-text transcription entraînée sur un audio supervisé multilingue, avec une limite de téléversement de 25 Mo par fichier.

Recherche de niveau institutionnel propulsée par le raisonnement Claude Opus 4.6, avec une profondeur maximale, un accès amélioré aux outils et une couverture source étendue.

Modèle de recherche pour la récupération, la synthèse et le raisonnement en plusieurs étapes, en recherchant, lisant et évaluant de manière autonome les sources sur des sujets complexes.

Sonar Pro en tant que chercheur agent: enchaîne les recherches web, récupère des pages complètes et diffuse le raisonnement en direct, adaptant sa stratégie pour des requêtes complexes.

Recherche web en temps réel avec filtrage par domaine, langue, date, et plus encore. Retourne les résultats de recherche, pas les réponses des LLM; Aucun téléchargement de fichiers.

Recherche web en temps réel avec citations précises et sources personnalisables pour up-to-date intégration de la recherche IA dans les applications de production.

Modèle basé sur la recherche avec le double de citations et une fenêtre contextuelle plus grande, conçu pour des requêtes complexes nécessitant des réponses approfondies et nuancées.

Modèle de raisonnement sur le R1-1776 open-source non censuré avec recherche web, surpassant les moteurs de recherche et LLM les plus performants sur le benchmark SimpleQA.

Génération de vidéo cinématographique en modes texte en vidéo, image en vidéo et transition avec un haut niveau de détail, un mouvement fluide et des animations réalistes.

Génère des vidéos à partir de texte ou d’images d’images 1-2 images jusqu’à 1080p, avec plusieurs formats d’aspect, durées de 5 à 10 secondes, avec audio synchronisé en option.

Modèle unifié de génération et d’édition d’images avec un rendu de texte Chinese/English complexe de premier plan, des textures réalistes et une fusion multi-images.

Alibaba CloudSingaporePublié 21 juil. 2026Génération d’imagesGénération et édition d’images Qwen avec variantes Base et Pro, typographie multilingue, références multi-images, et sortie contrôlable en 1K ou 2K.

Alibaba CloudSingaporePublié 24 févr. 2026Ctx 1MGénération de texteModèle vision-langage avec une attention linéaire hybride plus un MoE clairsemé, un contexte 1M, et une inférence rapide multimodale text/image/vidéo.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 1MGénération de texteModèle vision-langage avec une attention linéaire hybride plus un MoE clairsemé, un contexte 1M, et une inférence rapide multimodale text/image/vidéo.

Alibaba CloudSingaporePublié 30 mars 2026Ctx 256KGénération de texteModèle omnimodal économique gérant texte, image, audio et vidéo, avec jusqu’à 3 heures d’audio et 1 heure de vidéo dans 90+ langues.

Alibaba CloudSingaporePublié 30 mars 2026Ctx 256KGénération de texteModèle omni-modal phare pour le texte, l’image, l’audio et la vidéo. 3 heures audio, 1 main vidéo, 90+ entrées et 30+ sorties, 55 timbres vocaux.

Alibaba CloudSingaporePublié 16 févr. 2026Ctx 1MGénération de texteModèle multimodal avec architecture hybride pour une réflexion profonde efficace et une compréhension visuelle à travers le texte, l’image et la vidéo dans un contexte 1M.

Alibaba CloudChinaPublié 16 févr. 2026Ctx 1MGénération de texteModèle multimodal avec architecture hybride pour une réflexion profonde efficace et une compréhension visuelle à travers le texte, l’image et la vidéo dans un contexte 1M.

Alibaba CloudSingaporePublié 20 avr. 2026Ctx 256KGénération de textePlus grande variante d’aperçu de la série 3.6 (texte uniquement): meilleure exécution des agents de codage, compétences front-end renforcées et une connaissance plus large des long-tails.

Alibaba CloudSingaporePublié 2 avr. 2026Ctx 1MGénération de texteModèle de vision avec des améliorations majeures par rapport à la version 3.5: codage agent et front-end, reconnaissance multimodale, OCR et localisation d’objets.

Modèle de vision avec des améliorations majeures par rapport à la version 3.5: codage agent et front-end, reconnaissance multimodale, OCR et localisation d’objets.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 256KGénération de texteContexte phare 256K avec des améliorations majeures du raisonnement, du suivi des instructions et du support multilingue, ainsi qu’une meilleure précision coding/math.

Alibaba CloudSingaporePublié 5 sept. 2025Ctx 256KGénération de texteVersion preview avec des avancées majeures par rapport à la série 2.5 en matière de compréhension chinois-anglais, d’instructions complexes, de capacité multilingue et d’utilisation des outils.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 256KGénération de texteModèle de raisonnement utilisant l’utilisation d’outils adaptatifs (recherche, mémoire, interpréteur de code) et l’échelle en temps de test pour une plus grande précision sur des tâches complexes.

Reclasseur sémantique de documents. Trie jusqu’à 500 candidats par requête selon leur pertinence, prend en charge 100+ langages et accepte une instruction de tri personnalisée.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteModèle 256K contextuel ajusté au codage avec de solides résultats front-end et un support multilingue de programmation pour les outils et agents de codage IA.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteModèle polyvalent équilibré pour les charges de travail d’entreprise à haute fréquence: traitement de l’information, contenu, recherche et analyse des données.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteModèle multimodal axé sur la latence avec contexte 256K, quatre modes d’effort de raisonnement et image/video compréhension pour une utilisation à haute concurrence.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteModèle général phare avec un contexte 256K pour un raisonnement complexe, une compréhension multimodale, une génération structurée et une exécution augmentée par outils.

ByteDanceMalaysiaPublié 12 févr. 2026Génération de vidéosVariante vidéo 2.0 optimisée pour la vitesse et les clips cinématiques avec synchronisation audio native, contrôle de la caméra et mouvement stable à moindre coût par rendu.

Modèle vidéo multimodal pour la sortie cinématographique à partir de texte, image, audio ou vidéo, avec un mouvement stable et des caractères cohérents.

Modèle d’image multimodal unifié qui raisonne à travers des invites avant de rendu, produisant des montages et des visuels de marque à haute résolution et cohérents.

Modèle d’image Premium Seedream pour text-to-image, modifications et fusion multi-références avec sortie 1K, 1,5K et 2K, plus optimisation rapide ou rapide des prompts.

Modèle vocal open source pour des dialogues de podcast longs et multi-haut-parleurs, avec contrôle paralinguistique (rires, soupirs) et clonage vocal zéro-shot.

Génère de l’audio jusqu’à 3 minutes à partir d’invites textuelles, prenant en charge text-to-audio et audio-to-audio avec une durée, des pas et une échelle CFG ajustables.

Up-to-3-minute audio à partir du texte avec text-to-audio, audio-to-audio et l’inpainting audio pour la production musicale, la conception sonore et le remix.

Stable Video Infinity 2.0 Pro sur WAN 2.2: étend les images fixes en vidéos théoriquement de longueur infinie tout en conservant des identifiants de caractères cohérents.

Assistant de recherche multi-recherche qui explore un sujet, analyse les sources et produit un rapport de recherche détaillé avec des citations.

Recherche web avec crawl, extraction et mappage d’URL pour une récupération rapide et structurée entre pages et domaines pour les pipelines en aval.

Alibaba CloudSingaporePublié 4 juin 2025Ctx 8KEncastrementsIntégration de texte multilingue avec dimensions de sortie sélectionnables (64–2048). Jusqu’à 8 192 jetons par entrée.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 1KEncastrementsIntégration multimodale optimisée en vitesse, même forme que Vision-Plus, 3 × moins cher image/video tokens.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 1KEncastrementsL’intégration multimodale produisant des vecteurs indépendants pour le texte, l’image et les entrées vidéo.

Modèle de génération vidéo multimodale pour des histoires cinématographiques à plans multiples avec synchronisation audiovisuelle native (play-sync, dialogues, musique, effets sonores).

Modèle vidéo multimodal supportant T2V, I2V, le montage vidéo et reference-to-video, avec une sortie haute fidélité provenant de texte, d’image ou d’entrées vidéo.

Modèle compagnon de génération et d’édition d’images: text-to-image, modifications en boîte enbounding, et ensembles d’images cohérents, avec une sortie jusqu’à 4K sur Pro.
Transcription contrôlée Whisper Large v3 Turbo avec ASR multilingue, traduction, VAD, horodatages, sous-titres, hotwords et contrôles décodeurs.

Agent IA autonome qui transforme une invite de haut niveau en sous-tâches, appelle des outils et des API, et délivre end-to-end résultats sans orchestration manuelle.

Génération texte en vidéo, image-to-video et reference-to-video avec jusqu’à sept images de référence pour des caractères cohérents, jusqu’à 15 secondes en 1080p.

Modèle de premier plan pour les flux de travail agents, l’ingénierie logicielle complexe et les tâches à long terme, supportant le travail sur 1000+ appels d’outils sur un contexte 1M.

Modèle multimodal avec compréhension visuelle et audio native dans un contexte 1M, conçu pour raisonner et agir à travers différentes modalités dans des flux de travail agentiques.

Alibaba CloudSingaporePublié 22 juin 2026Génération de vidéosTexte, image et reference-to-video dans un seul modèle. Mouvement cinématographique, cohérence des personnages sur jusqu’à 9 références, et audio natif synchronisé.

Le niveau Seedance 2.0 le plus rapide et abordable pour les courts clips cinématographiques avec audio natif, contrôle de caméra, et entrées image ou vidéo en 480p et 720p.

StepFunInternationalPublié 28 mai 2026Ctx 256KGénération de texteModèle de raisonnement multimodal StepFun avec entrée image et vidéo, appel d’outils, effort de raisonnement ajustable et contexte 256K.

StepFunInternationalPublié 12 févr. 2026Ctx 256KGénération de texteModèle de raisonnement textuel StepFun pour agents, codage, appel d’outils et analyse à long contexte.

StepFunInternationalPublié 2 avr. 2026Ctx 256KGénération de texteVariante Flash Step 3.5 optimisée pour agent avec des modes d’effort de raisonnement faible et élevé.

Modèle de conversation audio et textuelle StepFun avec sortie texte et compréhension paralinguistique.

StepFunInternationalPublié 29 avr. 2026Génération d’imagesModèle de génération d’images et d’édition d’images StepFun pour les retouches text-to-image et sur une seule image.

Modèle text-to-speech Contextual StepFun avec une direction vocale en langage naturel et une interprétation expressive.

Modèle text-to-speech StepFun avec voix officielles, voix clonées personnalisées et contrôles de tag vocal.

Modèle de reconnaissance vocale en streaming StepFun pour la transcription audio chinoise et anglaise.

ByteDanceMalaysiaPublié 13 juil. 2026Ctx 256KGénération de texteModèle de codage et d’agent de nouvelle génération avec une livraison de code de qualité ingénierie, une autonomie à long terme et une compréhension multimodale 256K.

Alibaba CloudSingaporePublié 20 juil. 2026Production audioSynthèse vocale en paliers avec plus de 1 000 voix, 16 langues, 20 dialectes chinois, une direction de transmission en langue naturelle et des balises émotionnelles en ligne.

Génère des clips de 4 à 15 secondes jusqu’à 2K avec un audio stéréo natif, suivant des références texte, image, vidéo et audio dans une seule requête.

Le modèle d’image phare d’OpenAI offre une forte fidélité des invites, un rendu texte net et un montage basé sur des instructions sur jusqu’à 16 images de référence.

Le générateur vidéo Kling 3.0 de Kuaishou avec text-to-video, première et dernière image image-to-video, audio natif, et sorties 720p, 1080p ou 4K.

Le modèle vidéo Wan 2.5 d’Alibaba avec text-to-video et image-to-video, audio natif, pistes audio personnalisées en option, et sortie 480p à 1080p.

La famille vidéo Wan 2.2 d’Alibaba avec les niveaux standard et flash, l’interpolation de la première et de la dernière image, et une sortie 480p à 1080p à faible coût.

Le modèle vidéo Wan 2.1 d’Alibaba avec des niveaux turbo et plus pour text-to-video, image-to-video, ainsi que les premières et dernières images en 480p ou 720p.

Le modèle d’image Wan 2.5 d’Alibaba avec text-to-image et un montage multi-référence allant jusqu’à 3 images à environ 1,7 mégapixel.

Le modèle Wan 2.2 d’Alibaba text-to-image avec des niveaux plus et flash et une sortie allant jusqu’à 1440x1440 à bas prix par image.

Le modèle Wan 2.1 text-to-image d’Alibaba avec des niveaux turbo et plus et une puissance allant jusqu’à 1440x1440 à bas prix par image.

Modèle vidéo long pour des clips cohérents jusqu’à 30 secondes, avec jusqu’à 50 images de référence, vidéos et extraits audio, audio natif, montage et extension.
140 / 155 Modèles