
Texte en vidéo et image-to-video avec audio natif synchronisé, en 720p ou 1080p pendant 3 à 15 secondes, avec contrôle au format et aux invites.
Payez uniquement pour ce que vous utilisez. Aucun verrouillage d’abonnement.
Catalogue tarifaire
La tarification d’EmpirioLabs varie selon le modèle et l’unité: jetons, images, secondes audio ou vidéo, messages, ressources 3D et requêtes de recherche. La table de tarification interactive charge le catalogue actuel, tandis que ces taux représentatifs restent lisibles sans JavaScript client.
L’entrée d’image $0.05 par image. La sortie vidéo commence à $0.096 par seconde pour le 480p et à $0.168 par seconde pour le 720p.
L’entrée commence à $0.40 par 1M de jetons d’invite pour une API multimodale à long contexte rentable.
L’entrée commence à $0.30 par jetons d’invite de 1 million pour le raisonnement multimodal, le codage et les charges de travail d’agents.
La génération image vers 3D est tarifée par actif 3D généré, avec des documents pour les contrôles de format et de résolution.
Les tarifs de l'API des modèles sont affichés et facturés en USD. Le checkout peut afficher des moyens de paiement locaux lorsqu'ils sont éligibles.

Texte en vidéo et image-to-video avec audio natif synchronisé, en 720p ou 1080p pendant 3 à 15 secondes, avec contrôle au format et aux invites.

Modèle de raisonnement et de codage avec un contexte de jeton 1M, sortie 128K, effort de raisonnement ajustable, recherche web native et appel d’outils.

Modèle de raisonnement et de codage avec un contexte de jeton 1M, sortie 128K, effort de raisonnement ajustable, recherche web native et appel d’outils.

Moonshot AIInternationalPublié 15 juil. 2026Ctx 1MGénération de texteKimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

Moonshot AIInternationalPublié 16 juin 2026Ctx 256KGénération de texteLe code Kimi K2.7 est le modèle de codage agent à un billion de paramètres de Moonshot avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées texte, image et vidéo.

Moonshot AIGermanyPublié 16 juin 2026Ctx 256KGénération de texteLe code Kimi K2.7 est le modèle de codage agent à un billion de paramètres de Moonshot avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées texte, image et vidéo.

Modèle de raisonnement de meta-frontier avec un contexte de jeton de 1M, compréhension image et vidéo, recherche web intégrée avec sources citées, et appel d’outils.

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

Alibaba CloudSingaporePublié 1 juin 2026Ctx 1MGénération de texteModèle de langage de vision Qwen3.7 rentable pour le texte, l'image, la vidéo, le codage, l'utilisation d'outils, la compréhension de l'interface graphique et les flux de travail 1M-context.

Modèle de langage de vision Qwen3.7 rentable pour le texte, l'image, la vidéo, le codage, l'utilisation d'outils, la compréhension de l'interface graphique et les flux de travail 1M-context.

Moonshot AIInternationalPublié 16 juin 2026Ctx 256KGénération de texteKimi K2.7 Code Highspeed est la couche de service plus rapide du modèle de codage agent de Moonshot, avec un contexte 256K, un raisonnement toujours activé, ainsi que des entrées image et vidéo.

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Alibaba CloudSingaporePublié 15 juil. 2026Ctx 1MGénération de texteFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

Alibaba CloudChinaPublié 15 juil. 2026Ctx 1MGénération de texteFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

MiniMax M3 est un modèle de raisonnement multimodal pour le codage, les agents et l'analyse de long-contexte avec entrée texte, image et vidéo.

MiniMax M3 est un modèle de raisonnement multimodal pour le codage, les agents et l'analyse de long-contexte avec entrée texte, image et vidéo.

Alibaba CloudSingaporePublié 21 mai 2026Ctx 1MGénération de texteQwen3.7 Max est un modèle de texte phare pour le codage, la productivité, les agents de longue durée, la pensée profonde, les outils et le contexte de jeton 1M.

Qwen3.7 Max est un modèle de texte phare pour le codage, la productivité, les agents de longue durée, la pensée profonde, les outils et le contexte de jeton 1M.
Modèle de génération musicale open source pour l’audio guidé par text-to-song et paroles, avec une inférence XL Turbo rapide en 8 étapes pour une itération contrôlable des chansons.

Modèle de génération et d’édition d’images Klein 4B FLUX.2 sous licence Apache avec text-to-image, retouche d’images de référence et support de flux de travail créatif.

MiniMaxSingaporePublié 18 mars 2026Ctx 200KGénération de texteVariante M2.7 à haute vitesse adaptée à une inférence rapide avec une performance générale forte avec de fortes capacités agentsiques.
Modèle de voix en temps réel avec une direction en anglais simple, une identité vocale unique sur 100+ langues, et time-to-first-audio en streaming sous 200 ms.
Sous-130ms TTFB synthèse vocale avec 271+ voix dans 15 langues, prosody expressive, et en temps réel SSE streaming pour les agents de voix à faible latence.
Synthèse vocale de qualité radiodiffusée avec prosody expressive riche, 271+ voix dans 15 langues, et diffusion SSE en temps réel avec horodatage par mot.

Modèle de raisonnement IA Zhipu à long contexte avec contexte 202K, sortie 128K, appel d’outils, sortie structurée et support du cache.

Kimi K2.6 est un modèle de raisonnement multimodal Moonshot avec un contexte 256K, un codage fort, ainsi que des entrées texte, image et vidéo.

MiniMaxSingaporePublié 18 mars 2026Ctx 200KGénération de texteMiniMax M2.7 est un modèle de discussion de raisonnement à usage général avec une pensée entrelacée, un appel de fonction et une mise en cache rapide.
TRELLIS.2 modèle image à 3D qui transforme une image de référence en un actif GLB texturé avec résolution, graine, maillage, texture et contrôles d'exportation.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 256KGénération de texteQwen3.5 122B-A10B est un modèle de raisonnement multimodal avec un contexte 256K, une inférence efficace et clairsemée du MoE et une entrée texte, image et vidéo.

Alibaba CloudChinaPublié 16 févr. 2026Ctx 256KGénération de texteQwen3.5 397B-A17B est un modèle de raisonnement multimodal phare pour la langue, le code, les agents, les tâches de l'interface graphique et la compréhension de l'image et de la vidéo.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 256KGénération de texteQwen3.5 35B-A3B est un modèle de langage de vision natif efficace avec un routage clairsemé du MoE, une pensée profonde et une entrée texte, image et vidéo.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 256KGénération de texteQwen3.5 27B est un modèle de raisonnement multimodal dense avec des réponses rapides, un contexte 256K et une compréhension du texte, de l'image et de la vidéo.

Alibaba CloudChinaPublié 22 avr. 2026Ctx 256KGénération de texteQwen3.6 27B améliore le codage agentique, le raisonnement STEM, la vision spatiale, l'OCR, le texte, l'image et la compréhension vidéo sur le contexte 256K.

Alibaba CloudSingaporePublié 16 avr. 2026Ctx 1MGénération de texteModèle rapide de langage de vision Qwen3.6 pour le codage agentique, le raisonnement mathématique, la compréhension spatiale, l'OCR et l'entrée texte, image et vidéo.

Alibaba CloudChinaPublié 16 avr. 2026Ctx 1MGénération de texteModèle rapide de langage de vision Qwen3.6 pour le codage agentique, le raisonnement mathématique, la compréhension spatiale, l'OCR et l'entrée texte, image et vidéo.

Gemma 4 26B A4B est un modèle multimodal ouvert Google avec 256K contexte, texte, image et entrées vidéo, outils et sorties structurées.

Qwen3.5 9B est un modèle de raisonnement multimodal compact avec un contexte 256K, une entrée image et vidéo, des outils de fonction et une sortie structurée.

Qwen3.5 4B est un modèle de raisonnement multimodal à faible coût avec un contexte 256K, une entrée image et vidéo, des outils de fonction et une sortie structurée.

Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

Modèle texte GLM-4.7 léger gratuit pour le codage, le raisonnement, l’écriture en contexte long et le chat général.

Modèle texte GLM-4.5 léger gratuit pour le raisonnement, le codage, le chat long format et les tâches linguistiques générales.

Modèle multimodal GLM-4.6V gratuit pour la compréhension d’images, vidéos, fichiers et texte avec appel de fonction natif.

La génération et l’édition d’images modèlent la création et la modification d’images à partir de texte ou d’entrées d’images, avec inpainting, essais virtuels et contrôles de style.

Modèle de génération vidéo produisant jusqu’à 2 minutes de vidéos multi-plans à partir de texte et d’images optionnelles, avec une qualité et une cohérence améliorées.

La transcription vocale en texte utilisant le modèle Nova-3 avec prise en charge multilingue et réglages avancés personnalisables pour les charges de production.

Associe DeepSeek R1 chain-of-thought raisonnement avec Anthropic Claude créatif et génération de code derrière une interface unifiée contrôlée par les données.

LLM open source spécialisé dans la démonstration formelle de théorèmes en Lean 4, basé sur un pipeline récursif de démonstration de théorèmes.

DeepSeekSingaporePublié 1 déc. 2025Ctx 128KGénération de texteLLM open source Mixture-of-Experts, adapté pour un raisonnement efficace, du codage et des tâches générales de langage à travers des prompts longs.

DeepSeekGermanyPublié 24 avr. 2026Ctx 1MGénération de texteModèle MoE léger avec 284 B de paramètres totaux / 13 milliards de paramètres actifs et un contexte natif 1M, ajusté pour une utilisation à faible latence et à haute concurrence économique.

DeepSeekSingaporePublié 24 avr. 2026Ctx 1MGénération de texteModèle MoE léger avec 284 B de paramètres totaux / 13 milliards de paramètres actifs et un contexte natif 1M, ajusté pour une utilisation à faible latence et à haute concurrence économique.

DeepSeekChinaPublié 24 avr. 2026Ctx 1MGénération de texteModèle MoE léger avec 284 B de paramètres totaux / 13 milliards de paramètres actifs et un contexte natif 1M, ajusté pour une utilisation à faible latence et à haute concurrence économique.

DeepSeekGermanyPublié 24 avr. 2026Ctx 1MGénération de texteLLM MoE phare avec 1,6T au total / 49B de paramètres actifs et un contexte natif 1M pour les mathématiques avancées, l’inférence logique et le codage spécialisé.

DeepSeekSingaporePublié 24 avr. 2026Ctx 1MGénération de texteLLM MoE phare avec 1,6T au total / 49B de paramètres actifs et un contexte natif 1M pour les mathématiques avancées, l’inférence logique et le codage spécialisé.

LLM MoE phare avec 1,6T au total / 49B de paramètres actifs et un contexte natif 1M pour les mathématiques avancées, l’inférence logique et le codage spécialisé.

Réponse rapide de type LLM à une question en langage naturel, fondée sur de nouveaux résultats de recherche exa web avec des citations en ligne et des liens sources.

Moteur de recherche web pour trouver des pages, récupérer des pages similaires, explorer et rechercher du code dédié sur le web ouvert pour les agents IA.

Faible latence text-to-speech avec voix à un ou plusieurs haut-parleurs, ainsi qu’un style, un accent et un ton expressif contrôlables pour les applications de production.

Aperçu TTS de haute qualité pour podcasts, livres audio et support client, avec des voix expressives multi-haut-parleurs dans 23+ langues.

TTS hautement contrôlable avec de nouvelles balises audio pour un style, un ton, un rythme et une livraison précis via narration, assistants et applications vocales.

Modèle de langage visionnaire open source avec contexte 128K, 140+ langues, math/reasoning amélioré, sorties structurées et appel de fonctions.

text-to-speech basées sur LLM avec clonage vocal zéro shot de 3 à 10 secondes d’audio et une sortie contrôlable et expressive émotionnelle via RL multi-récompenses.

Détecteur d’apprentissage profond qui signale les parties de texte probablement générées par l’IA par rapport à l’humain, classant le contenu comme entièrement humain, IA ou mixte.

Modèle vidéo proposant des modes Text-to-Video, Image-to-Video, Reference-to-Video et Édition Vidéo avec une sortie haute fidélité et fluide au mouvement.

Modèle text-to-image open source sur une architecture multimodale Mixture-of-Experts, avec un niveau de détail photoréaliste et un rendu textuel multilingue puissant.

Modèle vidéo à paramètres 8,3B avec sortie native 720p (upscalable en 1080p), forte cohérence de mouvement et compréhension bilingue des prompts jusqu’à 10 secondes.

Cadre autorégressif sur le modèle Janus Pro 7B qui unifie la compréhension multimodale et la génération d’images en une seule architecture.

Modèle vidéo en mode Standard ou Pro avec transitions Text-to-Video, Image-to-Video, Reference-to-Video, édit, son natif et multi-scène.

Modèle Kling 3.0 qui transfère le mouvement d'une vidéo de référence sur un personnage d'une image de référence, avec les niveaux Standard 720p et Pro 1080p.

Recherche itérative d'IA qui continue à interroger lorsque les résultats initiaux sont insuffisants, en retournant des réponses plus complètes que le mode Standard.

Recherche en ligne alimentée par l'IA avec des aperçus détaillés et des réponses, plus rapidement que la recherche profonde. Classement 1 sur OpenAI SimpleQA benchmark.

Modèle linguistique rentable offrant un raisonnement solide et une performance multimodale pour les charges de production générales à la latence concurrentielle.

Mistral AIPublié 12 août 2025Ctx 131KGénération de texteModèle de qualité Enterprise avec un raisonnement fort, un codage et des performances STEM, supportant les déploiements hybrides, sur-prime et in-VPC.

Modèle multimodal 24B avec un contexte 128K pour l'analyse d'image, la programmation, les maths et les tâches multilingues.

Modèle hybride unifiant Instruct, Reasoning (Magistral) et les familles Devstral: 40% moins de temps d'achèvement et 3x débit vs Small 3.

Open-source 32B MoE modèle de fondation qui génère la vidéo et l'audio synchronisés dans une étape de inférence avec dual-tower lip-sync précise.

Modèle de base multimodal à faible coût pour le texte, les images et la vidéo sur un contexte de 300K (jusqu'à ~30 min de vidéo), adapté pour la vitesse et l'abordabilité.

Modèle de raisonnement multimodal rapide et rentable pour le texte, les images, les documents et la vidéo sur un contexte 1M (long docs et ~90 min clips).

Modèle de fondation text-only accordé pour une latence ultra-faible et coût sur le contexte 128K. Fort pour résumer, traduire et discuter avec 44% de réduction cache.

Modèle le plus capable de la famille. Multimodal text/image /vidéo sur un contexte 1M avec un raisonnement chain-of-thought entre outils et sources de données.

Modèle de fondation multimodal équilibre la précision, la vitesse et le coût du texte, des images et de la vidéo sur le contexte 300K (jusqu'à ~30 min de vidéo).

Whisper-1 speech-to-text transcription formée sur audio supervisé multilingue, avec une limite de téléchargement de 25 Mo par fichier.

Recherche de niveau institutionnel alimentée par le raisonnement de Claude Opus 4.6, avec une profondeur maximale, un accès amélioré aux outils et une couverture étendue des sources.

Modèle de recherche pour la recherche en plusieurs étapes, la synthèse et le raisonnement, la recherche autonome, la lecture et l'évaluation des sources sur des sujets complexes.

Sonar Pro en tant que chercheur agentique: enchaîne les recherches sur le Web, récupère les pages complètes et diffuse le raisonnement en direct, adaptant la stratégie aux requêtes complexes.

Recherche web en temps réel avec filtrage par domaine, langue, date, et plus encore. Retourne les résultats de recherche, pas les réponses LLM; aucun téléchargement de fichier.

Recherche connectée en temps réel avec citations précises et sources personnalisables pour l'intégration de la recherche AI dans les applications de production.

Modèle basé sur la recherche avec double citations et une fenêtre contextuelle plus grande, accordé pour des requêtes complexes nécessitant des réponses approfondies et nuancées.

Modèle de raisonnement sur le R1-1776 open-source non censuré avec recherche web, surperformant les principaux moteurs de recherche et les LLM sur la référence SimpleQA.

Génération de vidéos cinématographiques en mode texte-vidéo, image-vidéo et transition avec un grand détail, un mouvement fluide et des animations réalistes.

Génére des vidéos à partir de texte ou 1-2 images de cadre invite jusqu'à 1080p, rapports d'aspects multiples, durées 5-10s, avec audio synchronisé optionnel.

Modèle de génération et d'édition d'images unifiées avec un complexe de classe Chinese/English, des textures réalistes et une fusion multi-images.

Alibaba CloudSingaporePublié 24 févr. 2026Ctx 1MGénération de texteModèle de langage de vision avec une attention linéaire hybride plus un MoE clairsemé, un contexte 1M et une inférence vidéo multimodale rapide text/image.

Alibaba CloudChinaPublié 24 févr. 2026Ctx 1MGénération de texteModèle de langage de vision avec une attention linéaire hybride plus un MoE clairsemé, un contexte 1M et une inférence vidéo multimodale rapide text/image.

Alibaba CloudSingaporePublié 30 mars 2026Ctx 256KGénération de texteModèle omni-modal économique de traitement de texte, d'image, audio et vidéo, avec jusqu'à 3 heures d'audio et 1 heure de vidéo dans plus de 90 langues.

Alibaba CloudSingaporePublié 30 mars 2026Ctx 256KGénération de texteModèle omnimodal phare pour texte, image, audio et vidéo. 3h audio, 1h vidéo, 90+ entrée et 30+ sortie langues, 55 timbres de voix.

Alibaba CloudSingaporePublié 16 févr. 2026Ctx 1MGénération de texteModèle multimodal avec architecture hybride pour une pensée profonde et une compréhension visuelle efficaces sur texte, image et vidéo sur un contexte 1M.

Alibaba CloudChinaPublié 16 févr. 2026Ctx 1MGénération de texteModèle multimodal avec architecture hybride pour une pensée profonde et une compréhension visuelle efficaces sur texte, image et vidéo sur un contexte 1M.

Alibaba CloudSingaporePublié 20 avr. 2026Ctx 256KGénération de texteVariante de prévisualisation la plus importante de la série 3.6 (texte seulement): meilleure exécution de l'agent de codage, compétences de front-end plus solides et connaissance longue queue plus large.

Alibaba CloudSingaporePublié 2 avr. 2026Ctx 1MGénération de texteModèle de langage de vision avec des mises à niveau majeures supérieures à 3,5: codage agentique et frontal, reconnaissance multimodale, ROC et localisation des objets.

Modèle de langage de vision avec des mises à niveau majeures supérieures à 3,5: codage agentique et frontal, reconnaissance multimodale, ROC et localisation des objets.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 256KGénération de texte256K-context phare avec des améliorations majeures dans le raisonnement, l'instruction suivant, et le soutien multilingue, plus plus haute coding/math précision.

Alibaba CloudSingaporePublié 5 sept. 2025Ctx 256KGénération de textePrévisualiser la sortie avec des gains majeurs sur la série 2.5 dans la compréhension chinois-anglais, des instructions complexes, la capacité multilingue, et l'utilisation des outils.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 256KGénération de texteModèle de raisonnement avec utilisation d'outils adaptatifs (recherche, mémoire, interprète de code) et échelle de temps de test pour une plus grande précision sur les tâches complexes.

Document sémantique reclassé. Trie jusqu'à 500 candidats par question par pertinence, prend en charge plus de 100 langues, et accepte une instruction de tri personnalisée.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteCodage-accordé 256K-context modèle avec des résultats frontaux solides et un support de programmation multilingue pour les outils et agents de codage d'IA.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteModèle général équilibré pour les charges de travail des entreprises à haute fréquence: traitement de l'information, contenu, recherche et analyse des données.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteModèle multimodal axé sur la latence avec un contexte 256K, quatre modes d'effort de raisonnement et une compréhension image/video pour une utilisation à haute devises.

ByteDanceMalaysiaPublié 14 févr. 2026Ctx 256KGénération de texteModèle général phare avec un contexte 256K pour le raisonnement complexe, la compréhension multimodale, la génération structurée et l'exécution augmentée d'outils.

ByteDanceMalaysiaPublié 12 févr. 2026Génération de vidéosVariante vidéo 2.0 optimisée pour les clips cinématographiques avec synchronisation audio native, contrôle de la caméra et mouvement stable à moindre coût par rendu.

Modèle vidéo multimodal pour sortie cinématographique à partir d'entrées texte, image, audio ou vidéo, avec un mouvement stable et des caractères cohérents.

Modèle d'image multimodale unifiée qui raisonne par l'intermédiaire d'invites avant le rendu, produisant des modifications à haute résolution et cohérentes et des visuels de marque.

Modèle d’image Premium Seedream pour text-to-image détaillés, modifications d’image unique et fusion multi-référence avec sortie 1K et 2K.

Modèle vocal open source pour le dialogue podcast multi haut-parleurs à longue forme avec contrôle paralinguistique (rire, soupirs) et clonage vocal à zéro.

Génére l'audio jusqu'à 3 minutes à partir d'invites de texte, supportant text-to-audio et audio-to-audio avec durée réglable, étapes et échelle CFG.

Up to-3-minute audio à partir de texte avec text-to-audio, audio-to-audio, et l'inpeinture audio pour la production musicale, la conception sonore et le remixage.

Stable Video Infinity 2.0 Pro sur WAN 2.2: étend les images fixes en vidéo théoriquement infinie tout en conservant des identifiants de caractères cohérents.

Assistant de recherche multi-recherche qui explore un sujet, analyse les sources et produit un rapport de recherche détaillé avec des citations.

Recherche Web avec ramper, extraire et cartographie URL pour une récupération rapide et structurée à travers les pages et les domaines pour les pipelines en aval.

Alibaba CloudSingaporePublié 4 juin 2025Ctx 8192EncastrementsIntégration multilingue du texte avec des dimensions de sortie sélectionnables (64-2048). Jusqu'à 8 192 jetons par entrée.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 1024EncastrementsIntégration multimodale optimisée de vitesse - même forme que Vision-Plus, 3× moins cher image/video jetons.

Alibaba CloudSingaporePublié 23 sept. 2025Ctx 1024EncastrementsIntégration multimodale produisant des vecteurs indépendants pour les entrées texte, image et vidéo.

Modèle de génération vidéo multimodale pour des histoires cinématographiques et multi-captures avec synchronisation audio-visuelle native (lip-sync, dialogue, musique, SFX).

Modèle vidéo multimodal prenant en charge T2V, I2V, montage vidéo, et reference-to-video, avec sortie haute fidélité à partir d'entrées texte, image ou vidéo.

Modèle compagnon de génération et d'édition d'images: text-to-image, reliure-box et ensembles d'images cohésives, avec une sortie jusqu'à 4K sur Pro.
Transcription contrôlée Whisper Large v3 Turbo avec ASR multilingue, traduction, VAD, horodatages, sous-titres, hotwords et contrôles décodeurs.

Agent d'IA autonome qui transforme une prompte de haut niveau en sous-tâches, appels d'outils et API, et délivre des résultats end-to-end sans orchestration manuelle.

Modèle image-vidéo qui anime une image source avec un mouvement guidé par prompt, jusqu’à 15 secondes en 480p ou 720p sur sept formats d’aspect.

Modèle de haut niveau pour les workflows d'agents, l'ingénierie logicielle complexe et les tâches de longue durée, le maintien du travail sur 1000+ appels d'outils sur le contexte 1M.

Modèle multimodal avec compréhension visuelle et audio native sur un contexte 1M, conçu pour raisonner et agir selon les modalités dans les flux de travail d'agents.

Alibaba CloudSingaporePublié 22 juin 2026Génération de vidéosTexte, image et reference-to-video dans un seul modèle. Mouvement cinématographique, cohérence des personnages sur jusqu’à 9 références, et audio natif synchronisé.

Le niveau Seedance 2.0 le plus rapide et abordable pour les courts clips cinématographiques avec audio natif, contrôle de caméra, et entrées image ou vidéo en 480p et 720p.

StepFunInternationalPublié 28 mai 2026Ctx 256KGénération de texteModèle de raisonnement multimodal StepFun avec entrée image et vidéo, appel d’outils, effort de raisonnement ajustable et contexte 256K.

StepFunInternationalPublié 12 févr. 2026Ctx 256KGénération de texteModèle de raisonnement textuel StepFun pour agents, codage, appel d’outils et analyse à long contexte.

StepFunInternationalPublié 2 avr. 2026Ctx 256KGénération de texteVariante Flash Step 3.5 optimisée pour agent avec des modes d’effort de raisonnement faible et élevé.

Modèle de conversation audio et textuelle StepFun avec sortie texte et compréhension paralinguistique.

StepFunInternationalPublié 29 avr. 2026Génération d'imagesModèle de génération d’images et d’édition d’images StepFun pour les retouches text-to-image et sur une seule image.

Modèle text-to-speech Contextual StepFun avec une direction vocale en langage naturel et une interprétation expressive.

Modèle text-to-speech StepFun avec voix officielles, voix clonées personnalisées et contrôles de tag vocal.

Modèle de reconnaissance vocale en streaming StepFun pour la transcription audio chinoise et anglaise.

ByteDanceMalaysiaPublié 13 juil. 2026Ctx 256KGénération de texteNext-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Alibaba CloudSingaporePublié 20 juil. 2026Production audioTiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 Modèles