
Texto a video e imagen a video con audio nativo sincronizado, en 720p o 1080p durante 3 a 15 segundos, con control de relacion de aspecto y prompt.
Paga solo por lo que uses. No hay bloqueos de suscripción.
Catálogo de precios
El precio de EmpirioLabs varía según el modelo y la unidad: tokens, imágenes, segundos de audio o vídeo, mensajes, recursos 3D y solicitudes de búsqueda. La tabla interactiva de precios carga el catálogo actual, mientras que estas tarifas representativas permanecen legibles sin JavaScript del cliente.
La entrada de imagen $0.05 por imagen. La salida de vídeo empieza a $0.096 por segundo para 480p y $0.168 por segundo para 720p.
La entrada comienza en $0.40 por cada 1M de tokens de prompt para una API multimodal de contexto largo rentable.
La entrada comienza en $0.30 por cada token de 1M de prompt para razonamiento multimodal, codificación y cargas de trabajo de agentes.
La generación de imagen a 3D se valora por cada activo 3D generado, con documentación para controles de formato y resolución.
Las tarifas de la API de modelos se muestran y se facturan en USD. El checkout puede mostrar métodos de pago locales cuando sean elegibles.

Texto a video e imagen a video con audio nativo sincronizado, en 720p o 1080p durante 3 a 15 segundos, con control de relacion de aspecto y prompt.

Modelo de razonamiento y codigo con contexto de 1M de tokens, salida de 128K, esfuerzo de razonamiento ajustable, busqueda web nativa y llamadas a herramientas.
Modelo de razonamiento y codigo con contexto de 1M de tokens, salida de 128K, esfuerzo de razonamiento ajustable, busqueda web nativa y llamadas a herramientas.

Kimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

Moonshot AIInternationalLanzado 16 jun 2026Ctx 256KGeneracion de textoKimi K2.7 Code es el modelo de codigo agentico de un billon de parametros de Moonshot, con contexto de 256K, razonamiento siempre activo y entradas de texto, imagen y video.

Moonshot AIGermanyLanzado 16 jun 2026Ctx 256KGeneracion de textoKimi K2.7 Code es el modelo de codigo agentico de un billon de parametros de Moonshot, con contexto de 256K, razonamiento siempre activo y entradas de texto, imagen y video.

Modelo de razonamiento metafrontera con un contexto de token de 1M, comprensión de imágenes y vídeos, búsqueda web integrada con fuentes citadas y llamada a herramientas.

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

Modelo de visión Qwen3.7 rentable para texto, imagen, vídeo, codificación, uso de herramientas, comprensión de la interfaz gráfica y flujos de trabajo de contexto 1M.

Modelo de visión Qwen3.7 rentable para texto, imagen, vídeo, codificación, uso de herramientas, comprensión de la interfaz gráfica y flujos de trabajo de contexto 1M.

Moonshot AIInternationalLanzado 16 jun 2026Ctx 256KGeneracion de textoKimi K2.7 Code Highspeed es la capa de servicio más rápido del modelo de codificación agente de Moonshot, con contexto de 256K, razonamiento siempre activado y entrada de imagen y vídeo.

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Alibaba CloudSingaporeLanzado 15 jul 2026Ctx 1MGeneracion de textoFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

MiniMax M3 es un modelo de razonamiento multimodal para codificación, agentes y análisis de contexto largo con entrada de texto, imagen y vídeo.

MiniMax M3 es un modelo de razonamiento multimodal para codificación, agentes y análisis de contexto largo con entrada de texto, imagen y vídeo.

Qwen3.7 Max es un modelo de texto emblemático para programación, productividad, agentes de larga duración, pensamiento profundo, herramientas y contexto de 1M de tokens.

Qwen3.7 Max es un modelo de texto emblemático para programación, productividad, agentes de larga duración, pensamiento profundo, herramientas y contexto de 1M de tokens.
Modelo de generación musical de código abierto para audio guiado por text-to-song y letras, con inferencia XL Turbo rápida de 8 pasos para iteraciones controlables de canciones.

Modelo de generación y edición de imágenes 4B FLUX.2 Klein con licencia apache con soporte de text-to-image, edición de imágenes de referencia y flujo de trabajo creativo.

MiniMaxSingaporeLanzado 18 mar 2026Ctx 200KGeneracion de textoVariante M2.7 de alta velocidad ajustada para una inferencia rápida con un alto rendimiento de propósito general y grandes capacidades agentes.
Modelo de voz en tiempo real con dirección de voz en inglés sencillo, una identidad de voz en 100+ idiomas y time-to-first-audio de streaming por debajo de 200 ms.
Síntesis de voz TTFB por debajo de 130 ms con 271+ voces en 15 idiomas, prosodia expresiva y streaming SSE en tiempo real para agentes de voz de baja latencia.
Síntesis de voz de calidad de emisión con prosodia expresiva rica, 271+ voces en 15 idiomas y transmisión SSE en tiempo real con marcas de tiempo por palabra.
Modelo de razonamiento de IA Zhipu de largo contexto con contexto 202K, salida 128K, llamada a herramientas, salida estructurada y soporte para caché.

Kimi K2.6 es un modelo de razonamiento multimodal Moonshot con contexto 256K, codificación fuerte y entradas de texto, imagen y vídeo.

MiniMax M2.7 es un modelo de chat de razonamiento de propósito general con pensamiento entrelazado, llamadas a funciones y caché de prompts.
TRELLIS.2 modelo de imagen a 3D que convierte una imagen de referencia en un recurso GLB texturizado con controles de resolución, semilla, malla, textura y exportación.

Alibaba CloudChinaLanzado 24 feb 2026Ctx 256KGeneracion de textoQwen3.5 122B-A10B es un modelo de razonamiento multimodal con contexto de 256K, inferencia eficiente y escasa de MoE, y entrada de texto, imagen y vídeo.

Alibaba CloudChinaLanzado 16 feb 2026Ctx 256KGeneracion de textoQwen3.5 397B-A17B es un modelo de razonamiento multimodal emblemático para lenguaje, código, agentes, tareas de interfaz gráfica y comprensión de imágenes y vídeos.

Alibaba CloudChinaLanzado 24 feb 2026Ctx 256KGeneracion de textoQwen3.5 35B-A3B es un modelo nativo de visión y lenguaje eficiente con un enrutamiento MoE escaso, pensamiento profundo y entrada de texto, imagen y vídeo.

Qwen3.5 27B es un modelo de razonamiento multimodal denso con respuestas rápidas, contexto 256K y comprensión de texto, imagen y vídeo.

Qwen3.6 27B mejora la codificación agente, el razonamiento STEM, la visión espacial, el OCR y la comprensión de texto, imagen y vídeo en contexto 256K.

Alibaba CloudSingaporeLanzado 16 abr 2026Ctx 1MGeneracion de textoModelo de visión Fast Qwen3.6 para codificación agente, razonamiento matemático, comprensión espacial, OCR, y entrada de texto, imagen y vídeo.

Modelo de visión Fast Qwen3.6 para codificación agente, razonamiento matemático, comprensión espacial, OCR, y entrada de texto, imagen y vídeo.

Gemma 4 26B A4B es un modelo multimodal abierto de Google con 256K de contexto, texto, imagen y entrada de vídeo, herramientas y salida estructurada.

Qwen3.5 9B es un modelo de razonamiento multimodal compacto con 256K de contexto, entrada de imagen y vídeo, herramientas funcionales y salida estructurada.

Qwen3.5 4B es un modelo de razonamiento multimodal de bajo coste con 256K de contexto, entrada de imagen y vídeo, herramientas funcionales y salida estructurada.

Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

Modelo de texto GLM-4.7 gratuito y ligero para codificación, razonamiento, escritura en contexto largo y chat general.

Modelo de texto GLM-4.5 gratuito y ligero para razonamiento, programación, chat de formato largo y tareas generales de lenguaje.

Modelo multimodal gratuito de GLM-4.6V para comprensión de imágenes, vídeos, archivos y texto con llamada a funciones nativas.

La generación y edición de imágenes modela creando y modificando imágenes a partir de texto o entradas de imagen, con inpainting, prueba virtual y controles de estilo.

Modelo de generación de vídeo que produce vídeos de hasta 2 minutos con múltiples tomas a partir de texto y prompts de imagen opcionales con mejor calidad y consistencia.

Transcripción de voz a texto usando el modelo Nova-3 con soporte multilingüe y ajustes avanzados personalizables para cargas de producción.

Combina DeepSeek R1 chain-of-thought razonamiento con Anthropic Claude la creación y generación de código detrás de una interfaz unificada controlada por datos.

LLM de código abierto especializado en demostración formal de teoremas en Lean 4, basado en una cadena recursiva de demostración de teoremas.

LLM de código abierto Mixture-of-Experts optimizado para razonamiento, programación y tareas generales de lenguaje de alta eficiencia a través de prompts de formato largo.

Modelo MoE ligero con 284B de parámetros totales / 13B activos y contexto nativo de 1M, ajustado para un uso de baja latencia y alta concurrencia rentable.

DeepSeekSingaporeLanzado 24 abr 2026Ctx 1MGeneracion de textoModelo MoE ligero con 284B de parámetros totales / 13B activos y contexto nativo de 1M, ajustado para un uso de baja latencia y alta concurrencia rentable.

Modelo MoE ligero con 284B de parámetros totales / 13B activos y contexto nativo de 1M, ajustado para un uso de baja latencia y alta concurrencia rentable.

LLM MoE insignia con 1,6T totales / 49B parámetros activos y contexto nativo de 1M para matemáticas avanzadas, inferencia lógica y codificación especializada.

LLM MoE insignia con 1,6T totales / 49B parámetros activos y contexto nativo de 1M para matemáticas avanzadas, inferencia lógica y codificación especializada.

LLM MoE insignia con 1,6T totales / 49B parámetros activos y contexto nativo de 1M para matemáticas avanzadas, inferencia lógica y codificación especializada.

Respuesta rápida al estilo LLM a una pregunta en lenguaje natural, basada en resultados de búsqueda web exa frescos con citas en línea y enlaces a fuentes.

Motor de búsqueda web para encontrar páginas, recuperar páginas similares, rastrear y buscar código dedicado en la web abierta para agentes de IA.

Baja latencia text-to-speech con voces de un y varios altavoces y estilo, acento y tono expresivo controlables para aplicaciones de producción.

Vista previa TTS de alta calidad para podcasts, audiolibros y atención al cliente, con voces expresivas con múltiples altavoces en 23+ idiomas.

TTS altamente controlable con nuevas etiquetas de audio para un estilo, tono, ritmo y entrega precisos en narración, asistentes y aplicaciones de voz.

Modelo de lenguaje de visión de código abierto con contexto de 128K, 140+ lenguajes, math/reasoning mejorado, salidas estructuradas y llamadas a funciones.

text-to-speech basado en LLM con clonación de voz sin disparo a partir de 3-10 segundos de audio y salida expresiva emocionalmente controlable mediante RL multi-recompensa.

Detector de aprendizaje profundo que señala partes de texto probablemente generadas por IA frente a humanas, clasificando el contenido como completamente humano, IA o mixto.

Modelo de vídeo que ofrece modos Texto a Vídeo, Imagen a Vídeo, Referencia a Vídeo y Edición de Vídeo con salida de alta fidelidad y fluidez para el movimiento.

Modelo de text-to-image de código abierto sobre una arquitectura multimodal Mixture-of-Experts con detalle fotorrealista y un renderizado de texto multilingüe potente.
Modelo de vídeo de 8.3B parámetros con salida nativa 720p (escalable a 1080p), coherencia de movimiento fuerte y comprensión bilingüe de prompts de hasta 10s.

Marco autorregresivo en el modelo Janus Pro 7B que unifica la comprensión multimodal y la generación de imágenes en una sola arquitectura.

Modelo de vídeo en modos Standard o Pro con Texto a Vídeo, Imagen a Vídeo, Referencia a Vídeo, edición, sonido nativo y transiciones multiescena.

Kling 3.0 modelo que transfiere movimiento de un vídeo de referencia a un personaje de una imagen de referencia, con niveles estándar 720p y Pro 1080p.

Búsqueda iterativa de IA que sigue consultando cuando los resultados iniciales son insuficientes, devolviendo respuestas más completas que el modo Estándar.

Búsqueda web impulsada por IA con resúmenes detallados y respuestas, más rápida que la búsqueda profunda. Ocupa el puesto #1 en el benchmark de OpenAI SimpleQA.

Modelo de lenguaje rentable que ofrece un razonamiento sólido y un rendimiento multimodal para cargas de trabajo generales de producción con latencia competitiva.

Modelo de nivel empresarial con un razonamiento sólido, programación y rendimiento STEM, que soporta despliegues híbridos, on-premises e in-VPC.

Modelo multimodal de 24B parámetros con contexto de 128K para análisis de imágenes, programación, matemáticas y tareas multilingües, ajustado para una inferencia local eficiente.

Modelo híbrido que unifica las familias Instruct, Razonamiento (Magistral) y Devstral: 40% menos tiempo de finalización y 3x rendimiento frente a los 3 pequeños.

Modelo base MoE 32B de código abierto que genera vídeo y audio sincronizados en un solo paso de inferencia con sincronización labial precisa de doble torre.

Modelo multimodal de bajo coste para texto, imágenes y vídeo en un contexto de 300K (hasta ~30 minutos de vídeo), ajustado para velocidad y asequibilidad.

Modelo de razonamiento multimodal rápido y rentable para texto, imágenes, documentos y vídeo en un contexto de 1M (documentación larga y clips de ~90 minutos).

Modelo base solo texto ajustado para latencia y coste ultra bajos en contexto de 128K. Fuerte para resumen, traducción y chat, con un 44% de descuento en caché.

El modelo más capaz de la familia. text/image/vídeo multimodal en un contexto de 1M con chain-of-thought razonamiento entre herramientas y fuentes de datos.

Modelo base multimodal que equilibra precisión, velocidad y coste para texto, imágenes y vídeo en contexto de 300K (hasta ~30 min de vídeo).

Whisper-1 speech-to-text transcripción entrenada con audio supervisado multilingüe, con un límite de subida de 25 MB por archivo.

Investigación de nivel institucional impulsada por el razonamiento Claude Opus 4.6, con máxima profundidad, acceso mejorado a las herramientas y amplia cobertura de fuentes.

Modelo de investigación para la recuperación, síntesis y razonamiento en varios pasos, buscando, leyendo y evaluando fuentes de forma autónoma en temas complejos.

Sonar Pro como investigador agente: encadena búsquedas web, obtiene páginas completas y transmite razonamiento en directo, adaptando la estrategia para consultas complejas.

Búsqueda web en tiempo real con filtrado por dominio, idioma, fecha y más. Devuelve resultados de búsqueda, no respuestas de LLM; No se suben archivos.

Búsqueda web en tiempo real con citas precisas y fuentes personalizables para up-to-date integración de búsqueda por IA en aplicaciones de producción.

Modelo basado en búsquedas con el doble de citas y una ventana de contexto más amplia, ajustado para consultas complejas que requieren respuestas profundas y matizadas.

Modelo de razonamiento en el R1-1776 de código abierto sin censura con búsqueda web, superando a los principales motores de búsqueda y LLMs en el benchmark SimpleQA.

Generación de vídeo cinematográfico en modos Texto a Vídeo, Imagen a Vídeo y Transición con alto detalle, movimiento fluido y animaciones realistas.

Genera vídeos a partir de texto o de imágenes de 1-2 fotogramas de hasta 1080p, múltiples relaciones de aspecto, duraciones de 5-10 segundos, con audio sincronizado opcional.

Modelo unificado de generación y edición de imágenes con un renderizado de texto complejo de Chinese/English líder en su clase, texturas realistas y fusión multi-imagen.

Alibaba CloudSingaporeLanzado 24 feb 2026Ctx 1MGeneracion de textoModelo de visión y lenguaje con atención lineal híbrida más MoE escaso, contexto 1M y rápida inferencia multimodal de text/image/vídeo.

Modelo de visión y lenguaje con atención lineal híbrida más MoE escaso, contexto 1M y rápida inferencia multimodal de text/image/vídeo.

Alibaba CloudSingaporeLanzado 30 mar 2026Ctx 256KGeneracion de textoModelo omnimodal rentable que maneja texto, imagen, audio y vídeo, con hasta 3 horas de audio y 1 hora de vídeo en 90+ idiomas.

Alibaba CloudSingaporeLanzado 30 mar 2026Ctx 256KGeneracion de textoModelo omnimodal insignia para texto, imagen, audio y vídeo. 3 horas de audio, 1 mano de vídeo, 90+ idiomas de entrada y 30+ de salida, 55 timbres de voz.

Alibaba CloudSingaporeLanzado 16 feb 2026Ctx 1MGeneracion de textoModelo multimodal con arquitectura híbrida para un pensamiento profundo eficiente y una comprensión visual entre texto, imagen y vídeo en un contexto de 1M.

Modelo multimodal con arquitectura híbrida para un pensamiento profundo eficiente y una comprensión visual entre texto, imagen y vídeo en un contexto de 1M.

Alibaba CloudSingaporeLanzado 20 abr 2026Ctx 256KGeneracion de textoLa mayor variante de vista previa de la serie 3.6 (solo texto): mejora en la ejecución de los agentes de codificación, habilidades de front-end más sólidas y un conocimiento más amplio de la long-tail.

Modelo de visión con grandes mejoras respecto a la versión 3.5: codificación agente y frontal, reconocimiento multimodal, OCR y localización de objetos.

Modelo de visión con grandes mejoras respecto a la versión 3.5: codificación agente y frontal, reconocimiento multimodal, OCR y localización de objetos.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 256KGeneracion de texto256K-contexto insignia con grandes mejoras en razonamiento, seguimiento de instrucciones y soporte multilingüe, además de mayor precisión coding/math.

Alibaba CloudSingaporeLanzado 5 sept 2025Ctx 256KGeneracion de textoVersión previa con grandes avances respecto a la serie 2.5 en comprensión chino-inglés, instrucciones complejas, capacidad multilingüe y uso de herramientas.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 256KGeneracion de textoModelo de razonamiento con uso de herramientas adaptativas (búsqueda, memoria, intérprete de código) y escalado en tiempo de prueba para mayor precisión en tareas complejas.

Reclasificador semántico de documentos. Ordena hasta 500 candidatos por consulta por relevancia, soporta 100+ lenguajes y acepta instrucciones de ordenación personalizadas.

Modelo 256K ajustado para codificación, con resultados front-end sólidos y soporte multilingüe para herramientas y agentes de codificación por IA.

Modelo equilibrado de propósito general para cargas de trabajo empresariales de alta frecuencia: procesamiento de información, contenido, búsqueda y análisis de datos.

Modelo multimodal centrado en latencia con contexto de 256K, cuatro modos de esfuerzo de razonamiento y image/video comprensión para un uso de alta concurrencia.

Modelo general insignia con contexto de 256K para razonamiento complejo, comprensión multimodal, generación estructurada y ejecución aumentada por herramientas.

Variante de vídeo 2.0 optimizada para velocidad y clips cinematográficos con sincronización de audio nativa, control de cámara y movimiento estable a menor coste por renderizado.

Modelo de vídeo multimodal para salida cinematográfica de texto, imagen, audio o vídeo, con movimiento estable y caracteres consistentes.

Modelo de imagen multimodal unificado que razona mediante prompts antes de renderizar, produciendo editajes y visuales de marca de alta resolución y consistentes.

Modelo de imagen premium de Seedream para text-to-image detallados, ediciones de una sola imagen y fusión multirreferencia con salida 1K y 2K.

Modelo de voz de código abierto para diálogos de podcast de formato largo y múltiples altavoces con control paralingüístico (risas, suspiros) y clonación de voz sin tomas.

Genera audio de hasta 3 minutos a partir de indicaciones de texto, soportando text-to-audio y audio-to-audio con duración, pasos y escala CFG ajustables.

Up-to-3-minute audio de texto con text-to-audio, audio-to-audio e inpainting de audio para producción musical, diseño de sonido y remezclas.

Stable Video Infinity 2.0 Pro en WAN 2.2: extiende imágenes fijas a vídeos teóricamente de longitud infinita manteniendo identificadores de personajes consistentes.

Asistente de investigación multi-búsqueda que explora un tema, analiza fuentes y produce un informe de investigación detallado con citas.

Búsqueda web con rastreo, extracción y mapeo de URL para una recuperación rápida y estructurada entre páginas y dominios para las canalizaciones posteriores.

Alibaba CloudSingaporeLanzado 4 jun 2025Ctx 8192IncrustacionesIncrustación de texto multilingüe con dimensiones de salida seleccionables (64–2048). Hasta 8.192 tokens por entrada.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 1024IncrustacionesEmbebido multimodal optimizado para velocidad, misma forma que Vision-Plus, tokens de image/video 3× más baratos.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 1024IncrustacionesIncrustación multimodal que produce vectores independientes para entradas, texto, imagen y vídeo.

Modelo de generación de vídeo multimodal para historias cinematográficas con múltiples planos y sincronización audiovisual nativa (sincronización labial, diálogo, música, efectos sonoros).

Modelo de vídeo multimodal compatible con T2V, I2V, edición de vídeo y reference-to-video, con salida de alta fidelidad desde entradas, texto, imagen o vídeo.

Modelo compañero de generación y edición de imágenes: text-to-image, ediciones en caja delimitadora y conjuntos de imágenes cohesivos, con salida de hasta 4K en Pro.
Transcripción controlada Whisper Large v3 Turbo con ASR multilingüe, traducción, VAD, marcas de tiempo, subtítulos, palabras calientes y controles de decodificador.

Agente de IA autónomo que convierte un prompt de alto nivel en subtareas, llama a herramientas y APIs, y entrega resultados end-to-end sin orquestación manual.

Modelo imagen-vídeo que anima una imagen fuente con movimiento guiado por prompt, hasta 15 segundos a 480p o 720p en siete relaciones de aspecto.

Modelo de primer nivel para flujos de trabajo agentes, ingeniería de software compleja y tareas a largo plazo, que sostiene trabajo a través de 1000+ llamadas de herramientas en contexto de 1M.

Modelo multimodal con comprensión visual y auditiva nativa en un contexto 1M, diseñado para razonar y actuar a través de modalidades en flujos de trabajo agentivos.

Texto, imagen y reference-to-video en un solo modelo. Movimiento cinematográfico, consistencia de personajes en hasta 9 referencias y audio nativo sincronizado.

La gama Seedance 2.0 más rápida y asequible para clips cortos de cinemática con audio nativo, control de cámara y entradas de imagen o vídeo a 480p y 720p.

StepFunInternationalLanzado 28 may 2026Ctx 256KGeneracion de textoModelo de razonamiento multimodal StepFun con entrada de imagen y vídeo, llamada a herramientas, esfuerzo de razonamiento ajustable y contexto 256K.

StepFunInternationalLanzado 12 feb 2026Ctx 256KGeneracion de textoModelo de razonamiento textual StepFun para agentes, codificación, llamadas a herramientas y análisis de contexto largo.

StepFunInternationalLanzado 2 abr 2026Ctx 256KGeneracion de textoVariante Flash Step 3.5 optimizada para agentes con modos de bajo y alto esfuerzo de razonamiento.

Modelo de conversación de audio y texto StepFun con salida de texto y comprensión paralingüística.

StepFunInternationalLanzado 29 abr 2026Generación de imágenesModelo de generación y edición de imágenes de StepFun para ediciones de text-to-image y de una sola imagen.

Modelo contextual de StepFun text-to-speech con dirección de voz en lenguaje natural y entrega expresiva.

StepFun text-to-speech modelo con voces oficiales, voces clonadas personalizadas y controles de etiqueta de voz.

Modelo de reconocimiento de voz en streaming StepFun para transcripción de audio en chino e inglés.

Next-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Alibaba CloudSingaporeLanzado 20 jul 2026Generación de audioTiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 Modelos