
Texto a video e imagen a video con audio nativo sincronizado, en 720p o 1080p durante 3 a 15 segundos, con control de relacion de aspecto y prompt.
Paga según la marcha, o elige un plan con asignaciones semanales.
Catálogo de precios
El precio de EmpirioLabs varía según el modelo y la unidad: tokens, imágenes, segundos de audio o vídeo, mensajes, recursos 3D y solicitudes de búsqueda. La tabla interactiva de precios carga el catálogo actual, mientras que estas tarifas representativas permanecen legibles sin JavaScript del cliente.
La entrada de imagen $0.05 por imagen. La salida de vídeo empieza a $0.096 por segundo para 480p y $0.168 por segundo para 720p.
La entrada comienza en $0.40 por cada 1M de tokens de prompt para una API multimodal de contexto largo rentable.
La entrada comienza en $0.30 por cada token de 1M de prompt para razonamiento multimodal, codificación y cargas de trabajo de agentes.
La generación de imagen a 3D se valora por cada activo 3D generado, con documentación para controles de formato y resolución.
Las tarifas de la API de modelos se muestran y se facturan en USD. El checkout puede mostrar métodos de pago locales cuando sean elegibles.
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
MiniMax M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 FlashGratisThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V FlashGratisThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 FlashGratisThis model is free to run, so using it never draws from your weekly allowance.
Mistral Medium 3
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 Plus
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
Mistral Medium 3.1
Nova Premier 1.0
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

Texto a video e imagen a video con audio nativo sincronizado, en 720p o 1080p durante 3 a 15 segundos, con control de relacion de aspecto y prompt.

Modelo de razonamiento y codigo con contexto de 1M de tokens, salida de 128K, esfuerzo de razonamiento ajustable, busqueda web nativa y llamadas a herramientas.
Modelo de razonamiento y codigo con contexto de 1M de tokens, salida de 128K, esfuerzo de razonamiento ajustable, busqueda web nativa y llamadas a herramientas.

Kimi K3 es el modelo de razonamiento insignia de Moonshot con un contexto de token de 1M, pensamiento siempre activo, búsqueda web nativa y entradas de texto, imagen y vídeo.

El modelo de razonamiento fronterizo actualizado de Meta con un contexto de 1.048.576 tokens, conocimiento de imagen, vídeo, audio y PDF, búsqueda web y uso de herramientas.

Moonshot AIInternationalLanzado 16 jun 2026Ctx 256KGeneracion de textoKimi K2.7 Code es el modelo de codigo agentico de un billon de parametros de Moonshot, con contexto de 256K, razonamiento siempre activo y entradas de texto, imagen y video.

Moonshot AIGermanyLanzado 16 jun 2026Ctx 256KGeneracion de textoKimi K2.7 Code es el modelo de codigo agentico de un billon de parametros de Moonshot, con contexto de 256K, razonamiento siempre activo y entradas de texto, imagen y video.

Modelo de razonamiento metafrontera con un contexto de 1.048.576 tokens más comprensión de imagen, vídeo, audio y PDF, búsqueda web y uso de herramientas.

Conductor multiagente actualizado para razonamiento duro, codificación e investigación, con esfuerzo máximo diferenciado, contexto 1M, entrada de imagen y búsqueda web.

Modelo de visión Qwen3.7 rentable para texto, imagen, vídeo, codificación, uso de herramientas, comprensión de la interfaz gráfica y flujos de trabajo de contexto 1M.

Modelo de visión Qwen3.7 rentable para texto, imagen, vídeo, codificación, uso de herramientas, comprensión de la interfaz gráfica y flujos de trabajo de contexto 1M.

Moonshot AIInternationalLanzado 16 jun 2026Ctx 256KGeneracion de textoKimi K2.7 Code Highspeed es la capa de servicio más rápido del modelo de codificación agente de Moonshot, con contexto de 256K, razonamiento siempre activado y entrada de imagen y vídeo.

Conductor multiagente original para razonamiento duro, codificación e investigación, con contexto 1M, entrada de imágenes, llamada a funciones y búsqueda web.

Alibaba CloudSingaporeLanzado 15 jul 2026Ctx 1MGeneracion de textoModelo de lenguaje visual Fast Qwen3.7 para texto, imagen, vídeo, uso de herramientas y tareas agentes, con caché implícita y un contexto de token de 1M.

Modelo de lenguaje visual Fast Qwen3.7 para texto, imagen, vídeo, uso de herramientas y tareas agentes, con caché implícita y un contexto de token de 1M.

MiniMax M3 es un modelo de razonamiento multimodal para codificación, agentes y análisis de contexto largo con entrada de texto, imagen y vídeo.

MiniMax M3 es un modelo de razonamiento multimodal para codificación, agentes y análisis de contexto largo con entrada de texto, imagen y vídeo.

Qwen3.7 Max es un modelo de texto emblemático para programación, productividad, agentes de larga duración, pensamiento profundo, herramientas y contexto de 1M de tokens.

Qwen3.7 Max es un modelo de texto emblemático para programación, productividad, agentes de larga duración, pensamiento profundo, herramientas y contexto de 1M de tokens.

Buque insignia del MoE a escala de billones para programación, agentes a largo plazo y trabajo profesional, con comprensión de imagen y vídeo en un contexto de 1M-token.

Buque insignia del MoE a escala de billones para programación, agentes a largo plazo y trabajo profesional, con comprensión de imagen y vídeo en un contexto de 1M-token.
Modelo de generación musical de código abierto para audio guiado por text-to-song y letras, con inferencia XL Turbo rápida de 8 pasos para iteraciones controlables de canciones.

Modelo de generación y edición de imágenes 4B FLUX.2 Klein con licencia apache con soporte de text-to-image, edición de imágenes de referencia y flujo de trabajo creativo.

MiniMaxSingaporeLanzado 18 mar 2026Ctx 200KGeneracion de textoVariante M2.7 de alta velocidad ajustada para una inferencia rápida con un alto rendimiento de propósito general y grandes capacidades agentes.
Modelo de voz en tiempo real con dirección de voz en inglés sencillo, una identidad de voz en 100+ idiomas y time-to-first-audio de streaming por debajo de 200 ms.
Síntesis de voz TTFB por debajo de 130 ms con 271+ voces en 15 idiomas, prosodia expresiva y streaming SSE en tiempo real para agentes de voz de baja latencia.
Síntesis de voz de calidad de emisión con prosodia expresiva rica, 271+ voces en 15 idiomas y transmisión SSE en tiempo real con marcas de tiempo por palabra.
Modelo de razonamiento de IA Zhipu de largo contexto con contexto 202K, salida 128K, llamada a herramientas, salida estructurada y soporte para caché.

Kimi K2.6 es un modelo de razonamiento multimodal Moonshot con contexto 256K, codificación fuerte y entradas de texto, imagen y vídeo.

DeepSeekGermanyLanzado 31 jul 2026Ctx 1MGeneracion de textoVersión 0731 post-entrenada con grandes avances en codificación, trabajo de repositorio, uso de herramientas y tareas full-stack, además de una ventana contextual de 1M.

MiniMax M2.7 es un modelo de chat de razonamiento de propósito general con pensamiento entrelazado, llamadas a funciones y caché de prompts.
TRELLIS.2 modelo de imagen a 3D que convierte una imagen de referencia en un recurso GLB texturizado con controles de resolución, semilla, malla, textura y exportación.

Alibaba CloudChinaLanzado 24 feb 2026Ctx 256KGeneracion de textoQwen3.5 122B-A10B es un modelo de razonamiento multimodal con contexto de 256K, inferencia eficiente y escasa de MoE, y entrada de texto, imagen y vídeo.

Alibaba CloudChinaLanzado 16 feb 2026Ctx 256KGeneracion de textoQwen3.5 397B-A17B es un modelo de razonamiento multimodal emblemático para lenguaje, código, agentes, tareas de interfaz gráfica y comprensión de imágenes y vídeos.

Alibaba CloudChinaLanzado 24 feb 2026Ctx 256KGeneracion de textoQwen3.5 35B-A3B es un modelo nativo de visión y lenguaje eficiente con un enrutamiento MoE escaso, pensamiento profundo y entrada de texto, imagen y vídeo.

Qwen3.5 27B es un modelo de razonamiento multimodal denso con respuestas rápidas, contexto 256K y comprensión de texto, imagen y vídeo.

Qwen3.6 27B mejora la codificación agente, el razonamiento STEM, la visión espacial, el OCR y la comprensión de texto, imagen y vídeo en contexto 256K.

Alibaba CloudSingaporeLanzado 16 abr 2026Ctx 1MGeneracion de textoModelo de visión Fast Qwen3.6 para codificación agente, razonamiento matemático, comprensión espacial, OCR, y entrada de texto, imagen y vídeo.

Modelo de visión Fast Qwen3.6 para codificación agente, razonamiento matemático, comprensión espacial, OCR, y entrada de texto, imagen y vídeo.

Gemma 4 26B A4B es un modelo multimodal abierto de Google con 256K de contexto, texto, imagen y entrada de vídeo, herramientas y salida estructurada.

Qwen3.5 9B es un modelo de razonamiento multimodal compacto con 256K de contexto, entrada de imagen y vídeo, herramientas funcionales y salida estructurada.

Qwen3.5 4B es un modelo de razonamiento multimodal de bajo coste con 256K de contexto, entrada de imagen y vídeo, herramientas funcionales y salida estructurada.

Qwen3.6 35B A3B es un modelo de razonamiento mixture-of-experts experto en 256 con 128K de contexto, herramientas funcionales y salida JSON estrictamente estructurada.

Modelo de texto GLM-4.7 gratuito y ligero para codificación, razonamiento, escritura en contexto largo y chat general.

Modelo de texto GLM-4.5 gratuito y ligero para razonamiento, programación, chat de formato largo y tareas generales de lenguaje.

Modelo multimodal gratuito de GLM-4.6V para comprensión de imágenes, vídeos, archivos y texto con llamada a funciones nativas.

La generación y edición de imágenes modela creando y modificando imágenes a partir de texto o entradas de imagen, con inpainting, prueba virtual y controles de estilo.

Modelo de generación de vídeo que produce vídeos de hasta 2 minutos con múltiples tomas a partir de texto y prompts de imagen opcionales con mejor calidad y consistencia.

Transcripción de voz a texto usando el modelo Nova-3 con soporte multilingüe y ajustes avanzados personalizables para cargas de producción.

Combina DeepSeek R1 chain-of-thought razonamiento con Anthropic Claude la creación y generación de código detrás de una interfaz unificada controlada por datos.

LLM de código abierto Mixture-of-Experts optimizado para razonamiento, programación y tareas generales de lenguaje de alta eficiencia a través de prompts de formato largo.

Modelo MoE ligero con 284B de parámetros totales / 13B activos y contexto nativo de 1M, ajustado para un uso de baja latencia y alta concurrencia rentable.

DeepSeekSingaporeLanzado 24 abr 2026Ctx 1MGeneracion de textoModelo MoE ligero con 284B de parámetros totales / 13B activos y contexto nativo de 1M, ajustado para un uso de baja latencia y alta concurrencia rentable.

Modelo MoE ligero con 284B de parámetros totales / 13B activos y contexto nativo de 1M, ajustado para un uso de baja latencia y alta concurrencia rentable.

LLM MoE insignia con 1,6T totales / 49B parámetros activos y contexto nativo de 1M para matemáticas avanzadas, inferencia lógica y codificación especializada.

LLM MoE insignia con 1,6T totales / 49B parámetros activos y contexto nativo de 1M para matemáticas avanzadas, inferencia lógica y codificación especializada.

LLM MoE insignia con 1,6T totales / 49B parámetros activos y contexto nativo de 1M para matemáticas avanzadas, inferencia lógica y codificación especializada.

Respuesta rápida al estilo LLM a una pregunta en lenguaje natural, basada en resultados de búsqueda web exa frescos con citas en línea y enlaces a fuentes.

Motor de búsqueda web para encontrar páginas, recuperar páginas similares, rastrear y buscar código dedicado en la web abierta para agentes de IA.

Baja latencia text-to-speech con voces de un y varios altavoces y estilo, acento y tono expresivo controlables para aplicaciones de producción.

Vista previa TTS de alta calidad para podcasts, audiolibros y atención al cliente, con voces expresivas con múltiples altavoces en 23+ idiomas.

TTS altamente controlable con nuevas etiquetas de audio para un estilo, tono, ritmo y entrega precisos en narración, asistentes y aplicaciones de voz.

Modelo de lenguaje de visión de código abierto con contexto de 128K, 140+ lenguajes, math/reasoning mejorado, salidas estructuradas y llamadas a funciones.

text-to-speech basado en LLM con clonación de voz sin disparo a partir de 3-10 segundos de audio y salida expresiva emocionalmente controlable mediante RL multi-recompensa.

Detector de aprendizaje profundo que señala partes de texto probablemente generadas por IA frente a humanas, clasificando el contenido como completamente humano, IA o mixto.

Modelo de vídeo que ofrece modos Texto a Vídeo, Imagen a Vídeo, Referencia a Vídeo y Edición de Vídeo con salida de alta fidelidad y fluidez para el movimiento.

Modelo de text-to-image de código abierto sobre una arquitectura multimodal Mixture-of-Experts con detalle fotorrealista y un renderizado de texto multilingüe potente.
Modelo de vídeo de 8.3B parámetros con salida nativa 720p (escalable a 1080p), coherencia de movimiento fuerte y comprensión bilingüe de prompts de hasta 10s.

Marco autorregresivo en el modelo Janus Pro 7B que unifica la comprensión multimodal y la generación de imágenes en una sola arquitectura.

Modelo de vídeo en modos Standard o Pro con Texto a Vídeo, Imagen a Vídeo, Referencia a Vídeo, edición, sonido nativo y transiciones multiescena.

Kling 3.0 modelo que transfiere movimiento de un vídeo de referencia a un personaje de una imagen de referencia, con niveles estándar 720p y Pro 1080p.

Búsqueda iterativa de IA que sigue consultando cuando los resultados iniciales son insuficientes, devolviendo respuestas más completas que el modo Estándar.

Búsqueda web impulsada por IA con resúmenes detallados y respuestas, más rápida que la búsqueda profunda. Ocupa el puesto #1 en el benchmark de OpenAI SimpleQA.

Modelo de lenguaje rentable que ofrece un razonamiento sólido y un rendimiento multimodal para cargas de trabajo generales de producción con latencia competitiva.

Modelo de nivel empresarial con un razonamiento sólido, programación y rendimiento STEM, que soporta despliegues híbridos, on-premises e in-VPC.

Modelo multimodal de 24B parámetros con contexto de 128K para análisis de imágenes, programación, matemáticas y tareas multilingües, ajustado para una inferencia local eficiente.

Modelo híbrido que unifica las familias Instruct, Razonamiento (Magistral) y Devstral: 40% menos tiempo de finalización y 3x rendimiento frente a los 3 pequeños.

Modelo base MoE 32B de código abierto que genera vídeo y audio sincronizados en un solo paso de inferencia con sincronización labial precisa de doble torre.

Modelo multimodal de bajo coste para texto, imágenes y vídeo en un contexto de 300K (hasta ~30 minutos de vídeo), ajustado para velocidad y asequibilidad.

Modelo de razonamiento multimodal rápido y rentable para texto, imágenes, documentos y vídeo en un contexto de 1M (documentación larga y clips de ~90 minutos).

Modelo base solo texto ajustado para latencia y coste ultra bajos en contexto de 128K. Fuerte para resumen, traducción y chat, con un 44% de descuento en caché.

El modelo más capaz de la familia. text/image/vídeo multimodal en un contexto de 1M con chain-of-thought razonamiento entre herramientas y fuentes de datos.

Modelo base multimodal que equilibra precisión, velocidad y coste para texto, imágenes y vídeo en contexto de 300K (hasta ~30 min de vídeo).

Whisper-1 speech-to-text transcripción entrenada con audio supervisado multilingüe, con un límite de subida de 25 MB por archivo.

Investigación de nivel institucional impulsada por el razonamiento Claude Opus 4.6, con máxima profundidad, acceso mejorado a las herramientas y amplia cobertura de fuentes.

Modelo de investigación para la recuperación, síntesis y razonamiento en varios pasos, buscando, leyendo y evaluando fuentes de forma autónoma en temas complejos.

Sonar Pro como investigador agente: encadena búsquedas web, obtiene páginas completas y transmite razonamiento en directo, adaptando la estrategia para consultas complejas.

Búsqueda web en tiempo real con filtrado por dominio, idioma, fecha y más. Devuelve resultados de búsqueda, no respuestas de LLM; No se suben archivos.

Búsqueda web en tiempo real con citas precisas y fuentes personalizables para up-to-date integración de búsqueda por IA en aplicaciones de producción.

Modelo basado en búsquedas con el doble de citas y una ventana de contexto más amplia, ajustado para consultas complejas que requieren respuestas profundas y matizadas.

Modelo de razonamiento en el R1-1776 de código abierto sin censura con búsqueda web, superando a los principales motores de búsqueda y LLMs en el benchmark SimpleQA.

Generación de vídeo cinematográfico en modos Texto a Vídeo, Imagen a Vídeo y Transición con alto detalle, movimiento fluido y animaciones realistas.

Genera vídeos a partir de texto o de imágenes de 1-2 fotogramas de hasta 1080p, múltiples relaciones de aspecto, duraciones de 5-10 segundos, con audio sincronizado opcional.

Modelo unificado de generación y edición de imágenes con un renderizado de texto complejo de Chinese/English líder en su clase, texturas realistas y fusión multi-imagen.

Generación y edición de imágenes Qwen con variantes Base y Pro, tipografía multilingüe, referencias multiimagen y salida controlable en 1K o 2K.

Alibaba CloudSingaporeLanzado 24 feb 2026Ctx 1MGeneracion de textoModelo de visión y lenguaje con atención lineal híbrida más MoE escaso, contexto 1M y rápida inferencia multimodal de text/image/vídeo.

Modelo de visión y lenguaje con atención lineal híbrida más MoE escaso, contexto 1M y rápida inferencia multimodal de text/image/vídeo.

Alibaba CloudSingaporeLanzado 30 mar 2026Ctx 256KGeneracion de textoModelo omnimodal rentable que maneja texto, imagen, audio y vídeo, con hasta 3 horas de audio y 1 hora de vídeo en 90+ idiomas.

Alibaba CloudSingaporeLanzado 30 mar 2026Ctx 256KGeneracion de textoModelo omnimodal insignia para texto, imagen, audio y vídeo. 3 horas de audio, 1 mano de vídeo, 90+ idiomas de entrada y 30+ de salida, 55 timbres de voz.

Alibaba CloudSingaporeLanzado 16 feb 2026Ctx 1MGeneracion de textoModelo multimodal con arquitectura híbrida para un pensamiento profundo eficiente y una comprensión visual entre texto, imagen y vídeo en un contexto de 1M.

Modelo multimodal con arquitectura híbrida para un pensamiento profundo eficiente y una comprensión visual entre texto, imagen y vídeo en un contexto de 1M.

Alibaba CloudSingaporeLanzado 20 abr 2026Ctx 256KGeneracion de textoLa mayor variante de vista previa de la serie 3.6 (solo texto): mejora en la ejecución de los agentes de codificación, habilidades de front-end más sólidas y un conocimiento más amplio de la long-tail.

Modelo de visión con grandes mejoras respecto a la versión 3.5: codificación agente y frontal, reconocimiento multimodal, OCR y localización de objetos.

Modelo de visión con grandes mejoras respecto a la versión 3.5: codificación agente y frontal, reconocimiento multimodal, OCR y localización de objetos.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 256KGeneracion de texto256K-contexto insignia con grandes mejoras en razonamiento, seguimiento de instrucciones y soporte multilingüe, además de mayor precisión coding/math.

Alibaba CloudSingaporeLanzado 5 sept 2025Ctx 256KGeneracion de textoVersión previa con grandes avances respecto a la serie 2.5 en comprensión chino-inglés, instrucciones complejas, capacidad multilingüe y uso de herramientas.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 256KGeneracion de textoModelo de razonamiento con uso de herramientas adaptativas (búsqueda, memoria, intérprete de código) y escalado en tiempo de prueba para mayor precisión en tareas complejas.

Reclasificador semántico de documentos. Ordena hasta 500 candidatos por consulta por relevancia, soporta 100+ lenguajes y acepta instrucciones de ordenación personalizadas.

Modelo 256K ajustado para codificación, con resultados front-end sólidos y soporte multilingüe para herramientas y agentes de codificación por IA.

Modelo equilibrado de propósito general para cargas de trabajo empresariales de alta frecuencia: procesamiento de información, contenido, búsqueda y análisis de datos.

Modelo multimodal centrado en latencia con contexto de 256K, cuatro modos de esfuerzo de razonamiento y image/video comprensión para un uso de alta concurrencia.

Modelo general insignia con contexto de 256K para razonamiento complejo, comprensión multimodal, generación estructurada y ejecución aumentada por herramientas.

Variante de vídeo 2.0 optimizada para velocidad y clips cinematográficos con sincronización de audio nativa, control de cámara y movimiento estable a menor coste por renderizado.

Modelo de vídeo multimodal para salida cinematográfica de texto, imagen, audio o vídeo, con movimiento estable y caracteres consistentes.

Modelo de imagen multimodal unificado que razona mediante prompts antes de renderizar, produciendo editajes y visuales de marca de alta resolución y consistentes.

Modelo de imagen Premium Seedream para text-to-image, ediciones y fusión multirreferencia con salida de 1K, 1,5K y 2K, además de optimización de prompts estándar o rápido.

Modelo de voz de código abierto para diálogos de podcast de formato largo y múltiples altavoces con control paralingüístico (risas, suspiros) y clonación de voz sin tomas.

Genera audio de hasta 3 minutos a partir de indicaciones de texto, soportando text-to-audio y audio-to-audio con duración, pasos y escala CFG ajustables.

Up-to-3-minute audio de texto con text-to-audio, audio-to-audio e inpainting de audio para producción musical, diseño de sonido y remezclas.

Stable Video Infinity 2.0 Pro en WAN 2.2: extiende imágenes fijas a vídeos teóricamente de longitud infinita manteniendo identificadores de personajes consistentes.

Asistente de investigación multi-búsqueda que explora un tema, analiza fuentes y produce un informe de investigación detallado con citas.

Búsqueda web con rastreo, extracción y mapeo de URL para una recuperación rápida y estructurada entre páginas y dominios para las canalizaciones posteriores.

Incrustación de texto multilingüe con dimensiones de salida seleccionables (64–2048). Hasta 8.192 tokens por entrada.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 1KIncrustacionesEmbebido multimodal optimizado para velocidad, misma forma que Vision-Plus, tokens de image/video 3× más baratos.

Alibaba CloudSingaporeLanzado 23 sept 2025Ctx 1KIncrustacionesIncrustación multimodal que produce vectores independientes para entradas, texto, imagen y vídeo.

Modelo de generación de vídeo multimodal para historias cinematográficas con múltiples planos y sincronización audiovisual nativa (sincronización labial, diálogo, música, efectos sonoros).

Modelo de vídeo multimodal compatible con T2V, I2V, edición de vídeo y reference-to-video, con salida de alta fidelidad desde entradas, texto, imagen o vídeo.

Modelo compañero de generación y edición de imágenes: text-to-image, ediciones en caja delimitadora y conjuntos de imágenes cohesivos, con salida de hasta 4K en Pro.
Transcripción controlada Whisper Large v3 Turbo con ASR multilingüe, traducción, VAD, marcas de tiempo, subtítulos, palabras calientes y controles de decodificador.

Agente de IA autónomo que convierte un prompt de alto nivel en subtareas, llama a herramientas y APIs, y entrega resultados end-to-end sin orquestación manual.

Generación de texto a vídeo, image-to-video y reference-to-video con hasta siete imágenes de referencia para caracteres consistentes, hasta 15 segundos a 1080p.

Modelo de primer nivel para flujos de trabajo agentes, ingeniería de software compleja y tareas a largo plazo, que sostiene trabajo a través de 1000+ llamadas de herramientas en contexto de 1M.

Modelo multimodal con comprensión visual y auditiva nativa en un contexto 1M, diseñado para razonar y actuar a través de modalidades en flujos de trabajo agentivos.

Texto, imagen y reference-to-video en un solo modelo. Movimiento cinematográfico, consistencia de personajes en hasta 9 referencias y audio nativo sincronizado.

La gama Seedance 2.0 más rápida y asequible para clips cortos de cinemática con audio nativo, control de cámara y entradas de imagen o vídeo a 480p y 720p.

StepFunInternationalLanzado 28 may 2026Ctx 256KGeneracion de textoModelo de razonamiento multimodal StepFun con entrada de imagen y vídeo, llamada a herramientas, esfuerzo de razonamiento ajustable y contexto 256K.

StepFunInternationalLanzado 12 feb 2026Ctx 256KGeneracion de textoModelo de razonamiento textual StepFun para agentes, codificación, llamadas a herramientas y análisis de contexto largo.

StepFunInternationalLanzado 2 abr 2026Ctx 256KGeneracion de textoVariante Flash Step 3.5 optimizada para agentes con modos de bajo y alto esfuerzo de razonamiento.

Modelo de conversación de audio y texto StepFun con salida de texto y comprensión paralingüística.

StepFunInternationalLanzado 29 abr 2026Generación de imágenesModelo de generación y edición de imágenes de StepFun para ediciones de text-to-image y de una sola imagen.

Modelo contextual de StepFun text-to-speech con dirección de voz en lenguaje natural y entrega expresiva.

StepFun text-to-speech modelo con voces oficiales, voces clonadas personalizadas y controles de etiqueta de voz.

Modelo de reconocimiento de voz en streaming StepFun para transcripción de audio en chino e inglés.

Modelo de codificación y agente de próxima generación con entrega de código de calidad de ingeniería, autonomía a largo plazo y comprensión multimodal de 256K.

Alibaba CloudSingaporeLanzado 20 jul 2026Generación de audioSíntesis de voz por niveles con más de 1.000 voces, 16 idiomas, 20 dialectos chinos, dirección de transmisión en lenguaje natural y etiquetas emocionales en línea.

Genera clips de 4 a 15 segundos de hasta 2K con audio estéreo nativo, siguiendo texto, imagen, vídeo y referencias de audio en una sola solicitud.

El modelo de imagen insignia de OpenAI con alta fidelidad en prompts, renderizado de texto nítido y edición basada en instrucciones en hasta 16 imágenes de referencia.

El generador de vídeo Kling 3.0 de Kuaishou con text-to-video, primer y último fotograma image-to-video, audio nativo y salida 720p, 1080p o 4K.

El modelo de vídeo Wan 2.5 de Alibaba con text-to-video y image-to-video, audio nativo, pistas de audio personalizadas opcionales y salida de 480p a 1080p.

La familia de vídeo Wan 2.2 de Alibaba con niveles estándar y de flash, interpolación de primer y último fotograma, y salida de 480p a 1080p a bajo coste.

El modelo de vídeo Wan 2.1 de Alibaba con niveles turbo y plus para text-to-video, image-to-video y primer y último fotograma a 480p o 720p.

El modelo de imagen Wan 2.5 de Alibaba con text-to-image y edición multirreferencial de hasta 3 imágenes a unos 1,7 megapíxeles.

El modelo Wan 2.2 de Alibaba text-to-image con niveles plus y flash y hasta 1440x1440 de salida a bajo precio por imagen.

El modelo Wan 2.1 text-to-image de Alibaba con niveles turbo y plus y hasta 1440x1440 de salida a bajo precio por imagen.

Modelo de vídeo de formato largo para clips coherentes de hasta 30 segundos, con hasta 50 imágenes de referencia, vídeos y clips de audio, audio nativo, edición y extensión.
140 / 155 Modelos