
GLM 5.3
Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.
Explora el catálogo completo de modelos en texto, imagen, audio, vídeo, 3D y más.
Catálogo de modelos
Navega por texto, imagen, vídeo, audio, 3D, búsqueda y endpoints de agentes con precios pay-as-you-go. El catálogo interactivo carga la disponibilidad actual de EmpirioLabs, y estos documentos modelo son rastreables sin JavaScript cliente.
xAI image-to-video con movimiento guiado por prompt, audio nativo, salida 480p o 720p y clips de hasta 15 segundos.
Generación de vídeo multimodal para clips cinematográficos a partir de entradas, texto, imagen, audio o vídeo.
Generación y edición unificada de imágenes para imágenes creativas, de marca y de producto en alta resolución.
Modelo de lenguaje visual rentable para texto, imagen, vídeo, programación, herramientas y flujos de trabajo contextuales de 1M.
Modelo insignia de contexto largo para programación, productividad, agentes de larga duración, pensamiento profundo y uso de herramientas.
Razonamiento multimodal para codificación, agentes, análisis de contexto largo y entrada de texto, imagen y vídeo.
Razonamiento multimodal Moonshot con fuerte soporte de codificación, contexto 256K y entrada de imagen y vídeo.
Razonamiento de contexto largo con llamada a herramientas, salida estructurada, soporte de caché y salida de 128K.
Generación de imagen a 3D que convierte una imagen de referencia en un recurso GLB texturizado.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Alibaba CloudMultimodal reasoner with 256K context, image and video input, function tools, structured JSON, and thinking on by default.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

DeepSeekOfficial 0813 Pro release with major gains across coding, repository work, tool use, and agent tasks, plus hybrid thinking and a 1M context window.
Text-to-image plus multi-reference editing with up to three source images, selectable quality tiers, and 1K or 2K output resolution.

Meta AIModelo agente 30B de Meta-Open con comprensión de imagen, contexto 128K, llamada a herramientas, salida estructurada y fuerza de razonamiento controlable.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Z.aiModelo de razonamiento y codigo con contexto de 1M de tokens, salida de 128K, esfuerzo de razonamiento ajustable, busqueda web nativa y llamadas a herramientas.

Moonshot AIKimi K3 es el modelo de razonamiento insignia de Moonshot con un contexto de token de 1M, pensamiento siempre activo, búsqueda web nativa y entradas de texto, imagen y vídeo.

Meta AIEl modelo de razonamiento fronterizo actualizado de Meta con un contexto de 1.048.576 tokens, conocimiento de imagen, vídeo, audio y PDF, búsqueda web y uso de herramientas.

Moonshot AIKimi K2.7 Code es el modelo de codigo agentico de un billon de parametros de Moonshot, con contexto de 256K, razonamiento siempre activo y entradas de texto, imagen y video.

Meta AIModelo de razonamiento metafrontera con un contexto de 1.048.576 tokens más comprensión de imagen, vídeo, audio y PDF, búsqueda web y uso de herramientas.

Black Forest LabsModelo de generación y edición de imágenes 4B FLUX.2 Klein con licencia apache con soporte de text-to-image, edición de imágenes de referencia y flujo de trabajo creativo.

AmazonLa generación y edición de imágenes modela creando y modificando imágenes a partir de texto o entradas de imagen, con inpainting, prueba virtual y controles de estilo.

TencentModelo de text-to-image de código abierto sobre una arquitectura multimodal Mixture-of-Experts con detalle fotorrealista y un renderizado de texto multilingüe potente.

DeepSeekMarco autorregresivo en el modelo Janus Pro 7B que unifica la comprensión multimodal y la generación de imágenes en una sola arquitectura.

Alibaba CloudModelo unificado de generación y edición de imágenes con un renderizado de texto complejo de Chinese/English líder en su clase, texturas realistas y fusión multi-imagen.

Alibaba CloudGeneración y edición de imágenes Qwen con variantes Base y Pro, tipografía multilingüe, referencias multiimagen y salida controlable en 1K o 2K.

Kling AITexto a video e imagen a video con audio nativo sincronizado, en 720p o 1080p durante 3 a 15 segundos, con control de relacion de aspecto y prompt.

AmazonModelo de generación de vídeo que produce vídeos de hasta 2 minutos con múltiples tomas a partir de texto y prompts de imagen opcionales con mejor calidad y consistencia.

Alibaba CloudModelo de vídeo que ofrece modos Texto a Vídeo, Imagen a Vídeo, Referencia a Vídeo y Edición de Vídeo con salida de alta fidelidad y fluidez para el movimiento.

TencentModelo de vídeo de 8.3B parámetros con salida nativa 720p (escalable a 1080p), coherencia de movimiento fuerte y comprensión bilingüe de prompts de hasta 10s.

Kling AIModelo de vídeo en modos Standard o Pro con Texto a Vídeo, Imagen a Vídeo, Referencia a Vídeo, edición, sonido nativo y transiciones multiescena.

Kling AIKling 3.0 modelo que transfiere movimiento de un vídeo de referencia a un personaje de una imagen de referencia, con niveles estándar 720p y Pro 1080p.

ACE-StepModelo de generación musical de código abierto para audio guiado por text-to-song y letras, con inferencia XL Turbo rápida de 8 pasos para iteraciones controlables de canciones.

InworldModelo de voz en tiempo real con dirección de voz en inglés sencillo, una identidad de voz en 100+ idiomas y time-to-first-audio de streaming por debajo de 200 ms.

InworldSíntesis de voz TTFB por debajo de 130 ms con 271+ voces en 15 idiomas, prosodia expresiva y streaming SSE en tiempo real para agentes de voz de baja latencia.

InworldSíntesis de voz de calidad de emisión con prosodia expresiva rica, 271+ voces en 15 idiomas y transmisión SSE en tiempo real con marcas de tiempo por palabra.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

GoogleBaja latencia text-to-speech con voces de un y varios altavoces y estilo, acento y tono expresivo controlables para aplicaciones de producción.

DeepgramTranscripción de voz a texto usando el modelo Nova-3 con soporte multilingüe y ajustes avanzados personalizables para cargas de producción.

OpenAIWhisper-1 speech-to-text transcripción entrenada con audio supervisado multilingüe, con un límite de subida de 25 MB por archivo.

OpenAITranscripción controlada Whisper Large v3 Turbo con ASR multilingüe, traducción, VAD, marcas de tiempo, subtítulos, palabras calientes y controles de decodificador.

StepFunModelo de reconocimiento de voz en streaming StepFun para transcripción de audio en chino e inglés.

ExaRespuesta rápida al estilo LLM a una pregunta en lenguaje natural, basada en resultados de búsqueda web exa frescos con citas en línea y enlaces a fuentes.

ExaMotor de búsqueda web para encontrar páginas, recuperar páginas similares, rastrear y buscar código dedicado en la web abierta para agentes de IA.

LinkupBúsqueda iterativa de IA que sigue consultando cuando los resultados iniciales son insuficientes, devolviendo respuestas más completas que el modo Estándar.

LinkupBúsqueda web impulsada por IA con resúmenes detallados y respuestas, más rápida que la búsqueda profunda. Ocupa el puesto #1 en el benchmark de OpenAI SimpleQA.

PerplexityInvestigación de nivel institucional impulsada por el razonamiento Claude Opus 4.6, con máxima profundidad, acceso mejorado a las herramientas y amplia cobertura de fuentes.

PerplexityModelo de investigación para la recuperación, síntesis y razonamiento en varios pasos, buscando, leyendo y evaluando fuentes de forma autónoma en temas complejos.

MicrosoftTRELLIS.2 modelo de imagen a 3D que convierte una imagen de referencia en un recurso GLB texturizado con controles de resolución, semilla, malla, textura y exportación.

DeemosRodin Gen-2 engine that turns a text prompt or up to five reference images into production 3D assets with PBR materials and quad or raw meshes.

Hitem3DProduction-focused image-to-3D with structure-aware textures, 1536 and 1536 Pro precision tiers, meshes up to two million faces, and five export formats.

Alibaba CloudIncrustación de texto multilingüe con dimensiones de salida seleccionables (64–2048). Hasta 8.192 tokens por entrada.

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba CloudIncrustación multimodal que produce vectores independientes para entradas, texto, imagen y vídeo.

ByteDanceMultimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.

Alibaba CloudReclasificador semántico de documentos. Ordena hasta 500 candidatos por consulta por relevancia, soporta 100+ lenguajes y acepta instrucciones de ordenación personalizadas.

GPTZeroDetector de aprendizaje profundo que señala partes de texto probablemente generadas por IA frente a humanas, clasificando el contenido como completamente humano, IA o mixto.

ManusAgente de IA autónomo que convierte un prompt de alto nivel en subtareas, llama a herramientas y APIs, y entrega resultados end-to-end sin orquestación manual.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.