
GLM 5.3
Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.
Navegue pelo catálogo completo de modelos em texto, imagem, áudio, vídeo, 3D e muito mais.
Catálogo de modelos
Navegue por texto, imagem, vídeo, áudio, 3D, busca e endpoints de agentes com preços pay-as-you-go. O catálogo interativo carrega a disponibilidade atual do EmpirioLabs, e esses documentos modelo são rastreáveis sem JavaScript do cliente.
xAI image-to-video com movimento guiado por prompt, áudio nativo, saída 480p ou 720p e clipes de até 15 segundos.
Geração de vídeo multimodal para clipes cinematográficos a partir de entradas, texto, imagem, áudio ou vídeo.
Geração e edição unificada de imagens para criatividade, visual de marca e produto em alta resolução.
Modelo de linguagem visual econômico para texto, imagem, vídeo, programação, ferramentas e fluxos de trabalho com contexto de 1M.
Modelo principal de longo contexto para programação, produtividade, agentes de longa duração, pensamento profundo e uso de ferramentas.
Raciocínio multimodal para codificação, agentes, análise de contexto longo e entrada de texto, imagem e vídeo.
Moonshot raciocínio multimodal com forte suporte à programação, contexto 256K e entrada de imagem e vídeo.
Raciocínio de longo contexto com chamada de ferramentas, saída estruturada, suporte a cache e saída de 128K.
Geração de imagem para 3D que transforma uma imagem de referência em um recurso GLB texturizado.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Alibaba CloudMultimodal reasoner with 256K context, image and video input, function tools, structured JSON, and thinking on by default.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

DeepSeekOfficial 0813 Pro release with major gains across coding, repository work, tool use, and agent tasks, plus hybrid thinking and a 1M context window.
Text-to-image plus multi-reference editing with up to three source images, selectable quality tiers, and 1K or 2K output resolution.

Meta AIMeta Open modelo agentical 30B com compreensão de imagem, contexto 128K, chamada de ferramenta, saída estruturada e força de raciocínio controlável.

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Z.aiModelo de raciocínio e codificação com um contexto de token de 1M, saída de 128K, esforço de raciocínio ajustável, busca nativa na web e chamada de ferramentas.

Moonshot AIKimi K3 é o modelo principal de raciocínio da Moonshot, com contexto de token 1M, pensamento sempre ativo, busca nativa na web e entradas de texto, imagem e vídeo.

Meta AIO modelo atualizado de raciocínio fronteiriço da Meta com um contexto de 1.048.576 tokens, entendimento de imagem, vídeo, áudio e PDF, busca na web e uso de ferramentas.

Moonshot AIKimi K2.7 Code é o modelo de codificação agente de trilhões de parâmetros da Moonshot, com contexto de 256K, raciocínio sempre ativo e entradas de texto, imagem e vídeo.

Meta AIModelo de raciocínio metafrontier com um contexto de 1.048.576 tokens, além de entendimento de imagens, vídeos, áudio e PDF, busca na web e uso de ferramentas.

Black Forest LabsModelo de geração e edição de imagens 4B FLUX.2 Klein licenciado por Apache com suporte a text-to-image, edição de imagens de referência e workflow criativo.

AmazonGeração e edição de imagens modelam a criação e modificação de imagens a partir de texto ou entradas de imagem, com inpainting, virtual try-on e controles de estilo.

TencentModelo text-to-image de código aberto em uma arquitetura multimodal Mixture-of-Experts, com detalhes fotorrealistas e forte renderização multilíngue de texto.

DeepSeekFramework autorregressivo no modelo Janus Pro 7B que unifica compreensão multimodal e geração de imagens em uma única arquitetura.

Alibaba CloudModelo unificado de geração e edição de imagens com renderização de texto complexa Chinese/English líder de classe, texturas realistas e fusão multi-imagem.

Alibaba CloudGeração e edição de imagens Qwen com variantes Base e Pro, tipografia multilíngue, referências multi-imagem e saída controlável em 1K ou 2K.

Kling AITexto para vídeo e image-to-video com áudio nativo sincronizado, em 720p ou 1080p por 3 a 15 segundos, com proporção de aspecto e controle de prompt.

AmazonModelo de geração de vídeo produzindo vídeos de até 2 minutos com múltiplas tomadas a partir de texto e prompts opcionais de imagem, com qualidade e consistência aprimoradas.

Alibaba CloudModelo de vídeo oferecendo modos Texto-para-Vídeo, Imagem-para-Vídeo, Referência para Vídeo e Edição de Vídeo com saída de alta fidelidade e fluidez de movimento.

TencentModelo de vídeo com 8.3B e saída nativa 720p (upscalável para 1080p), forte coerência de movimento e compreensão bilíngue de prompts de até 10s.

Kling AIModelo de vídeo nos modos Standard ou Pro com Texto para Vídeo, Imagem para Vídeo, Referência para Vídeo, edição, som nativo e transições multi-cena.

Kling AIModelo Kling 3.0 que transfere movimento de um vídeo de referência para um personagem de uma imagem de referência, com camadas padrão 720p e Pro 1080p.

ACE-StepModelo de geração de música open-source para áudio guiado por text-to-song e letras, com inferência XL Turbo rápida de 8 passos para iteração controlável das músicas.

InworldModelo de voz em tempo real com direção de voz em inglês simples, uma identidade de voz em 100+ idiomas e time-to-first-audio de streaming abaixo de 200ms.

InworldSíntese de voz TTFB abaixo de 130ms com 271+ vozes em 15 idiomas, prosódia expressiva e streaming SSE em tempo real para agentes de voz de baixa latência.

InworldSíntese de voz de qualidade de transmissão com prosódia expressiva rica, 271+ vozes em 15 idiomas e streaming SSE em tempo real com carimbos de data por palavra.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

GoogleBaixa latência text-to-speech com vozes de um ou múltiplos alto-falantes e estilo, sotaque e tom expressivo controláveis para aplicativos de produção.

DeepgramTranscrição de fala para texto usando o modelo Nova-3 com suporte multilíngue e configurações avançadas personalizáveis para cargas de trabalho de produção.

OpenAIWhisper-1 speech-to-text transcrição treinada com áudio supervisionado multilíngue, com limite de upload de 25 MB por arquivo.

OpenAITranscrição controlada Whisper Large v3 Turbo com ASR multilíngue, tradução, VAD, carimbos de tempo, legendas, hotwords e controles de decodificador.

StepFunModelo de reconhecimento de fala em streaming StepFun para transcrição de áudio em chinês e inglês.

ExaResposta rápida no estilo LLM para uma pergunta em linguagem natural, baseada em resultados de busca exa frescos com citações e links de fonte.

ExaMotor de busca web para encontrar páginas, recuperar páginas semelhantes, rastreamento e busca dedicada por código pela web aberta para agentes de IA.

LinkupBusca iterativa por IA que continua consultando quando os resultados iniciais são insuficientes, retornando respostas mais abrangentes do que o modo Padrão.

LinkupBusca na web impulsionada por IA, com visões detalhadas e respostas, mais rápida que a Deep Search. Está em #1 no benchmark OpenAI SimpleQA.

PerplexityPesquisa de nível institucional baseada no raciocínio Claude Opus 4.6, com máxima profundidade, acesso aprimorado às ferramentas e ampla cobertura de fontes.

PerplexityModelo de pesquisa para recuperação, síntese e raciocínio em múltiplas etapas, pesquisando, lendo e avaliando fontes de forma autônoma em tópicos complexos.

MicrosoftTRELLIS.2 modelo imagem-para-3D que transforma uma imagem de referência em um asset GLB texturizado com controles de resolução, semente, malha, textura e exportação.

DeemosRodin Gen-2 engine that turns a text prompt or up to five reference images into production 3D assets with PBR materials and quad or raw meshes.

Hitem3DProduction-focused image-to-3D with structure-aware textures, 1536 and 1536 Pro precision tiers, meshes up to two million faces, and five export formats.

Alibaba CloudIncorporação de texto multilíngue com dimensões de saída selecionáveis (64–2048). Até 8.192 tokens por entrada.

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba CloudIncorporação multimodal produzindo vetores independentes para entradas, texto, imagem e vídeo.

ByteDanceMultimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.

Alibaba CloudReclassificador semântico de documentos. Ordena até 500 candidatos por consulta por relevância, suporta 100+ idiomas e aceita uma instrução de ordenação personalizada.

GPTZeroDetector de deep learning que sinaliza partes do texto provavelmente geradas por IA versus humanas, classificando o conteúdo como totalmente humano, IA ou misto.

ManusAgente autônomo de IA que transforma um prompt de alto nível em subtarefas, chama ferramentas e APIs, e entrega resultados end-to-end sem orquestração manual.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.