
Muse Glimmer 30B
Meta AIMeta Open modelo agentical 30B com compreensão de imagem, contexto 128K, chamada de ferramenta, saída estruturada e força de raciocínio controlável.
Navegue pelo catálogo completo de modelos em texto, imagem, áudio, vídeo, 3D e muito mais.
Catálogo de modelos
Navegue por texto, imagem, vídeo, áudio, 3D, busca e endpoints de agentes com preços pay-as-you-go. O catálogo interativo carrega a disponibilidade atual do EmpirioLabs, e esses documentos modelo são rastreáveis sem JavaScript do cliente.
xAI image-to-video com movimento guiado por prompt, áudio nativo, saída 480p ou 720p e clipes de até 15 segundos.
Geração de vídeo multimodal para clipes cinematográficos a partir de entradas, texto, imagem, áudio ou vídeo.
Geração e edição unificada de imagens para criatividade, visual de marca e produto em alta resolução.
Modelo de linguagem visual econômico para texto, imagem, vídeo, programação, ferramentas e fluxos de trabalho com contexto de 1M.
Modelo principal de longo contexto para programação, produtividade, agentes de longa duração, pensamento profundo e uso de ferramentas.
Raciocínio multimodal para codificação, agentes, análise de contexto longo e entrada de texto, imagem e vídeo.
Moonshot raciocínio multimodal com forte suporte à programação, contexto 256K e entrada de imagem e vídeo.
Raciocínio de longo contexto com chamada de ferramentas, saída estruturada, suporte a cache e saída de 128K.
Geração de imagem para 3D que transforma uma imagem de referência em um recurso GLB texturizado.

Meta AIMeta Open modelo agentical 30B com compreensão de imagem, contexto 128K, chamada de ferramenta, saída estruturada e força de raciocínio controlável.

ByteDanceModelo de vídeo de formato longo para clipes coerentes de até 30 segundos, com até 50 imagens de referência, vídeos e clipes de áudio, áudio nativo, edição e extensão.

Meta AIO modelo atualizado de raciocínio fronteiriço da Meta com um contexto de 1.048.576 tokens, entendimento de imagem, vídeo, áudio e PDF, busca na web e uso de ferramentas.

Alibaba CloudGeração e edição de imagens Qwen com variantes Base e Pro, tipografia multilíngue, referências multi-imagem e saída controlável em 1K ou 2K.

MiniMaxGera clipes de 4 a 15 segundos em até 2K com áudio estéreo nativo, seguindo referências de texto, imagem, vídeo e áudio em uma única solicitação.

Alibaba CloudO MoE principal em escala trilionária para programação, agentes de longo prazo e trabalhos profissionais, com compreensão de imagem e vídeo em um contexto de 1 milhão de tokens.

Z.aiModelo de raciocínio e codificação com um contexto de token de 1M, saída de 128K, esforço de raciocínio ajustável, busca nativa na web e chamada de ferramentas.

Moonshot AIKimi K3 é o modelo principal de raciocínio da Moonshot, com contexto de token 1M, pensamento sempre ativo, busca nativa na web e entradas de texto, imagem e vídeo.

Meta AIO modelo atualizado de raciocínio fronteiriço da Meta com um contexto de 1.048.576 tokens, entendimento de imagem, vídeo, áudio e PDF, busca na web e uso de ferramentas.

Moonshot AIKimi K2.7 Code é o modelo de codificação agente de trilhões de parâmetros da Moonshot, com contexto de 256K, raciocínio sempre ativo e entradas de texto, imagem e vídeo.

Meta AIModelo de raciocínio metafrontier com um contexto de 1.048.576 tokens, além de entendimento de imagens, vídeos, áudio e PDF, busca na web e uso de ferramentas.

Sakana AICondutor multiagente atualizado para raciocínio rigoroso, codificação e pesquisa, com esforço máximo distinto, contexto 1M, entrada de imagem e busca na web.

Black Forest LabsModelo de geração e edição de imagens 4B FLUX.2 Klein licenciado por Apache com suporte a text-to-image, edição de imagens de referência e workflow criativo.

AmazonGeração e edição de imagens modelam a criação e modificação de imagens a partir de texto ou entradas de imagem, com inpainting, virtual try-on e controles de estilo.

TencentModelo text-to-image de código aberto em uma arquitetura multimodal Mixture-of-Experts, com detalhes fotorrealistas e forte renderização multilíngue de texto.

DeepSeekFramework autorregressivo no modelo Janus Pro 7B que unifica compreensão multimodal e geração de imagens em uma única arquitetura.

Alibaba CloudModelo unificado de geração e edição de imagens com renderização de texto complexa Chinese/English líder de classe, texturas realistas e fusão multi-imagem.

Alibaba CloudGeração e edição de imagens Qwen com variantes Base e Pro, tipografia multilíngue, referências multi-imagem e saída controlável em 1K ou 2K.

Kling AITexto para vídeo e image-to-video com áudio nativo sincronizado, em 720p ou 1080p por 3 a 15 segundos, com proporção de aspecto e controle de prompt.

AmazonModelo de geração de vídeo produzindo vídeos de até 2 minutos com múltiplas tomadas a partir de texto e prompts opcionais de imagem, com qualidade e consistência aprimoradas.

Alibaba CloudModelo de vídeo oferecendo modos Texto-para-Vídeo, Imagem-para-Vídeo, Referência para Vídeo e Edição de Vídeo com saída de alta fidelidade e fluidez de movimento.

TencentModelo de vídeo com 8.3B e saída nativa 720p (upscalável para 1080p), forte coerência de movimento e compreensão bilíngue de prompts de até 10s.

Kling AIModelo de vídeo nos modos Standard ou Pro com Texto para Vídeo, Imagem para Vídeo, Referência para Vídeo, edição, som nativo e transições multi-cena.

Kling AIModelo Kling 3.0 que transfere movimento de um vídeo de referência para um personagem de uma imagem de referência, com camadas padrão 720p e Pro 1080p.

ACE-StepModelo de geração de música open-source para áudio guiado por text-to-song e letras, com inferência XL Turbo rápida de 8 passos para iteração controlável das músicas.

InworldModelo de voz em tempo real com direção de voz em inglês simples, uma identidade de voz em 100+ idiomas e time-to-first-audio de streaming abaixo de 200ms.

InworldSíntese de voz TTFB abaixo de 130ms com 271+ vozes em 15 idiomas, prosódia expressiva e streaming SSE em tempo real para agentes de voz de baixa latência.

InworldSíntese de voz de qualidade de transmissão com prosódia expressiva rica, 271+ vozes em 15 idiomas e streaming SSE em tempo real com carimbos de data por palavra.

GoogleBaixa latência text-to-speech com vozes de um ou múltiplos alto-falantes e estilo, sotaque e tom expressivo controláveis para aplicativos de produção.

GooglePrévia TTS de alta qualidade para podcasts, audiolivros e suporte ao cliente, com vozes expressivas em múltiplos alto-falantes em 23+ idiomas.

DeepgramTranscrição de fala para texto usando o modelo Nova-3 com suporte multilíngue e configurações avançadas personalizáveis para cargas de trabalho de produção.

OpenAIWhisper-1 speech-to-text transcrição treinada com áudio supervisionado multilíngue, com limite de upload de 25 MB por arquivo.

OpenAITranscrição controlada Whisper Large v3 Turbo com ASR multilíngue, tradução, VAD, carimbos de tempo, legendas, hotwords e controles de decodificador.

StepFunModelo de reconhecimento de fala em streaming StepFun para transcrição de áudio em chinês e inglês.

ExaResposta rápida no estilo LLM para uma pergunta em linguagem natural, baseada em resultados de busca exa frescos com citações e links de fonte.

ExaMotor de busca web para encontrar páginas, recuperar páginas semelhantes, rastreamento e busca dedicada por código pela web aberta para agentes de IA.

LinkupBusca iterativa por IA que continua consultando quando os resultados iniciais são insuficientes, retornando respostas mais abrangentes do que o modo Padrão.

LinkupBusca na web impulsionada por IA, com visões detalhadas e respostas, mais rápida que a Deep Search. Está em #1 no benchmark OpenAI SimpleQA.

PerplexityPesquisa de nível institucional baseada no raciocínio Claude Opus 4.6, com máxima profundidade, acesso aprimorado às ferramentas e ampla cobertura de fontes.

PerplexityModelo de pesquisa para recuperação, síntese e raciocínio em múltiplas etapas, pesquisando, lendo e avaliando fontes de forma autônoma em tópicos complexos.

MicrosoftTRELLIS.2 modelo imagem-para-3D que transforma uma imagem de referência em um asset GLB texturizado com controles de resolução, semente, malha, textura e exportação.

Alibaba CloudIncorporação de texto multilíngue com dimensões de saída selecionáveis (64–2048). Até 8.192 tokens por entrada.

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba CloudIncorporação multimodal produzindo vetores independentes para entradas, texto, imagem e vídeo.

Alibaba CloudReclassificador semântico de documentos. Ordena até 500 candidatos por consulta por relevância, suporta 100+ idiomas e aceita uma instrução de ordenação personalizada.

GPTZeroDetector de deep learning que sinaliza partes do texto provavelmente geradas por IA versus humanas, classificando o conteúdo como totalmente humano, IA ou misto.

ManusAgente autônomo de IA que transforma um prompt de alto nível em subtarefas, chama ferramentas e APIs, e entrega resultados end-to-end sem orquestração manual.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.