
Codificação e modelo agente com contexto de token de 1M, saída de 128K, raciocínio sempre ativo em esforço baixo, alto ou máximo, busca nativa na web e chamada de ferramentas.
Pague conforme você vai ou escolha um plano com auxílios semanais.
Catálogo de preços
Os preços da EmpirioLabs variam conforme o modelo e a unidade: tokens, imagens, segundos de áudio ou vídeo, mensagens, ativos 3D e solicitações de busca. A tabela de preços interativa carrega o catálogo atual, enquanto essas taxas representativas permanecem legíveis sem JavaScript do cliente.
A entrada da imagem $0.05 por imagem. A saída de vídeo começa a $0.096 por segundo para 480p e $0.168 por segundo para 720p.
A entrada começa em $0.40 por 1M de tokens de prompt para uma API multimodal de longo contexto e custo-efetiva.
A entrada começa em $0.30 por 1M de tokens de prompt para raciocínio multimodal, codificação e cargas de trabalho de agentes.
A geração de imagem para 3D é precificada por ativo 3D gerado, com documentação para controles de formato e resolução.
As tarifas da API de modelos são exibidas e cobradas em USD. O checkout pode mostrar métodos de pagamento locais quando elegíveis.
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4.1 Flash
GLM 5.3 Flash
Qwen3.8 Flash
Qwen3.8 27B
Muse Glimmer 30B
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
MiniMax M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 FlashGrátisThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V FlashGrátisThis model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 FlashGrátisThis model is free to run, so using it never draws from your weekly allowance.
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Fugu Max
Fugu Ultra v2.0
Qwen3.8 Max 0902
Muse Spark 1.3
GLM 5.3
DeepSeek V4 Pro 0813
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 Plus
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

Codificação e modelo agente com contexto de token de 1M, saída de 128K, raciocínio sempre ativo em esforço baixo, alto ou máximo, busca nativa na web e chamada de ferramentas.

Texto para vídeo e image-to-video com áudio nativo sincronizado, em 720p ou 1080p por 3 a 15 segundos, com proporção de aspecto e controle de prompt.

Modelo flash multimodal nativo com contexto de token de 1M, entrada de imagem e vídeo, raciocínio sempre ativo, busca nativa na web e chamada de ferramentas.

Modelo de raciocínio e codificação com um contexto de token de 1M, saída de 128K, esforço de raciocínio ajustável, busca nativa na web e chamada de ferramentas.

Modelo de raciocínio e codificação com um contexto de token de 1M, saída de 128K, esforço de raciocínio ajustável, busca nativa na web e chamada de ferramentas.

Modelo de raciocínio e codificação com um contexto de token de 1M, saída de 128K, esforço de raciocínio ajustável, busca nativa na web e chamada de ferramentas.

Moonshot AIInternationalLançado 15 de jul. de 2026Ctx 1MGeração de TextoKimi K3 é o modelo principal de raciocínio da Moonshot, com contexto de token 1M, pensamento sempre ativo, busca nativa na web e entradas de texto, imagem e vídeo.

O modelo atualizado de raciocínio fronteiriço da Meta com um contexto de 1.048.576 tokens, entendimento de imagem, vídeo, áudio e PDF, busca na web e uso de ferramentas.

Moonshot AIInternationalLançado 16 de jun. de 2026Ctx 256KGeração de TextoKimi K2.7 Code é o modelo de codificação agente de trilhões de parâmetros da Moonshot, com contexto de 256K, raciocínio sempre ativo e entradas de texto, imagem e vídeo.

Moonshot AIGermanyLançado 16 de jun. de 2026Ctx 256KGeração de TextoKimi K2.7 Code é o modelo de codificação agente de trilhões de parâmetros da Moonshot, com contexto de 256K, raciocínio sempre ativo e entradas de texto, imagem e vídeo.

Modelo de raciocínio metafrontier com um contexto de 1.048.576 tokens, além de entendimento de imagens, vídeos, áudio e PDF, busca na web e uso de ferramentas.

Condutor multiagente atualizado para raciocínio rigoroso, codificação e pesquisa, com esforço máximo distinto, contexto 1M, entrada de imagem e busca na web.

Alibaba CloudSingaporeLançado 1 de jun. de 2026Ctx 1MGeração de TextoModelo de visão Qwen3.7 de linguagem de visão econômico para texto, imagem, vídeo, programação, uso de ferramentas, compreensão de interface gráfica e fluxos de trabalho de contexto 1M.

Alibaba CloudChinaLançado 1 de jun. de 2026Ctx 1MGeração de TextoModelo de visão Qwen3.7 de linguagem de visão econômico para texto, imagem, vídeo, programação, uso de ferramentas, compreensão de interface gráfica e fluxos de trabalho de contexto 1M.

Moonshot AIInternationalLançado 16 de jun. de 2026Ctx 256KGeração de TextoKimi K2.7 Code Highspeed é a camada de serviço mais rápido do modelo de codificação agente da Moonshot, com contexto de 256K, raciocínio sempre ativo e entrada de imagem e vídeo.

Condutor multiagente original para raciocínio rigoroso, codificação e pesquisa, com contexto 1M, entrada de imagem, chamada de funções e busca na web.

Alibaba CloudSingaporeLançado 15 de jul. de 2026Ctx 1MGeração de TextoModelo de linguagem visual rápido Qwen3.7 para tarefas de texto, imagem, vídeo, uso de ferramentas e agentes, com cache implícito e contexto de token de 1M.

Alibaba CloudChinaLançado 15 de jul. de 2026Ctx 1MGeração de TextoModelo de linguagem visual rápido Qwen3.7 para tarefas de texto, imagem, vídeo, uso de ferramentas e agentes, com cache implícito e contexto de token de 1M.

MiniMax M3 é um modelo de raciocínio multimodal para codificação, agentes e análise de longo contexto com entrada de texto, imagem e vídeo.

MiniMax M3 é um modelo de raciocínio multimodal para codificação, agentes e análise de longo contexto com entrada de texto, imagem e vídeo.

Alibaba CloudSingaporeLançado 21 de mai. de 2026Ctx 1MGeração de TextoQwen3.7 Max é um modelo de texto principal para programação, produtividade, agentes de longa duração, pensamento profundo, ferramentas e contexto de 1M-token.

Alibaba CloudChinaLançado 21 de mai. de 2026Ctx 1MGeração de TextoQwen3.7 Max é um modelo de texto principal para programação, produtividade, agentes de longa duração, pensamento profundo, ferramentas e contexto de 1M-token.

Alibaba CloudSingaporeLançado 3 de ago. de 2026Ctx 1MGeração de TextoO MoE principal em escala trilionária para programação, agentes de longo prazo e trabalhos profissionais, com compreensão de imagem e vídeo em um contexto de 1 milhão de tokens.

O MoE principal em escala trilionária para programação, agentes de longo prazo e trabalhos profissionais, com compreensão de imagem e vídeo em um contexto de 1 milhão de tokens.

Alibaba CloudSingaporeLançado 26 de ago. de 2026Ctx 1MGeração de TextoModelo de linguagem visual Fast Qwen3.8 para codificação, agentes e compreensão visual, com entrada de imagem e vídeo, cinco ferramentas integradas e um contexto de token de 1M.

Alibaba CloudSingaporeLançado 2 de set. de 2026Ctx 1MGeração de TextoSnapshot Qwen3.8 Max atualizado com codificação mais forte, execuções de agentes multi-ferramenta mais estáveis e visão mais nítida de gráficos e documentos em um contexto de 1M-token.
Modelo de geração de música open-source para áudio guiado por text-to-song e letras, com inferência XL Turbo rápida de 8 passos para iteração controlável das músicas.

Modelo de geração e edição de imagens 4B FLUX.2 Klein licenciado por Apache com suporte a text-to-image, edição de imagens de referência e workflow criativo.

MiniMaxSingaporeLançado 18 de mar. de 2026Ctx 200KGeração de TextoVariante M2.7 de alta velocidade ajustada para inferência rápida com forte desempenho de uso geral e fortes capacidades agentes.
Modelo de voz em tempo real que segue a direção de entrega em inglês simples, mantém uma identidade de voz em 200+ idiomas e transmite com carimbos de data de palavras.
Síntese de voz TTFB abaixo de 130ms com 271+ vozes em 15 idiomas, prosódia expressiva e streaming SSE em tempo real para agentes de voz de baixa latência.
Síntese de voz de qualidade de transmissão com prosódia expressiva rica, 271+ vozes em 15 idiomas e streaming SSE em tempo real com carimbos de data por palavra.

Modelo de raciocínio de IA Zhipu de longo contexto com contexto 202K, saída de 128K, chamada de ferramenta, saída estruturada e suporte a cache.

Kimi K2.6 é um modelo de raciocínio multimodal Moonshot com contexto 256K, codificação forte e entradas de texto, imagem e vídeo.

DeepSeekGermanyLançado 31 de jul. de 2026Ctx 1MGeração de TextoLançamento pós-treinado do 0731 com grandes ganhos em programação, trabalho com repositórios, uso de ferramentas e tarefas full-stack, além de uma janela de contexto de 1M.

DeepSeekUnited StatesLançado 31 de jul. de 2026Ctx 1MGeração de TextoLançamento pós-treinado do 0731 com grandes ganhos em programação, trabalho com repositórios, uso de ferramentas e tarefas full-stack, além de uma janela de contexto de 1M.
Gera músicas estéreo completas a partir de letras e um pedido de estilo, com controles de duração, seed e formato de até 5 minutos.

DeepSeekSingaporeLançado 13 de ago. de 2026Ctx 1MGeração de TextoVersão oficial 0813 Pro com grandes avanços em programação, trabalho com repositórios, uso de ferramentas e tarefas de agentes, além de pensamento híbrido e uma janela de contexto de 1 milhão.

Modelo de raciocínio agente de longo prazo da Meta com um contexto de 1.048.576 tokens, entendimento de imagem, vídeo e PDF, busca na web e chamada de ferramentas.
Síntese de voz em tempo real com latência em primeiro lugar, mantendo uma identidade de voz em 200+ idiomas, ajustada para cargas de trabalho de streaming de alto volume.

DeepSeekSingaporeLançado 10 de set. de 2026Ctx 1MGeração de TextoFlagship leve da nova arquitetura da DeepSeek, com compreensão nativa de imagens, pensamento híbrido, contexto de 1M e até 384K tokens de saída.

MiniMaxSingaporeLançado 18 de mar. de 2026Ctx 200KGeração de TextoMiniMax M2.7 é um modelo de chat de raciocínio de propósito geral com pensamento intercalado, chamadas de funções e cache de prompts.
TRELLIS.2 modelo imagem-para-3D que transforma uma imagem de referência em um asset GLB texturizado com controles de resolução, semente, malha, textura e exportação.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 122B-A10B é um modelo de raciocínio multimodal com contexto de 256K, inferência eficiente e esparsa de MoE, e entrada de texto, imagem e vídeo.

Alibaba CloudChinaLançado 16 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 397B-A17B é um modelo multimodal de raciocínio de referência para linguagem, código, agentes, tarefas de interface gráfica e compreensão de imagem e vídeo.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 35B-A3B é um modelo eficiente nativo de visão-linguagem com roteamento MoE esparso, pensamento profundo e entrada de texto, imagem e vídeo.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 27B é um modelo de raciocínio multimodal denso, com respostas rápidas, contexto 256K e compreensão de texto, imagem e vídeo.

Raciocínio multimodal com 256K de contexto, entrada de imagem e vídeo, ferramentas funcionais, JSON estruturado e pensamento ativo por padrão.

Alibaba CloudChinaLançado 22 de abr. de 2026Ctx 256KGeração de TextoQwen3.6 27B melhora codificação agente, raciocínio STEM, visão espacial, OCR e compreensão de texto, imagem e vídeo no contexto 256K.

Alibaba CloudSingaporeLançado 16 de abr. de 2026Ctx 1MGeração de TextoModelo de visão rápido Qwen3.6 para codificação agente, raciocínio matemático, compreensão espacial, OCR, e entrada de texto, imagem e vídeo.

Alibaba CloudChinaLançado 16 de abr. de 2026Ctx 1MGeração de TextoModelo de visão rápido Qwen3.6 para codificação agente, raciocínio matemático, compreensão espacial, OCR, e entrada de texto, imagem e vídeo.

Gemma 4 26B A4B é um modelo multimodal aberto do Google com 256K de contexto, texto, imagem e vídeo de entrada, ferramentas e saída estruturada.

Meta Open modelo agentical 30B com compreensão de imagem, contexto 128K, chamada de ferramenta, saída estruturada e força de raciocínio controlável.

Qwen3.5 9B é um modelo multimodal compacto de raciocínio com 256K de contexto, entrada de imagem e vídeo, ferramentas funcionais e saída estruturada.

Qwen3.5 4B é um modelo multimodal de raciocínio de baixo custo com 256K de contexto, entrada de imagem e vídeo, ferramentas funcionais e saída estruturada.

Qwen3.6 35B A3B é um modelo de raciocínio mixture-of-experts com 256 especialistas em raciocínio, com contexto de 128K, ferramentas funcionais e saída JSON estruturada e estritamente estruturada.

Modelo de texto GLM-4.7 leve e gratuito para programação, raciocínio, escrita em contexto longo e chat geral.

Modelo de texto GLM-4.5 leve e gratuito para raciocínio, programação, chat longo e tarefas gerais de linguagem.

Modelo multimodal gratuito GLM-4.6V para compreensão de imagens, vídeos, arquivos e texto com chamada nativa de funções.

Geração e edição de imagens modelam a criação e modificação de imagens a partir de texto ou entradas de imagem, com inpainting, virtual try-on e controles de estilo.

Modelo de geração de vídeo produzindo vídeos de até 2 minutos com múltiplas tomadas a partir de texto e prompts opcionais de imagem, com qualidade e consistência aprimoradas.

Transcrição de fala para texto usando o modelo Nova-3 com suporte multilíngue e configurações avançadas personalizáveis para cargas de trabalho de produção.

Combina o DeepSeek R1 chain-of-thought raciocínio com a criação e geração de código do Anthropic Claude por trás de uma interface unificada controlada por dados.

DeepSeekSingaporeLançado 1 de dez. de 2025Ctx 128KGeração de TextoLLM Open-source Mixture-of-Experts ajustado para raciocínio, programação e tarefas gerais de linguagem de alta eficiência em prompts de formato longo.

DeepSeekGermanyLançado 24 de abr. de 2026Ctx 1MGeração de TextoModelo MoE leve com 284B totais / 13B parâmetros ativos e contexto nativo de 1M, ajustado para baixa latência e uso econômico e alta concorrência.

DeepSeekSingaporeLançado 24 de abr. de 2026Ctx 1MGeração de TextoModelo MoE leve com 284B totais / 13B parâmetros ativos e contexto nativo de 1M, ajustado para baixa latência e uso econômico e alta concorrência.

DeepSeekChinaLançado 24 de abr. de 2026Ctx 1MGeração de TextoModelo MoE leve com 284B totais / 13B parâmetros ativos e contexto nativo de 1M, ajustado para baixa latência e uso econômico e alta concorrência.

DeepSeekUnited StatesLançado 24 de abr. de 2026Ctx 1MGeração de TextoModelo MoE leve com 284B totais / 13B parâmetros ativos e contexto nativo de 1M, ajustado para baixa latência e uso econômico e alta concorrência.

DeepSeekGermanyLançado 24 de abr. de 2026Ctx 1MGeração de TextoLLM principal do MoE com 1,6T no total / 49B de parâmetros ativos e contexto nativo de 1M para matemática avançada, inferência lógica e codificação especializada.

DeepSeekSingaporeLançado 24 de abr. de 2026Ctx 1MGeração de TextoLLM principal do MoE com 1,6T no total / 49B de parâmetros ativos e contexto nativo de 1M para matemática avançada, inferência lógica e codificação especializada.

LLM principal do MoE com 1,6T no total / 49B de parâmetros ativos e contexto nativo de 1M para matemática avançada, inferência lógica e codificação especializada.

DeepSeekUnited StatesLançado 24 de abr. de 2026Ctx 1MGeração de TextoLLM principal do MoE com 1,6T no total / 49B de parâmetros ativos e contexto nativo de 1M para matemática avançada, inferência lógica e codificação especializada.

Resposta rápida no estilo LLM para uma pergunta em linguagem natural, baseada em resultados de busca exa frescos com citações e links de fonte.

Motor de busca web para encontrar páginas, recuperar páginas semelhantes, rastreamento e busca dedicada por código pela web aberta para agentes de IA.

Baixa latência text-to-speech com vozes de um ou múltiplos alto-falantes e estilo, sotaque e tom expressivo controláveis para aplicativos de produção.

Prévia TTS de alta qualidade para podcasts, audiolivros e suporte ao cliente, com vozes expressivas em múltiplos alto-falantes em 23+ idiomas.

TTS altamente controlável com novas Tags de Áudio para estilo, tom, ritmo e entrega precisos em narração, assistentes e aplicativos de voz.

Modelo de linguagem vision-open open com contexto de 128K, 140+ linguagens, math/reasoning aprimorada, saídas estruturadas e chamadas de funções.

text-to-speech baseadas em LLM, com clonagem de voz zero-shot de 3 a 10 segundos de áudio e saída controlável e expressiva emocionalmente via RL multi-recompensa.

Detector de deep learning que sinaliza partes do texto provavelmente geradas por IA versus humanas, classificando o conteúdo como totalmente humano, IA ou misto.

Alibaba CloudSingaporeLançado 6 de mai. de 2026Geração de VídeoModelo de vídeo oferecendo modos Texto-para-Vídeo, Imagem-para-Vídeo, Referência para Vídeo e Edição de Vídeo com saída de alta fidelidade e fluidez de movimento.

Modelo text-to-image de código aberto em uma arquitetura multimodal Mixture-of-Experts, com detalhes fotorrealistas e forte renderização multilíngue de texto.

Modelo de vídeo com 8.3B e saída nativa 720p (upscalável para 1080p), forte coerência de movimento e compreensão bilíngue de prompts de até 10s.

Framework autorregressivo no modelo Janus Pro 7B que unifica compreensão multimodal e geração de imagens em uma única arquitetura.

Modelo de vídeo nos modos Standard ou Pro com Texto para Vídeo, Imagem para Vídeo, Referência para Vídeo, edição, som nativo e transições multi-cena.

Modelo Kling 3.0 que transfere movimento de um vídeo de referência para um personagem de uma imagem de referência, com camadas padrão 720p e Pro 1080p.

Busca iterativa por IA que continua consultando quando os resultados iniciais são insuficientes, retornando respostas mais abrangentes do que o modo Padrão.

Busca na web impulsionada por IA, com visões detalhadas e respostas, mais rápida que a Deep Search. Está em #1 no benchmark OpenAI SimpleQA.

Mistral AILançado 17 de mar. de 2025Ctx 128KGeração de TextoModelo multimodal de 24B parâmetros com contexto de 128K para análise de imagens, programação, matemática e tarefas multilíngues, ajustado para inferência local eficiente.

Modelo híbrido unificando as famílias Instrução, Raciocínio (Magistral) e Devstral: 40% menor tempo de conclusão e 3x de taxa de transferência comparado com Pequenos 3.

Modelo de fundação MoE 32B de código aberto que gera vídeo e áudio sincronizados em uma única etapa de inferência, com sincronização labial precisa de duas torres.

Modelo multimodal de baixo custo para texto, imagens e vídeo em um contexto de 300K (até ~30 minutos de vídeo), ajustado para velocidade e acessibilidade.

Modelo de raciocínio multimodal rápido e econômico para texto, imagens, documentos e vídeo em um contexto de 1M (documentos longos e clipes de ~90 minutos).

Modelo de fundação apenas texto ajustado para latência e custo ultra baixos em contexto de 128K. Forte para resumo, tradução e chat, com desconto de 44% no cache.

Modelo de fundação multimodal equilibrando precisão, velocidade e custo para texto, imagens e vídeo em contexto de 300K (até ~30 min de vídeo).

Whisper-1 speech-to-text transcrição treinada com áudio supervisionado multilíngue, com limite de upload de 25 MB por arquivo.

Pesquisa de nível institucional baseada no raciocínio Claude Opus 4.6, com máxima profundidade, acesso aprimorado às ferramentas e ampla cobertura de fontes.

Modelo de pesquisa para recuperação, síntese e raciocínio em múltiplas etapas, pesquisando, lendo e avaliando fontes de forma autônoma em tópicos complexos.

Sonar Pro como pesquisador agente: encadeia buscas na web, busca páginas inteiras e transmite raciocínio ao vivo, adaptando estratégias para consultas complexas.

Busca web em tempo real com filtragem por domínio, idioma, data e mais. Retorna resultados de busca, não respostas de LLM; Sem upload de arquivos.

Busca em tempo real conectada à web, com citações precisas e fontes personalizáveis para integração up-to-date busca por IA em aplicativos de produção.

Modelo baseado em busca, com o dobro das citações e uma janela de contexto maior, ajustado para consultas complexas que precisam de respostas profundas e sutis.

Modelo de raciocínio no código aberto sem censura R1-1776 com busca na web, superando os principais motores de busca e LLMs no benchmark SimpleQA.

Geração de vídeo cinematográfico nos modos Text-to-Video, Image-to-Video e Transição, com alto detalhe, movimento fluido e animações realistas.

Gera vídeos a partir de texto ou prompts de imagem de 1-2 quadros até 1080p, múltiplas proporções de aspecto, durações de 5 a 10 segundos, com áudio sincronizado opcional.

Alibaba CloudSingaporeLançado 3 de mar. de 2026Geração de ImagemModelo unificado de geração e edição de imagens com renderização de texto complexa Chinese/English líder de classe, texturas realistas e fusão multi-imagem.

Alibaba CloudSingaporeLançado 21 de jul. de 2026Geração de ImagemGeração e edição de imagens Qwen com variantes Base e Pro, tipografia multilíngue, referências multi-imagem e saída controlável em 1K ou 2K.

Alibaba CloudSingaporeLançado 24 de fev. de 2026Ctx 1MGeração de TextoModelo de visão-linguagem com atenção linear híbrida mais MoE esparso, contexto 1M e inferência rápida multimodal de text/image/vídeo.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 1MGeração de TextoModelo de visão-linguagem com atenção linear híbrida mais MoE esparso, contexto 1M e inferência rápida multimodal de text/image/vídeo.

Alibaba CloudSingaporeLançado 30 de mar. de 2026Ctx 256KGeração de TextoModelo omnimodal econômico para lidar com texto, imagem, áudio e vídeo, com até 3 horas de áudio e 1 hora de vídeo em 90+ idiomas.

Alibaba CloudSingaporeLançado 30 de mar. de 2026Ctx 256KGeração de TextoModelo omni-modal principal para texto, imagem, áudio e vídeo. 3h áudio, 1h vídeo, 90+ idiomas de entrada e 30+ de saída, 55 timbres de voz.

Alibaba CloudSingaporeLançado 16 de fev. de 2026Ctx 1MGeração de TextoModelo multimodal com arquitetura híbrida para pensamento profundo eficiente e compreensão visual em texto, imagem e vídeo em um contexto de 1M.

Alibaba CloudChinaLançado 16 de fev. de 2026Ctx 1MGeração de TextoModelo multimodal com arquitetura híbrida para pensamento profundo eficiente e compreensão visual em texto, imagem e vídeo em um contexto de 1M.

Alibaba CloudSingaporeLançado 20 de abr. de 2026Ctx 256KGeração de TextoMaior variante de pré-visualização da série 3.6 (apenas texto): melhor execução de agentes de codificação, habilidades de front-end mais fortes e conhecimento mais amplo de long-tail.

Alibaba CloudSingaporeLançado 2 de abr. de 2026Ctx 1MGeração de TextoModelo de visão e linguagem com grandes melhorias em relação à versão 3.5: codificação agente e front-end, reconhecimento multimodal, OCR e localização de objetos.

Alibaba CloudChinaLançado 2 de abr. de 2026Ctx 1MGeração de TextoModelo de visão e linguagem com grandes melhorias em relação à versão 3.5: codificação agente e front-end, reconhecimento multimodal, OCR e localização de objetos.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 256KGeração de Texto256K-contexto principal com grandes melhorias em raciocínio, acompanhamento de instruções e suporte multilíngue, além de maior precisão coding/math.

Alibaba CloudSingaporeLançado 5 de set. de 2025Ctx 256KGeração de TextoVersão prévia com grandes avanços em relação à série 2.5 em compreensão chinês-inglês, instruções complexas, capacidade multilíngue e uso de ferramentas.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 256KGeração de TextoModelo de raciocínio com uso de ferramentas adaptativas (busca, memória, interpretador de código) e escala em tempo de teste para maior precisão em tarefas complexas.

Alibaba CloudSingaporeLançado 5 de jun. de 2025Ctx 4KReclassificadoresReclassificador semântico de documentos. Ordena até 500 candidatos por consulta por relevância, suporta 100+ idiomas e aceita uma instrução de ordenação personalizada.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo 256K ajustado para codificação, com resultados front-end fortes e suporte multilíngue para ferramentas e agentes de codificação por IA.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo de uso geral balanceado para cargas de trabalho corporativas de alta frequência: processamento de informações, conteúdo, busca e análise de dados.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo multimodal focado em latência com contexto de 256K, quatro modos de esforço de raciocínio e image/video compreensão para uso em alta concorrência.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo geral principal com 256K contexto para raciocínio complexo, compreensão multimodal, geração estruturada e execução aumentada por ferramentas.

Variante de vídeo 2.0 otimizada para velocidade e clipes cinematográficos com sincronização nativa de áudio, controle de câmera e movimento estável a menor custo por renderizado.

Modelo de vídeo multimodal para saída cinematográfica de texto, imagem, áudio ou vídeo, com movimento estável e caracteres consistentes.

ByteDanceMalaysiaLançado 13 de fev. de 2026Geração de ImagemModelo de imagem multimodal unificado que raciocina por meio de prompts antes de renderizar, produzindo edições e visuais de marca de alta resolução e consistentes.

Modelo premium de imagem Seedream que divide uma imagem em camadas editáveis, edita por coordenadas ou marcadores de esboço, e funde até 10 referências.

Modelo de voz open-source para diálogos de podcast de longa duração e múltiplos alto-falantes com controle paralinguístico (risos, suspiros) e clonagem de voz zero-shot.

Gera áudio de até 3 minutos a partir de prompts de texto, suportando text-to-audio e audio-to-audio com duração, passos e escala CFG ajustáveis.

Up-to-3-minute áudio do texto com text-to-audio, audio-to-audio e inpainting de áudio para produção musical, design de som e remixagem.

Stable Video Infinity 2.0 Pro na WAN 2.2: estende imagens estáticas para vídeos teoricamente de comprimento infinito, mantendo IDs de personagens consistentes.

Assistente de pesquisa multi-busca que explora um tema, analisa fontes e produz um relatório detalhado com citações.

Busca na web com rastreamento, extração e mapeamento de URL para recuperação rápida e estruturada entre páginas e domínios para pipelines posteriores.

Alibaba CloudSingaporeLançado 4 de jun. de 2025Ctx 8KIncorporaçõesIncorporação de texto multilíngue com dimensões de saída selecionáveis (64–2048). Até 8.192 tokens por entrada.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 1KIncorporaçõesEmbedding multimodal otimizado para velocidade, mesmo formato do Vision-Plus, tokens image/video 3× mais baratos.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 1KIncorporaçõesIncorporação multimodal produzindo vetores independentes para entradas, texto, imagem e vídeo.

Modelo de geração de vídeo multimodal para histórias cinematográficas com múltiplos planos e sincronização áudio-visual nativa (dublagem labial, diálogo, música, efeitos sonoros).

Modelo de vídeo multimodal suportando T2V, I2V, edição de vídeo e reference-to-video, com saída de alta fidelidade a partir de entradas, texto, imagem ou vídeo.

Modelo companheiro de geração e edição de imagens: text-to-image, edições em caixa delimitadora e conjuntos de imagens coesos, com saída de até 4K no Pro.
Transcrição controlada Whisper Large v3 Turbo com ASR multilíngue, tradução, VAD, carimbos de tempo, legendas, hotwords e controles de decodificador.

Agente autônomo de IA que transforma um prompt de alto nível em subtarefas, chama ferramentas e APIs, e entrega resultados end-to-end sem orquestração manual.

Geração de texto para vídeo, image-to-video e reference-to-video com até sete imagens de referência para caracteres consistentes, até 15 segundos em 1080p.

Modelo de alto nível para fluxos de trabalho agentes, engenharia de software complexa e tarefas de longo prazo, sustentando trabalho em 1000+ chamadas de ferramentas em contexto de 1M.

Modelo multimodal com compreensão visual e sonora nativa em um contexto 1M, projetado para raciocinar e agir entre modalidades em fluxos de trabalho agentes.

Alibaba CloudSingaporeLançado 22 de jun. de 2026Geração de VídeoTexto, imagem e reference-to-video em um único modelo. Movimento cinematográfico, consistência dos personagens em até 9 referências e áudio nativo sincronizado.

O nível Seedance 2.0 mais rápido e acessível para clipes curtos de cinema, com áudio nativo, controle de câmera e entradas de imagem ou vídeo em 480p e 720p.

StepFunInternationalLançado 28 de mai. de 2026Ctx 256KGeração de TextoModelo de raciocínio multimodal StepFun com entrada de imagem e vídeo, chamada de ferramenta, esforço de raciocínio ajustável e contexto 256K.

StepFunInternationalLançado 12 de fev. de 2026Ctx 256KGeração de TextoModelo de raciocínio textual StepFun para agentes, codificação, chamada de ferramentas e análise de contexto longo.

StepFunInternationalLançado 2 de abr. de 2026Ctx 256KGeração de TextoVariante Flash Step 3.5 otimizada para agente com modos de esforço de raciocínio baixo e alto.

Modelo de conversa de áudio e texto StepFun com saída de texto e compreensão paralinguística.

StepFunInternationalLançado 29 de abr. de 2026Geração de ImagemModelo de geração e edição de imagens StepFun para edições text-to-image e de imagem única.

StepFunInternationalLançado 21 de abr. de 2026Geração de ÁudioModelo contextual StepFun text-to-speech com direção de voz em linguagem natural e entrega expressiva.

StepFun text-to-speech modelo com vozes oficiais, vozes clonadas personalizadas e controles de tag de voz.

Modelo de reconhecimento de fala em streaming StepFun para transcrição de áudio em chinês e inglês.

ByteDanceMalaysiaLançado 13 de jul. de 2026Ctx 256KGeração de TextoModelo de codificação e agente de próxima geração com entrega de código de nível de engenharia, autonomia de longo prazo e compreensão multimodal de 256K.

Alibaba CloudSingaporeLançado 20 de jul. de 2026Geração de ÁudioSíntese de fala em níveis com mais de 1.000 vozes, 16 idiomas, 20 dialetos chineses, direção de entrega em linguagem natural e tags emocionais inline.

Gera clipes de 4 a 15 segundos em até 2K com áudio estéreo nativo, seguindo referências de texto, imagem, vídeo e áudio em uma única solicitação.

Modelo de imagem principal da OpenAI com forte fidelidade de prompts, renderização de texto nítida e edição baseada em instruções em até 16 imagens de referência.

Gerador de vídeo Kling 3.0 da Kuaishou com text-to-video, primeiro e último quadro image-to-video, áudio nativo e saída 720p, 1080p ou 4K.

Modelo de vídeo Wan 2.5 da Alibaba com text-to-video e image-to-video, áudio nativo, faixas de áudio personalizadas opcionais e saída de 480p a 1080p.

Família de vídeo Wan 2.2 da Alibaba com níveis padrão e flash, interpolação de primeiro e último quadro, e saída de 480p para 1080p a baixo custo.

Modelo de vídeo Wan 2.1 da Alibaba com níveis turbo e plus para text-to-video, image-to-video e primeiro e último quadro clipam em 480p ou 720p.

Alibaba CloudSingaporeLançado 24 de set. de 2025Geração de ImagemModelo de imagem Wan 2.5 da Alibaba com edição text-to-image e multirreferência de até 3 imagens em cerca de 1,7 megapixels.

Alibaba CloudSingaporeLançado 28 de jul. de 2025Geração de ImagemO modelo Wan 2.2 da Alibaba text-to-image com níveis plus e flash e até 1440x1440 de saída a baixo preço por imagem.

Alibaba CloudSingaporeLançado 25 de fev. de 2025Geração de ImagemModelo Wan 2.1 text-to-image da Alibaba com níveis turbo e plus e até 1440x1440 com preço baixo por imagem.

Modelo de vídeo de formato longo para clipes coerentes de até 30 segundos, com até 50 imagens de referência, vídeos e clipes de áudio, áudio nativo, edição e extensão.

Texto para imagem mais edição multirreferencial com até cinco imagens fonte, níveis automáticos ou fixados de qualidade e resolução de saída 1K ou 2K.

Gera vídeo a partir de texto, imagens, primeiro e último quadro, ou até sete referências, com áudio nativo, cortes de múltiplos planos e extensão de clipe.

Modelo de vídeo de nível cinematográfico para ação e efeitos, a partir de texto, imagens, primeiro e último quadro, ou referências, com áudio sincronizado nativo.

Alinha o movimento da boca em um vídeo existente a uma faixa de áudio enviada ou ao texto falado por uma das quatorze vozes embutidas.
Transforma um único retrato em um vídeo de avatar falante, impulsionado por uma faixa de áudio enviada ou por texto falado com uma voz embutida.

Seis transformações de vídeo em um modelo: edição de prompts, restyling, troca de sujeito, transferência de movimento, upscaling e efeitos sonoros gerados.

Geração conjunta de áudio e vídeo com sincronização labial de milissegundos, diálogos em seis idiomas, movimentos de câmera cinematográficos e saída de até 1080p.

Geração e edição de imagens de alta fidelidade com até 14 imagens de referência, renderização de texto forte e saída 2K ou 4K por um preço fixo.

Geração e edição unificada de imagens com até 14 imagens de referência, conjuntos em lote de até 15 e saída de 1K a 4K com um preço fixo por imagem.

Rodin Gen-2 que transforma um prompt de texto ou até cinco imagens de referência em ativos 3D de produção com materiais PBR e malhas quad ou brutas.

Imagem para 3D focada em produção com texturas conscientes da estrutura, níveis de precisão 1536 e 1536 Pro, malhas de até dois milhões de faces e cinco formatos de exportação.

ByteDanceMalaysiaLançado 28 de jun. de 2025Ctx 8KIncorporaçõesIncorporação multimodal que funde texto, imagens e vídeo em um único vetor de dimensão 1024 ou 2048 para busca e recuperação cross-modal.

Geração de vídeo tudo-em-um de até 30 segundos com áudio nativo, referências omni-modais (imagens, vídeo, áudio, arquivos, links web) e um nível Prime rápido.

Condutor multiagente econômico que reúne uma equipe de especialistas do tamanho certo por tarefa, com 1M de contexto, entrada de imagem e busca na web.

Condutor multiagente principal para o raciocínio, codificação e pesquisa mais difíceis, com contexto de 1M, entrada de imagem e busca na web.
163 / 182 Modelos