
Texto-para-vídeo e image-to-video com áudio nativo sincronizado, em 720p ou 1080p por 3 a 15 segundos, com relação de aspecto e controle de prompt.
Pague apenas pelo que você usar. Sem bloqueios de assinatura.
Catálogo de preços
Os preços da EmpirioLabs variam conforme o modelo e a unidade: tokens, imagens, segundos de áudio ou vídeo, mensagens, ativos 3D e solicitações de busca. A tabela de preços interativa carrega o catálogo atual, enquanto essas taxas representativas permanecem legíveis sem JavaScript do cliente.
A entrada da imagem $0.05 por imagem. A saída de vídeo começa a $0.096 por segundo para 480p e $0.168 por segundo para 720p.
A entrada começa em $0.40 por 1M de tokens de prompt para uma API multimodal de longo contexto e custo-efetiva.
A entrada começa em $0.30 por 1M de tokens de prompt para raciocínio multimodal, codificação e cargas de trabalho de agentes.
A geração de imagem para 3D é precificada por ativo 3D gerado, com documentação para controles de formato e resolução.
As tarifas da API de modelos são exibidas e cobradas em USD. O checkout pode mostrar métodos de pagamento locais quando elegíveis.

Texto-para-vídeo e image-to-video com áudio nativo sincronizado, em 720p ou 1080p por 3 a 15 segundos, com relação de aspecto e controle de prompt.

Raciocínio e modelo de codificação com um contexto de token 1M, saída 128K, esforço de raciocínio ajustável, busca nativa web e chamada de ferramenta.

Raciocínio e modelo de codificação com um contexto de token 1M, saída 128K, esforço de raciocínio ajustável, busca nativa web e chamada de ferramenta.

Moonshot AIInternationalLançado 15 de jul. de 2026Ctx 1MGeração de TextoKimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

Moonshot AIInternationalLançado 16 de jun. de 2026Ctx 256KGeração de TextoKimi K2.7 O código é o modelo de codificação agentic trilião-parâmetro de Moonshot com 256K contexto, sempre em raciocínio, e texto, imagem, e entradas de vídeo.

Moonshot AIGermanyLançado 16 de jun. de 2026Ctx 256KGeração de TextoKimi K2.7 O código é o modelo de codificação agentic trilião-parâmetro de Moonshot com 256K contexto, sempre em raciocínio, e texto, imagem, e entradas de vídeo.

Modelo de raciocínio metafrontier com contexto de token de 1M, compreensão de imagem e vídeo, busca web embutida com fontes citadas e chamada de ferramentas.

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

Alibaba CloudSingaporeLançado 1 de jun. de 2026Ctx 1MGeração de TextoModelo de linguagem de visão Qwen3.7 econômico para texto, imagem, vídeo, codificação, uso de ferramentas, compreensão de GUI e fluxos de trabalho de 1M-contexto.

Alibaba CloudChinaLançado 1 de jun. de 2026Ctx 1MGeração de TextoModelo de linguagem de visão Qwen3.7 econômico para texto, imagem, vídeo, codificação, uso de ferramentas, compreensão de GUI e fluxos de trabalho de 1M-contexto.

Moonshot AIInternationalLançado 16 de jun. de 2026Ctx 256KGeração de TextoKimi K2.7 O Code Highspeed é o nível de serviço mais rápido do modelo de codificação agentic da Moonshot, com 256K de contexto, sempre em raciocínio e entrada de imagem e vídeo.

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Alibaba CloudSingaporeLançado 15 de jul. de 2026Ctx 1MGeração de TextoFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

Alibaba CloudChinaLançado 15 de jul. de 2026Ctx 1MGeração de TextoFast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.

MiniMax M3 é um modelo de raciocínio multimodal para codificação, agentes e análise de contexto longo com texto, imagem e entrada de vídeo.

MiniMax M3 é um modelo de raciocínio multimodal para codificação, agentes e análise de contexto longo com texto, imagem e entrada de vídeo.

Alibaba CloudSingaporeLançado 21 de mai. de 2026Ctx 1MGeração de TextoQwen3.7 Max é um modelo de texto emblemático para codificação, produtividade, agentes de longo prazo, pensamento profundo, ferramentas e contexto de 1M-token.

Alibaba CloudChinaLançado 21 de mai. de 2026Ctx 1MGeração de TextoQwen3.7 Max é um modelo de texto emblemático para codificação, produtividade, agentes de longo prazo, pensamento profundo, ferramentas e contexto de 1M-token.
Modelo de geração de música de código aberto para text-to-song e áudio guiado por letras, com rápida inferência XL Turbo de 8 passos para iterações de músicas controláveis.

Licença Apache 4B FLUX.2 Modelo de geração e edição de imagens Klein com text-to-image, edição de imagem de referência e suporte ao fluxo de trabalho criativo.

MiniMaxSingaporeLançado 18 de mar. de 2026Ctx 200KGeração de TextoVariante M2.7 de alta velocidade sintonizada para inferência rápida com forte desempenho de propósito geral com fortes capacidades de agente.
Modelo de voz em tempo real com direção de voz em inglês simples, uma identidade de voz em 100+ idiomas e time-to-first-audio de streaming abaixo de 200ms.
Sub-130ms TTFB síntese de voz com 271+ vozes em 15 idiomas, prosódia expressiva e streaming em tempo real para agentes de voz de baixa latência.
Síntese de voz de qualidade de transmissão com prosódia expressiva rica, 271+ vozes em 15 idiomas e streaming em tempo real de SSE com datas por palavra.

Modelo de raciocínio Zhipu AI de contexto longo com contexto 202K, saída 128K, chamada de ferramentas, saída estruturada e suporte a cache.

Kimi K2.6 é um modelo de raciocínio multimodal Moonshot com 256K de contexto, codificação forte e entradas de texto, imagem e vídeo.

MiniMaxSingaporeLançado 18 de mar. de 2026Ctx 200KGeração de TextoMiniMax M2.7 é um modelo de chat de raciocínio de propósito geral com pensamento interleaved, função chamando, e caching prompt.
TRELLIS.2 modelo imagem-para-3D que transforma uma imagem de referência em um ativo GLB texturizado com resolução, semente, malha, textura e controles de exportação.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 122B-A10B é um modelo de raciocínio multimodal com contexto 256K, inferência de MoE esparsa eficiente, texto, imagem e entrada de vídeo.

Alibaba CloudChinaLançado 16 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 397B-A17B é um modelo de raciocínio multimodal emblemático para linguagem, código, agentes, tarefas GUI e compreensão de imagens e vídeo.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 35B-A3B é um modelo eficiente de linguagem de visão nativa com roteamento de MoE esparso, pensamento profundo e entrada de texto, imagem e vídeo.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 256KGeração de TextoQwen3.5 27B é um modelo de raciocínio multimodal denso com respostas rápidas, contexto 256K e compreensão de texto, imagem e vídeo.

Alibaba CloudChinaLançado 22 de abr. de 2026Ctx 256KGeração de TextoQwen3.6 27B melhora a codificação agente, raciocínio STEM, visão espacial, OCR, texto, imagem e compreensão de vídeo no contexto 256K.

Alibaba CloudSingaporeLançado 16 de abr. de 2026Ctx 1MGeração de TextoModelo rápido de linguagem de visão Qwen3.6 para codificação agente, raciocínio matemático, compreensão espacial, OCR, texto, imagem e entrada de vídeo.

Alibaba CloudChinaLançado 16 de abr. de 2026Ctx 1MGeração de TextoModelo rápido de linguagem de visão Qwen3.6 para codificação agente, raciocínio matemático, compreensão espacial, OCR, texto, imagem e entrada de vídeo.

Gemma 4 26B A4B é um modelo multimodal aberto do Google com 256K de contexto, texto, imagem e entrada de vídeo, ferramentas e saída estruturada.

Qwen3.5 9B é um modelo de raciocínio multimodal compacto com 256K de contexto, entrada de imagem e vídeo, ferramentas de função e saída estruturada.

Qwen3.5 4B é um modelo de raciocínio multimodal de baixo custo com 256K de contexto, entrada de imagem e vídeo, ferramentas de função e saída estruturada.

Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

Modelo de texto GLM-4.7 leve gratuito para codificação, raciocínio, escrita de longo contexto e chat geral.

Modelo de texto GLM-4.5 leve livre para raciocínio, codificação, chat de longa duração e tarefas de linguagem geral.

Modelo multimodal GLM-4.6V gratuito para imagem, vídeo, arquivo e compreensão de texto com chamada de função nativa.

Modelo de geração e edição de imagens criando e modificando imagens a partir de entradas de texto ou imagem, com inpinting, virtual try-on, e controles de estilo.

Modelo de geração de vídeo produzindo até 2 minutos de vídeos multi-shot de texto e avisos de imagem opcionais com melhor qualidade e consistência.

Transcrição de fala-texto utilizando o modelo Nova-3 com suporte multilíngue e configurações personalizáveis avançadas para cargas de trabalho de produção.

Pares DeepSeek R1 chain-of-thought raciocínio com a criação Anthropic Claude e geração de código atrás de uma interface unificada, controlada por dados.

LLM de código aberto especializado em prova de teorema formal em Lean 4, construído em um pipeline de prova recursiva de teorema.

DeepSeekSingaporeLançado 1 de dez. de 2025Ctx 128KGeração de TextoOpen-source Mixture-of-Experts LLM sintonizado para raciocínio de alta eficiência, codificação e tarefas gerais de linguagem em prompts de longa forma.

DeepSeekGermanyLançado 24 de abr. de 2026Ctx 1MGeração de TextoModelo MoE leve com 284B total / 13B parâmetros ativos e contexto nativo de 1M, sintonizado para uso de alta concorrência de baixa latência e econômico.

DeepSeekSingaporeLançado 24 de abr. de 2026Ctx 1MGeração de TextoModelo MoE leve com 284B total / 13B parâmetros ativos e contexto nativo de 1M, sintonizado para uso de alta concorrência de baixa latência e econômico.

DeepSeekChinaLançado 24 de abr. de 2026Ctx 1MGeração de TextoModelo MoE leve com 284B total / 13B parâmetros ativos e contexto nativo de 1M, sintonizado para uso de alta concorrência de baixa latência e econômico.

DeepSeekGermanyLançado 24 de abr. de 2026Ctx 1MGeração de TextoFlagship MoE LLM com 1.6T total / 49B parâmetros ativos e contexto nativo 1M para matemática avançada, inferência lógica e codificação especializada.

DeepSeekSingaporeLançado 24 de abr. de 2026Ctx 1MGeração de TextoFlagship MoE LLM com 1.6T total / 49B parâmetros ativos e contexto nativo 1M para matemática avançada, inferência lógica e codificação especializada.

Flagship MoE LLM com 1.6T total / 49B parâmetros ativos e contexto nativo 1M para matemática avançada, inferência lógica e codificação especializada.

Resposta rápida ao estilo LLM a uma questão de linguagem natural, fundamentada em resultados de busca recente da web Exa com citações em linha e links de origem.

Mecanismo de busca da Web para encontrar páginas, recuperar páginas semelhantes, rastejar, e busca de código dedicado através da web aberta para agentes de IA.

Baixa latência text-to-speech com vozes mono e multi-falantes e estilo controlável, sotaque e tom expressivo para aplicativos de produção.

Pré-visualização TTS de alta qualidade para podcasts, audiolivros e suporte ao cliente, com vozes expressivas multi-falantes em mais de 23 idiomas.

TTS altamente controlável com novas etiquetas de áudio para estilo preciso, tom, ritmo e entrega através de narração, assistentes e aplicativos de voz.

Modelo vision-language de código aberto com contexto 128K, 140+ linguagens, melhorado math/reasoning, saídas estruturadas e chamada de função.

LLM-based text-to-speech com clonagem de voz zero de 3-10s de áudio e emoção-expressiva, saída controlável através de RL multi-recompensa.

Detector de aprendizagem profunda que sinaliza porções de texto provavelmente geradas por IA versus humanos, classificando o conteúdo como inteiramente humano, IA ou misto.

Alibaba CloudSingaporeLançado 6 de mai. de 2026Geração de VídeoModelo de vídeo que oferece os modos Texto-para-Video, Imagem-para-Vídeo, Referência-para-Vídeo e Edição de Vídeo com alta fidelidade, movimento-saída.

Open-source text-to-image modelo em uma arquitetura multimodal Mixture-of-Experts com detalhes fotorealistas e forte renderização de texto multilingue.

Modelo de vídeo de 8,3B-parâmetros com saída nativa de 720p (upcalable a 1080p), forte coerência de movimento, e entendimento rápido bilíngue até 10s.

Framework autorregressivo no modelo Janus Pro 7B que unifica compreensão multimodal e geração de imagem em uma arquitetura.

Modelo de vídeo em modos Standard ou Pro com transições de Texto para Vídeo, Imagem para Vídeo, Referência para Vídeo, edição, som nativo e multi-cena.

Modelo Kling 3.0 que transfere movimento de um vídeo de referência para um caractere de uma imagem de referência, com níveis Standard 720p e Pro 1080p.

Pesquisa de IA iterativa que continua consultando quando os resultados iniciais são insuficientes, retornando respostas mais abrangentes do que o modo Padrão.

Pesquisa web com tecnologia de IA com visão geral e respostas detalhadas, mais rápido do que a pesquisa profunda. Ranks #1 no OpenAI SimpleQA benchmark.

Modelo de linguagem custo-eficiente oferecendo forte raciocínio e desempenho multimodal para cargas de trabalho de produção geral em latência competitiva.

Mistral AILançado 12 de ago. de 2025Ctx 131KGeração de TextoModelo de nível empresarial com forte raciocínio, codificação e desempenho STEM, suportando implantações híbridas, on-prem e in-VPC.

Mistral AILançado 17 de mar. de 2025Ctx 128KGeração de TextoModelo multimodal 24B-parâmetro com contexto 128K para análise de imagens, programação, matemática e tarefas multilingues, sintonizadas para inferência local eficiente.

Modelo híbrido unificando as famílias Instrução, Raciocínio (Magistral) e Devstral: 40% menor tempo de conclusão e 3x rendimento vs Small 3.

Modelo de fundação Open-source 32B MoE que gera vídeo sincronizado e áudio em uma etapa de inferência com dupla torre precisa de sincronia labial.

Modelo de fundação multimodal de baixo custo para texto, imagens e vídeo em um contexto de 300K (até ~ 30 minutos de vídeo), sintonizado para velocidade e acessibilidade.

Modelo de raciocínio multimodal rápido e econômico para texto, imagens, documentos e vídeo em um contexto de 1M (docs longos e clipes de ~90 min).

Modelo de fundação somente texto sintonizado para latência ultra-baixa e custo no contexto 128K. Forte para resumo, tradução e bate-papo com 44% de desconto de cache.

Modelo mais capaz na família. Multimodal text/image /vídeo em um contexto de 1M com chain-of-thought raciocínio entre ferramentas e fontes de dados.

Modelo de fundação multimodal balanceamento precisão, velocidade e custo para texto, imagens e vídeo em 300K contexto (até ~ 30 minutos de vídeo).

Whisper-1 speech-to-text transcrição treinada em áudio supervisionado multilingue, com um limite de upload de 25 MB por arquivo.

Pesquisa de nível institucional baseada no raciocínio de Claude Opus 4.6, com profundidade máxima, acesso aprimorado a ferramentas e ampla cobertura de fontes.

Modelo de pesquisa para recuperação, síntese e raciocínio em várias etapas, busca, leitura e avaliação autônoma de fontes em tópicos complexos.

Sonar Pro como um pesquisador agente: cadeias de buscas na web, busca páginas completas e fluxos de raciocínio ao vivo, adaptando estratégia para consultas complexas.

Pesquisa web em tempo real com filtragem por domínio, idioma, data e muito mais. Devolve os resultados da pesquisa, não as respostas do LLM; não há envios de ficheiros.

Pesquisa web em tempo real com citações precisas e fontes personalizáveis para up-to-date Integração de pesquisa de IA em aplicativos de produção.

Modelo pesquisado com o dobro das citações e uma janela de contexto maior, sintonizado para consultas complexas que necessitam de respostas aprofundadas e nuances.

Raciocínio de modelo no código aberto sem censura R1-1776 com pesquisa web, superando motores de busca líderes e LLMs no simpleQA benchmark.

Geração de vídeo cinematográfico em modos Texto-Vídeo, Imagem-Vídeo e Transição com alto detalhe, movimento fluido e animações realistas.

Gera vídeos de texto ou imagem de 1-2 imagens de molduras até 1080p, múltiplas proporções de aspecto, 5-10s durações, com áudio sincronizado opcional.

Alibaba CloudSingaporeLançado 3 de mar. de 2026Geração de ImagensModelo unificado de geração e edição de imagens com complexo líder de classe Chinese/English renderização de texto, texturas realistas e fusão multi-imagem.

Alibaba CloudSingaporeLançado 24 de fev. de 2026Ctx 1MGeração de TextoModelo de linguagem de visão com atenção linear híbrida mais MoE esparsa, contexto 1M, e inferência multimodal rápida text/image /video.

Alibaba CloudChinaLançado 24 de fev. de 2026Ctx 1MGeração de TextoModelo de linguagem de visão com atenção linear híbrida mais MoE esparsa, contexto 1M, e inferência multimodal rápida text/image /video.

Alibaba CloudSingaporeLançado 30 de mar. de 2026Ctx 256KGeração de TextoModelo omnimodal custo-eficiente lidar com texto, imagem, áudio e vídeo, com até 3 horas de áudio e 1 hora de vídeo em mais de 90 idiomas.

Alibaba CloudSingaporeLançado 30 de mar. de 2026Ctx 256KGeração de TextoModelo omnimodal Flagship para texto, imagem, áudio e vídeo. 3h áudio, 1h vídeo, 90+ entrada e 30+ linguagens de saída, 55 timbres de voz.

Alibaba CloudSingaporeLançado 16 de fev. de 2026Ctx 1MGeração de TextoModelo multimodal com arquitetura híbrida para um pensamento profundo eficiente e compreensão visual através de texto, imagem e vídeo em um contexto 1M.

Alibaba CloudChinaLançado 16 de fev. de 2026Ctx 1MGeração de TextoModelo multimodal com arquitetura híbrida para um pensamento profundo eficiente e compreensão visual através de texto, imagem e vídeo em um contexto 1M.

Alibaba CloudSingaporeLançado 20 de abr. de 2026Ctx 256KGeração de TextoMaior variante de pré-visualização na série 3.6 (somente texto): execução melhorada do agente de codificação, habilidades front-end mais fortes e conhecimento de cauda longa mais amplo.

Alibaba CloudSingaporeLançado 2 de abr. de 2026Ctx 1MGeração de TextoModelo de linguagem de visão com grandes atualizações acima de 3.5: codificação agente e front-end, reconhecimento multimodal, OCR e localização de objetos.

Alibaba CloudChinaLançado 2 de abr. de 2026Ctx 1MGeração de TextoModelo de linguagem de visão com grandes atualizações acima de 3.5: codificação agente e front-end, reconhecimento multimodal, OCR e localização de objetos.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 256KGeração de Texto256K-context emblemático com grandes melhorias no raciocínio, instrução seguindo, e suporte multilingue, mais maior coding/math precisão.

Alibaba CloudSingaporeLançado 5 de set. de 2025Ctx 256KGeração de TextoLançamento de visualização com grandes ganhos sobre a série 2.5 no entendimento chinês-inglês, instruções complexas, habilidade multilíngue e uso de ferramentas.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 256KGeração de TextoModelo de raciocínio com uso de ferramenta adaptativa (pesquisa, memória, intérprete de código) e escala de tempo de teste para maior precisão em tarefas complexas.

Alibaba CloudSingaporeLançado 5 de jun. de 2025Ctx 4000ReclassificadoresReavaliador de documentos semânticos. Ordena até 500 candidatos por consulta por relevância, suporta mais de 100 idiomas e aceita uma instrução de ordenação personalizada.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo de contexto de 256K codificado com resultados front-end fortes e suporte de programação multilingue para ferramentas e agentes de codificação de IA.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo geral balanceado para cargas de trabalho empresariais de alta frequência: processamento de informações, conteúdo, pesquisa e análise de dados.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo multimodal focado em latência com contexto 256K, quatro modos de esforço de raciocínio e image/video para uso de alta concorrência.

ByteDanceMalaysiaLançado 14 de fev. de 2026Ctx 256KGeração de TextoModelo geral de flagship com contexto 256K para raciocínio complexo, compreensão multimodal, geração estruturada e execução aumentada por ferramentas.

Velocidade otimizada 2.0 variante de vídeo para clipes cinematográficos com sincronização de áudio nativo, controle de câmera e movimento estável a menor custo por renderização.

Modelo de vídeo multimodal para saída cinematográfica de entradas de texto, imagem, áudio ou vídeo, com movimento estável e caracteres consistentes.

ByteDanceMalaysiaLançado 13 de fev. de 2026Geração de ImagensModelo de imagem multimodal unificado que raciocina através de prompts antes da renderização, produzindo edições de alta resolução e consistentes e visuais de marca.

Modelo premium de imagem Seedream para text-to-image detalhados, edições de imagem única e fusão multirreferência com saída 1K e 2K.

Modelo de voz de código aberto para diálogo de podcast multi-falante de forma longa com controle paralinguístico (risos, suspiros) e clonagem de voz de tiro zero.

Gera áudio até 3 minutos das instruções de texto, suportando text-to-audio e audio-to-audio com duração ajustável, etapas e escala CFG.

Up to-3-minute áudio de texto com text-to-audio, audio-to-audio, e inpintura de áudio para produção de música, design de som e remixing.

Vídeo estável Infinity 2.0 Pro na WAN 2.2: estende imagens paradas em vídeo teoricamente infinito, mantendo IDs de caracteres consistentes.

Assistente de pesquisa multipesquisa que explora um tema, analisa fontes e produz um relatório detalhado de pesquisa com citações.

Pesquisa web com rastreamento, extração e mapeamento de URL para recuperação rápida e estruturada em páginas e domínios para pipelines a jusante.

Alibaba CloudSingaporeLançado 4 de jun. de 2025Ctx 8192IncorporaçõesTexto multilingue incorporado com dimensões de saída selecionáveis (64-2048). Até 8.192 tokens por entrada.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 1024IncorporaçõesIncorporação multimodal otimizada por velocidade - da mesma forma que Vision-Plus, 3× mais barato image/video.

Alibaba CloudSingaporeLançado 23 de set. de 2025Ctx 1024IncorporaçõesIncorporação multimodal produzindo vetores independentes para entradas de texto, imagem e vídeo.

Modelo de geração de vídeo multimodal para histórias cinematográficas, multi-shot com sincronização audiovisual nativa (lip-sync, diálogo, música, SFX).

Modelo de vídeo multimodal suportando T2V, I2V, edição de vídeo e reference-to-video, com saída de alta fidelidade de entrada de texto, imagem ou vídeo.

Alibaba CloudSingaporeLançado 1 de abr. de 2026Geração de ImagensModelo companheiro de geração e edição de imagens: text-to-image, edições da caixa-limite e conjuntos de imagens coesas, com até 4K de saída no Pro.
Transcrição controlada Whisper Large v3 Turbo com ASR multilíngue, tradução, VAD, carimbos de tempo, legendas, hotwords e controles de decodificador.

Agente de IA autônomo que transforma um prompt de alto nível em subtarefas, ferramentas de chamadas e APIs e oferece resultados end-to-end sem orquestração manual.

Modelo de imagem para vídeo que anima uma imagem de origem com movimento rápido guiado, até 15 segundos a 480p ou 720p em sete proporções de aspecto.

Modelo de topo para fluxos de trabalho agenticos, engenharia complexa de software e tarefas de longo horizonte, sustentando o trabalho em mais de 1000 chamadas de ferramentas no contexto de 1M.

Modelo multimodal com compreensão visual e áudio nativo em um contexto de 1M, projetado para raciocinar e agir através de modalidades em fluxos de trabalho agentes.

Alibaba CloudSingaporeLançado 22 de jun. de 2026Geração de VídeoTexto, imagem e reference-to-video em um único modelo. Movimento cinematográfico, consistência dos personagens em até 9 referências e áudio nativo sincronizado.

O nível Seedance 2.0 mais rápido e acessível para clipes curtos de cinema, com áudio nativo, controle de câmera e entradas de imagem ou vídeo em 480p e 720p.

StepFunInternationalLançado 28 de mai. de 2026Ctx 256KGeração de TextoModelo de raciocínio multimodal StepFun com entrada de imagem e vídeo, chamada de ferramenta, esforço de raciocínio ajustável e contexto 256K.

StepFunInternationalLançado 12 de fev. de 2026Ctx 256KGeração de TextoModelo de raciocínio textual StepFun para agentes, codificação, chamada de ferramentas e análise de contexto longo.

StepFunInternationalLançado 2 de abr. de 2026Ctx 256KGeração de TextoVariante Flash Step 3.5 otimizada para agente com modos de esforço de raciocínio baixo e alto.

Modelo de conversa de áudio e texto StepFun com saída de texto e compreensão paralinguística.

StepFunInternationalLançado 29 de abr. de 2026Geração de ImagensModelo de geração e edição de imagens StepFun para edições text-to-image e de imagem única.

StepFunInternationalLançado 21 de abr. de 2026Geração de ÁudioModelo contextual StepFun text-to-speech com direção de voz em linguagem natural e entrega expressiva.

StepFun text-to-speech modelo com vozes oficiais, vozes clonadas personalizadas e controles de tag de voz.

Modelo de reconhecimento de fala em streaming StepFun para transcrição de áudio em chinês e inglês.

ByteDanceMalaysiaLançado 13 de jul. de 2026Ctx 256KGeração de TextoNext-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Alibaba CloudSingaporeLançado 20 de jul. de 2026Geração de ÁudioTiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 Modelos