Casa Blog

Como Usar a API Flash do TTS 2

Como Usar a API Flash do TTS 2

Sep 4, 2026

EmpirioLabs AI

O TTS 2 Flash está disponível no EmpirioLabs. A Inworld lançou a família Realtime TTS-2 para disponibilidade geral, e o Flash é o membro que prioriza a latência. Ele possui uma identidade vocal única em 200+ idiomas e locais, transmite áudio enquanto sintetiza e pode retornar carimbos de tempo por palavra ou por caractere. O Realtime TTS-2, o modelo de qualidade da mesma família, está disponível na plataforma junto com ele.

O que o TTS 2 Flash suporta

Flash recebe texto e retorna áudio. Ele cobre 200+ idiomas e locais com uma identidade de voz, então o mesmo ID de voz mantém seu caráter quando você troca de idioma, incluindo trocar no meio de uma geração. A saída retorna como MP3, WAV, OGG, FLAC, PCM, A-LAW ou mu-law em taxas de amostragem de 8 kHz a 48 kHz.

O menu suspenso de voz mostra 20 presets selecionados a dedo. Essa é uma lista de conveniência, não o catálogo: passe qualquer outro ID de voz, incluindo vozes regionais e clonadas, por voice_id, e chame o endpoint de vozes para enumerar o que está disponível.

Como chamar o Flash do TTS 2

Use o endpoint de fala compatível com OpenAI e configure modelo para tts-2-flash:

curl https://api.empiriolabs.ai/v1/audio/speech \ -H 'Autorização: Portador $EMPIRIOLABS_API_KEY' \ -H 'Tipo-de-Conteúdo: application/json' \ -d '{ "modelo": "tts-2-flash", "entrada": "Alô, e obrigado por ligar. Como posso ajudar hoje?", "voz": "Ashley", "idioma": "en-US", "output_format": "MP3" }'

A resposta carrega uma URL assinada para o áudio gerado, além de um bloco de uso com a contagem de caracteres que foi faturada. A cobrança é por caractere de entrada, então o custo acompanha o texto que você envia em vez do comprimento do áudio que retorna.

Streaming

Para agentes de voz e qualquer coisa que reproduza áudio enquanto ainda está sendo produzido, poste na variante de streaming do mesmo endpoint. Ele retorna Eventos Enviados pelo Servidor: audio.chunk Eventos transmitindo áudio base64 como sintetizado, opcional carimbos de áudio.timestamps eventos em que você pediu palavra ou tempo de caractere, e um final audio.done evento com URL de replay e o bloco de uso. Definir timestamp_type para PALAVRA ou PERSONAGEM quando você está dirigindo legendas ou uma interface de destaque.

Escolhendo entre TTS 2 e TTS 2 Flash

Ambos os modelos compartilham a mesma forma de requisição, as mesmas vozes e a mesma cobertura de idioma, então a troca é uma mudança de uma palavra para modelo. A diferença que importa na hora de escolher é o controle de entrega.

O TTS-2 em tempo real aceita instruções de voz em inglês simples: abra o texto com uma instrução colcheada e o modelo executa a linha dessa forma, em vez de ler a instrução em voz alta. Ele entende tanto diretivas curtas quanto briefs livres.

{ "modelo": "tts-2", "entrada": "[Fale calorosamente, como se estivesse cumprimentando um velho amigo] Bom dia, é bom te ver de novo.", "voz": "Ashley" }

TTS 2 Flash não aplica essa direção. Envie o mesmo texto colcheado para Flash e ele é ignorado, então busque TTS 2 quando o desempenho importa e para Flash quando latência e volume importam. No Flash, entrega de forma com o Velocidade e temperatura controles em vez disso.

Notas que valem a pena saber antes da sua primeira ligação

  • A direção de voz é apenas TTS 2. O Flash ignora silenciosamente uma diretiva com colchetes em vez de rejeitá-la, então um prompt escrito para TTS 2 roda no Flash e simplesmente retorna sem direcionamento.
  • O texto de direção é faturado. A instrução em colchete conta para o total de caracteres do pedido, mesmo que nunca seja dito, então mantenha os resumos curtos.
  • O limite por requisição é de 2.000 caracteres. Faça um corte mais longo nos limites das frases no cliente e concatene o áudio, em vez de enviar um bloco longo.
  • A normalização de texto está ativada por padrão. Números, datas e abreviações são expandidos para a forma falada, o que também significa que a contagem de caracteres faturados pode exceder o comprimento da sequência que você enviou. Desligue se você já normalizou o texto por conta própria.

Começar

Tente o TTS 2 Flash no Área de reprodução, ler Referência de API, ou veja as taxas atuais na página do modelo.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.