O TTS 2 Flash está disponível no EmpirioLabs. A Inworld lançou a família Realtime TTS-2 para disponibilidade geral, e o Flash é o membro que prioriza a latência. Ele possui uma identidade vocal única em 200+ idiomas e locais, transmite áudio enquanto sintetiza e pode retornar carimbos de tempo por palavra ou por caractere. O Realtime TTS-2, o modelo de qualidade da mesma família, está disponível na plataforma junto com ele.
O que o TTS 2 Flash suporta
Flash recebe texto e retorna áudio. Ele cobre 200+ idiomas e locais com uma identidade de voz, então o mesmo ID de voz mantém seu caráter quando você troca de idioma, incluindo trocar no meio de uma geração. A saída retorna como MP3, WAV, OGG, FLAC, PCM, A-LAW ou mu-law em taxas de amostragem de 8 kHz a 48 kHz.
O menu suspenso de voz mostra 20 presets selecionados a dedo. Essa é uma lista de conveniência, não o catálogo: passe qualquer outro ID de voz, incluindo vozes regionais e clonadas, por voice_id, e chame o endpoint de vozes para enumerar o que está disponível.
Como chamar o Flash do TTS 2
Use o endpoint de fala compatível com OpenAI e configure modelo para tts-2-flash:
curl https://api.empiriolabs.ai/v1/audio/speech \ -H 'Autorização: Portador $EMPIRIOLABS_API_KEY' \ -H 'Tipo-de-Conteúdo: application/json' \ -d '{ "modelo": "tts-2-flash", "entrada": "Alô, e obrigado por ligar. Como posso ajudar hoje?", "voz": "Ashley", "idioma": "en-US", "output_format": "MP3" }'
A resposta carrega uma URL assinada para o áudio gerado, além de um bloco de uso com a contagem de caracteres que foi faturada. A cobrança é por caractere de entrada, então o custo acompanha o texto que você envia em vez do comprimento do áudio que retorna.
Streaming
Para agentes de voz e qualquer coisa que reproduza áudio enquanto ainda está sendo produzido, poste na variante de streaming do mesmo endpoint. Ele retorna Eventos Enviados pelo Servidor: audio.chunk Eventos transmitindo áudio base64 como sintetizado, opcional carimbos de áudio.timestamps eventos em que você pediu palavra ou tempo de caractere, e um final audio.done evento com URL de replay e o bloco de uso. Definir timestamp_type para PALAVRA ou PERSONAGEM quando você está dirigindo legendas ou uma interface de destaque.
Escolhendo entre TTS 2 e TTS 2 Flash
Ambos os modelos compartilham a mesma forma de requisição, as mesmas vozes e a mesma cobertura de idioma, então a troca é uma mudança de uma palavra para modelo. A diferença que importa na hora de escolher é o controle de entrega.
O TTS-2 em tempo real aceita instruções de voz em inglês simples: abra o texto com uma instrução colcheada e o modelo executa a linha dessa forma, em vez de ler a instrução em voz alta. Ele entende tanto diretivas curtas quanto briefs livres.
{ "modelo": "tts-2", "entrada": "[Fale calorosamente, como se estivesse cumprimentando um velho amigo] Bom dia, é bom te ver de novo.", "voz": "Ashley" }
TTS 2 Flash não aplica essa direção. Envie o mesmo texto colcheado para Flash e ele é ignorado, então busque TTS 2 quando o desempenho importa e para Flash quando latência e volume importam. No Flash, entrega de forma com o Velocidade e temperatura controles em vez disso.
Notas que valem a pena saber antes da sua primeira ligação
- A direção de voz é apenas TTS 2. O Flash ignora silenciosamente uma diretiva com colchetes em vez de rejeitá-la, então um prompt escrito para TTS 2 roda no Flash e simplesmente retorna sem direcionamento.
- O texto de direção é faturado. A instrução em colchete conta para o total de caracteres do pedido, mesmo que nunca seja dito, então mantenha os resumos curtos.
- O limite por requisição é de 2.000 caracteres. Faça um corte mais longo nos limites das frases no cliente e concatene o áudio, em vez de enviar um bloco longo.
- A normalização de texto está ativada por padrão. Números, datas e abreviações são expandidos para a forma falada, o que também significa que a contagem de caracteres faturados pode exceder o comprimento da sequência que você enviou. Desligue se você já normalizou o texto por conta própria.
Começar
Tente o TTS 2 Flash no Área de reprodução, ler Referência de API, ou veja as taxas atuais na página do modelo.



