
Trilhas sonoras sincronizadas por quadro geradas diretamente de vídeo, ou músicas a partir de um prompt de texto, com direção por segmento e separação de hastes.
Trilhas sonoras sincronizadas por quadro geradas diretamente de vídeo, ou músicas a partir de um prompt de texto, com direção por segmento e separação de hastes.
sonilo-v1-1/v1/audio/generationssonilo-v1.1sonilo/v1.1sonilo-musicsonilo/sonilo-v1-1Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Sonilo v1.1 roda por POST /v1/audio/generations. A requisição retorna um job_id na hora; consulte GET /v1/jobs/{job_id} até o job terminar e leia as URLs de saída do resultado. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "sonilo-v1-1",
"prompt": "Describe what you want Sonilo v1.1 to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "sonilo-v1-1",
"prompt": "Describe what you want Sonilo v1.1 to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Parâmetros de requisição suportados pela API Sonilo v1.1 na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| prompt | string | - | - | Estilo ou direção criativa para a música. Exigido ao gerar apenas a partir do texto. Opcional ao compor um vídeo, onde a filmagem lidera. |
| mode | enum | auto | auto, text, video | Grava automaticamente um vídeo anexado e volta para texto para música quando não há vídeo. Defina texto ou vídeo para fixar o comportamento. |
| duration | number | - | 5 a 360 | Duração da faixa em segundos. Modo texto apenas. No modo vídeo, a faixa segue o comprimento do vídeo original. Deixe vazio para deixar o prompt decidir. |
| output_format | enum | m4a | m4a, wav, mp3 | Formato de áudio entregue. M4A é AAC, WAV é PCM de 16 bits, MP3 é 320 kbps. |
| variants_num | number | 1 | 1 a 10 | Quantas direções musicais distintas gerar em uma única solicitação. Cada variante é faturada separadamente à taxa por segundo, e o mínimo de 10 segundos se aplica a... |
| stems | boolean | false | - | Também retorne a faixa gerada dividida em bateria, baixo, vocais e outros. Não adiciona carga e adiciona alguns minutos à espera. |
| ducking | boolean | false | - | Também devolve uma tomada com a música inserida sob a fala no vídeo original para que o diálogo fique inteligível. Não adiciona nenhuma carga. |
| preserve_speech | boolean | false | - | Mantenha a fala do vídeo original e retorne a voz isolada mais uma faixa mixada junto com a música. |
| prompt_influence | number | 0.5 | 0 a 1 | Quão fortemente a música segue o prompt em vez das imagens. Quanto mais baixo deixa o vídeo liderar, mais alto segue o prompt de forma mais literal. Não adiciona carga. |
| segments | string | - | - | Array JSON de prompts de segmento cronometrado para direção cena a cena. Cada entrada recebe início, fim e prompt em segundos. |
| video_url | string | - | - | Vídeo de origem para pontuação, como uma URL publicamente acessível. Até 300MB e 6 minutos. Enviar um vídeo no playground resolve isso para você. |
Modos - pontuação automática do vídeo anexado e retorna para texto para música quando não há vídeo - Modo vídeo segue os cortes e o ritmo da filmagem original - Modo texto gerado apenas a partir de um prompt Controles Suporta prompt, modo, vídeo de origem, duração de 5 a 360 segundos no modo texto, m4a, wav ou mp3, 1 a 10 variantes, separação de stem, ducking, preservação de fala, influência de prompt e prompts de segmento JSON. Limits - Vídeo fonte de até 300MB e 6 minutos - Duração de 5 a 360 segundos no modo texto. Modo vídeo segue o comprimento da fonte - Ducking, preservação de fala e influência de prompt aplicam-se apenas ao modo vídeo Faturamento - Cobrado por segundo gerado na taxa de catálogo, com mínimo de 10 segundos por faixa. Uma faixa de 4 segundos cobra 10 segundos. - Cada variante é faturada separadamente e o mínimo de 10 segundos se aplica a cada uma. - Separação do caule, ducking e influência rápida não adicionam cobrança. - Um pedido rejeitado antes da geração não é faturado.
Na EmpirioLabs, Sonilo v1.1 é cobrado por uso: De texto para música $0.0045 por segundo gerado; Vídeo para música $0.018 por segundo gerado. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Sonilo v1.1 é servido por POST /v1/audio/generations em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa Sonilo v1.1 no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.