
Transcrição consciente do contexto para nomes próprios, termos técnicos, dialetos e áudios difíceis incluindo sussurros, fala rápida e canto.
Transcrição consciente do contexto para nomes próprios, termos técnicos, dialetos e áudios difíceis incluindo sussurros, fala rápida e canto.
EmpirioLabs expõe o ponto final padrão /v1/audio/transcriptions e retorna a transcrição final no formato normal de resposta de transcrição.
Também conhecido como StepFun StepAudio 3 ASR Max
stepaudio-3-asr-max/v1/audio/transcriptionsstepfun/stepaudio-3-asr-maxTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
StepAudio 3 ASR Max roda por POST /v1/audio/transcriptions. A requisição retorna um job_id na hora; consulte GET /v1/jobs/{job_id} até o job terminar e leia as URLs de saída do resultado. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Parâmetros de requisição suportados pela API StepAudio 3 ASR Max na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| file | string | - | - | Upload do arquivo de áudio para transcrição. |
| file_url | string | - | - | URL pública para um arquivo de áudio. |
| audio_base64 | string | - | - | Carga útil de áudio Base64 para requisições JSON. |
| enable_itn | boolean | true | - | Ative a normalização de texto inverso, que escreve números, datas e moeda em sua forma escrita. |
| format | enum | wav | wav, mp3, ogg, m4a, pcm | Formato de contêiner de áudio. |
| codec | string | - | - | Codec PCM como pcm_s16le. |
| rate | number | - | - | Taxa de amostragem PCM em Hz. |
| bits | number | - | - | Profundidade de bits PCM. |
| channel | number | - | - | Contagem de canais PCM. |
Suporta entrada wav, mp3, ogg, m4a e pcm. As requisições PCM devem incluir codec, taxa de amostragem, profundidade de bits e contagem de canais. O idioma é detectado automaticamente e não pode ser configurado; Chinês, inglês, japonês, coreano, francês e espanhol são reconhecidos, com outros idiomas além do chinês e inglês em prévia. A normalização de texto inverso está ativada por padrão e pode ser desativada com enable_itn. Hotwords e carimbos de data de data de palavra não estão disponíveis neste modelo. O áudio é cobrado pela duração medida, com um mínimo de um segundo.
Na EmpirioLabs, StepAudio 3 ASR Max é cobrado por uso: Transcrição $0.24 por hora de áudio. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
StepAudio 3 ASR Max é servido por POST /v1/audio/transcriptions em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa StepAudio 3 ASR Max no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.