
Modelo de reconhecimento de fala em streaming StepFun para transcrição de áudio em chinês e inglês.
Modelo de reconhecimento de fala em streaming StepFun para transcrição de áudio em chinês e inglês.
EmpirioLabs expõe o ponto final padrão /v1/audio/transcriptions e retorna a transcrição final no formato normal de resposta de transcrição.
Também conhecido como StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asrTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
StepAudio 2.5 ASR roda por POST /v1/audio/transcriptions. A requisição retorna um job_id na hora; consulte GET /v1/jobs/{job_id} até o job terminar e leia as URLs de saída do resultado. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Parâmetros de requisição suportados pela API StepAudio 2.5 ASR na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| file | audio | - | - | Upload do arquivo de áudio para transcrição. |
| file_url | string | - | - | URL pública para um arquivo de áudio. |
| audio_base64 | string | - | - | Carga útil de áudio Base64 para requisições JSON. |
| language | enum | en | en, zh | Linguagem de reconhecimento. |
| hotwords | array | - | - | Lista opcional de hotword. |
| enable_itn | boolean | true | - | Ative a normalização de texto inverso. |
| enable_timestamp | boolean | false | - | Devolva campos de carimbo de tempo dos eventos StepFun SSE quando disponíveis. |
| format | enum | wav | wav, mp3, ogg, pcm | Formato de contêiner de áudio. |
| codec | string | - | - | Codec PCM como pcm_s16le. |
| rate | integer | 16000 | 8000 a 48000 | Taxa de amostragem PCM em Hz. |
| bits | integer | 16 | 8 a 32 | Profundidade de bits PCM. |
| channel | integer | 1 | 1 a 8 | Contagem de canais PCM. |
Suporta entrada wav, mp3, ogg e pcm. As requisições PCM devem incluir codec, taxa de amostragem, profundidade de bits e contagem de canais. A linguagem de reconhecimento suporta chinês e inglês. A saída de timestamp está disponível por meio de enable_timestamp.
Na EmpirioLabs, StepAudio 2.5 ASR é cobrado por uso: Transcrição $0.022 por hora de áudio. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
StepAudio 2.5 ASR é servido por POST /v1/audio/transcriptions em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa StepAudio 2.5 ASR no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.