StepFun 流式语音识别模型,用于中英音频转录。
EmpirioLabs暴露标准/v1/audio/transcriptions终点,并以正常转录响应格式返回最终转录本。
也称为 StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asr来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
StepAudio 2.5 ASR 通过 POST /v1/audio/transcriptions 运行。请求会立即返回 job_id;轮询 GET /v1/jobs/{job_id} 直到任务完成,再从结果中读取输出 URL。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs 上 StepAudio 2.5 ASR API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| file | audio | - | - | 上传音频文件用于转录。 |
| file_url | string | - | - | 音频文件的公共网址。 |
| audio_base64 | string | - | - | 用于JSON请求的Base64音频负载。 |
| language | enum | en | en, zh | 识别语言。 |
| hotwords | array | - | - | 可选热词列表。 |
| enable_itn | boolean | true | - | 启用反文本归一化。 |
| enable_timestamp | boolean | false | - | 在有时间戳字段时,请返回 StepFun SSE 活动中的字段。 |
| format | enum | wav | wav, mp3, ogg, pcm | 音频容器格式。 |
| codec | string | - | - | PCM编解码器,比如pcm_s16le。 |
| rate | integer | 16000 | 8000 到 48000 | PCM采样率以Hz为单位。 |
| bits | integer | 16 | 8 到 32 | PCM位深。 |
| channel | integer | 1 | 1 到 8 | PCM信道数。 |
支持wav、mp3、ogg和PCM输入。PCM请求应包括编解码器、采样率、位深和通道数。识别语言支持中文和英语。时间戳输出可通过enable_timestamp获取。
在 EmpirioLabs,StepAudio 2.5 ASR 按量计费:译名 $0.022 每小时音频。本页的实时价格表始终与 API 的实际计费一致。
StepAudio 2.5 ASR 通过 api.empiriolabs.ai 上的 POST /v1/audio/transcriptions 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 StepAudio 2.5 ASR,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。