StepFunは中国語と英語の音声書き起こしのためのストリーミング音声認識モデルです。
EmpirioLabs標準/v1/audio/transcriptionsエンドポイントを公開し、最終的な転写本を通常の転写応答形式で返します。
別名 StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asrEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
StepAudio 2.5 ASR は POST /v1/audio/transcriptions で動作します。リクエストはすぐに job_id を返すので、ジョブが完了するまで GET /v1/jobs/{job_id} をポーリングし、結果から出力 URL を読み取ってください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs 上の StepAudio 2.5 ASR API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| file | audio | - | - | 音声ファイルのアップロードで文字起こし。 |
| file_url | string | - | - | 音声ファイルの公開URL。 |
| audio_base64 | string | - | - | JSONリクエスト用のBase64オーディオペイロード。 |
| language | enum | en | en, zh | 認識言語。 |
| hotwords | array | - | - | オプションのホットワードリスト。 |
| enable_itn | boolean | true | - | 逆テキスト正規化を有効にしてください。 |
| enable_timestamp | boolean | false | - | 利用可能な場合は、StepFun SSEイベントのタイムスタンプフィールドを返してください。 |
| format | enum | wav | wav, mp3, ogg, pcm | オーディオコンテナ形式。 |
| codec | string | - | - | pcm_s16leのようなPCMコーデック。 |
| rate | integer | 16000 | 8000 から 48000 | PCMのサンプルレートはHzです。 |
| bits | integer | 16 | 8 から 32 | PCMビット深度。 |
| channel | integer | 1 | 1 から 8 | PCMチャンネル数。 |
wav、mp3、ogg、pcm入力に対応しています。PCMリクエストにはコーデック、サンプルレート、ビット深度、チャネル数を含める必要があります。認識言語は中国語と英語に対応しています。タイムスタンプ出力はenable_timestampを通じて利用可能です。
EmpirioLabs では StepAudio 2.5 ASR は従量課金です: コンテンツ $0.022 音声の時間あたり。このページのライブ料金表は常に API の請求額と一致します。
StepAudio 2.5 ASR は api.empiriolabs.ai 上の POST /v1/audio/transcriptions で提供され、標準的な Bearer トークン認証を使用します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで StepAudio 2.5 ASR をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。