
StepFun Streaming-Spracherkennungsmodell für chinesische und englische Audiotranskription.
StepFun Streaming-Spracherkennungsmodell für chinesische und englische Audiotranskription.
EmpirioLabs gibt das Standard-/v1/audio/transcriptions-Endpunkt frei und liefert das endgültige Transkript im normalen Transkriptionsantwortformat.
Auch bekannt als StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asrLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
StepAudio 2.5 ASR läuft über POST /v1/audio/transcriptions. Der Request liefert sofort eine job_id; frage GET /v1/jobs/{job_id} ab, bis der Job abgeschlossen ist, und lies die Ausgabe-URLs aus dem Ergebnis. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Request-Parameter, die die StepAudio 2.5 ASR API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| file | audio | - | - | Audiodatei-Upload zur Transkription. |
| file_url | string | - | - | Öffentliche URL zu einer Audiodatei. |
| audio_base64 | string | - | - | Base64-Audionutzlast für JSON-Anfragen. |
| language | enum | en | en, zh | Erkennungssprache. |
| hotwords | array | - | - | Optionale Hotword-Liste. |
| enable_itn | boolean | true | - | Inverse Textnormalisierung aktivieren. |
| enable_timestamp | boolean | false | - | Geben Sie Zeitstempelfelder aus StepFun SSE-Events zurück, wenn verfügbar. |
| format | enum | wav | wav, mp3, ogg, pcm | Audio-Container-Format. |
| codec | string | - | - | PCM-Codec wie pcm_s16le. |
| rate | integer | 16000 | 8000 bis 48000 | PCM-Abtastrate in Hz. |
| bits | integer | 16 | 8 bis 32 | PCM-Bittiefe. |
| channel | integer | 1 | 1 bis 8 | PCM-Kanalanzahl. |
Unterstützt WAV, mp3, OGG und PCM-Eingang. PCM-Anfragen sollten Codec, Abtastrate, Bittiefe und Kanalanzahl enthalten. Erkennungssprache unterstützt Chinesisch und Englisch. Zeitstempelausgaben sind über enable_timestamp verfügbar.
Auf EmpirioLabs wird StepAudio 2.5 ASR nach Verbrauch abgerechnet: Transkription $0.022 pro Stunde Audio. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
StepAudio 2.5 ASR wird über POST /v1/audio/transcriptions auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt StepAudio 2.5 ASR im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.