
Sprach-zu-Text für kurze Clips und lange Aufnahmen, mit Satzabschnitten, Wortzeitstempeln sowie mehrsprachiger und chinesischer Dialekterkennung.
Sprach-zu-Text für kurze Clips und lange Aufnahmen, mit Satzabschnitten, Wortzeitstempeln sowie mehrsprachiger und chinesischer Dialekterkennung.
Eine Datei hochladen oder eine Audio-URL weitergeben. Die Sprache wird automatisch erkannt.
Auch bekannt als Qwen Audio ASR, Alibaba Cloud Qwen Audio 3.1 ASR
qwen-audio-3-1-asr/v1/audio/transcriptionsqwen-audio-3.1-asralibaba/qwen-audio-3-1-asrLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Qwen Audio 3.1 ASR läuft über POST /v1/audio/transcriptions. Der Request liefert sofort eine job_id; frage GET /v1/jobs/{job_id} ab, bis der Job abgeschlossen ist, und lies die Ausgabe-URLs aus dem Ergebnis. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-1-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "qwen-audio-3-1-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Audio senden Senden Sie eine Datei als mehrteilige file oder JSON mit audio_url oder audio_base64 in gängigen Audioformaten. Kurze und lange Aufnahmen werden beide akzeptiert. Das Ergebnis erhalten Die Anfrage liefert sofort ein job_id und ein poll_url zurück. Abfrage GET /v1/jobs/<job-id>, bis status completed ist. Kurze Clips sind in Sekunden fertig; lange Aufnahmen dauern länger. Was zurückkommt Die result der abgeschlossenen Aufgabe enthält das vollständige Transkript als text, Satzabschnitte mit Start- und Endzeiten sowie Wortzeitstempel. Die Sprache wird automatisch erkannt, einschließlich chinesischer Dialekte. Abrechnung Eingabe- und Ausgabetoken werden pro 1 Million bepreist, und jede Anfrage wird von der vom Modell angegebenen Nutzung abgerechnet.
Auf EmpirioLabs wird Qwen Audio 3.1 ASR nach Verbrauch abgerechnet: Eingabe $0.30 pro 1M Audio-Eingangstoken; Output $0.94 pro 1 Million generierter Token. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Qwen Audio 3.1 ASR wird über POST /v1/audio/transcriptions auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt Qwen Audio 3.1 ASR im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.