
Live-Transkription über eine Fassung, Teilwörter streamen, während der Sprecher spricht, und bei jeder Pause ein festgelegter Satz, Preis pro Token.
Live-Transkription über eine Fassung, Teilwörter streamen, während der Sprecher spricht, und bei jeder Pause ein festgelegter Satz, Preis pro Token.
Streamen Sie 16 kHz PCM16-Audio über die Buchse. Teilweise erhalten Sie, während der Lautsprecher spricht.
Auch bekannt als Qwen Audio ASR Stream, Alibaba Cloud Qwen Audio 3.1 ASR Stream
qwen-audio-3-1-asr-stream/v1/realtimeqwen-audio-3.1-asr-streamalibaba/qwen-audio-3-1-asr-streamLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Qwen Audio 3.1 ASR Stream transkribiert einen Live-Audiostream über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID qwen-audio-3-1-asr-stream und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Hängen Sie base64-kodiertes 16-Bit-PCM-Audio an und lesen Sie die Transkript-Events, während noch gesprochen wird. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())Request-Parameter, die die Qwen Audio 3.1 ASR Stream API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Codierung des Audios, das du dem Eingangspuffer anhängst: base64 16-Bit-PCM, Mono, bei 16 kHz. |
Verbindung Live-Transkription über einen WebSocket bei wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, authentifiziert mit dem gewöhnlichen Authorization Bearer-Header. Audio-Senden Streamen Sie 16 kHz Mono PCM16-Audio mit input_audio_buffer.append. Die Spracherkennung entscheidet, wo jeder Satz endet, sodass kein Commit gesendet werden kann. Was zurückkommt conversation.item.input_audio_transcription.delta Ereignissen trägt den Satz bis hierher, während der Sprecher noch spricht, und conversation.item.input_audio_transcription.completed trägt den festgelegten Satz bei jeder Pause. Abrechnung Ein- und Ausgabetoken werden pro 1 Million berechnet, und jeder abgeschlossene Satz wird eigenständig aus der vom Modell angegebenen Nutzung berechnet.
Auf EmpirioLabs wird Qwen Audio 3.1 ASR Stream nach Verbrauch abgerechnet: Eingabe $1.86 pro 1M Audio-Eingangstoken; Output $1.40 pro 1 Million generierter Token. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Qwen Audio 3.1 ASR Stream wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Qwen Audio 3.1 ASR Stream läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID qwen-audio-3-1-asr-stream und streamen Sie dann Audio in beide Richtungen.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.