Zuhause Blog

Wie man Qwen Audio 3.1 ASR, ASR-Stream und ASR-Nachricht verwendet

Qwen Audio 3.1 ASR, ASR-Stream und ASR-Nachricht über API

Sep 24, 2026

EmpirioLabs AI

Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream und Qwen Audio 3.1 ASR Message sind auf EmpirioLabs verfügbar. ASR transkribiert aufgenommene Audiodateien durch POST /v1/audio/transcriptions. ASR-Stream und ASR-Nachricht transkribieren Live-Audio über wss://api.empiriolabs.ai/v1/realtime. Alle drei funktionieren sowohl in der API als auch im Playground.

Die drei Modelle

  • qwen-audio-3-1-asr transkribiert kurze Ausschnitte und lange Aufnahmen und gibt das Transkript mit Satzsegmenten und Wortzeitstempeln zurück. Die Sprache wird automatisch erkannt, einschließlich chinesischer Dialekte.
  • qwen-audio-3-1-asr-stream ist für Live-Untertitel gebaut. Es sendet den Satz bis hierher, während der Sprecher spricht, und dann den festgelegten Satz bei jeder Pause.
  • qwen-audio-3-1-asr-message ist für Sprachnachrichten und Spracheingaben konzipiert. Jede Äußerung wird als vollständiges Transkript zurückgegeben, sobald der Sprecher pausiert, ohne Teilwirkung.

Transkribieren einer Aufnahme

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3

Ein JSON-Körper mit audio_url oder audio_base64 Funktioniert anstelle des Dateihochladens. Die Antwort lautet ein Job:

{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "status": "processing", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }

Befrage den Job, bis Status ist abgeschlossen:

curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY"

Das Transkript ist in result.text, mit Satzsegmenten in Ergebnis. Segmente und Wortzeitstempel in Ergebnis.Wörter. Kurze Clips sind in Sekunden fertig; lange Aufnahmen dauern länger.

Live-Transkription über einen WebSocket

Öffnen Sie den Echtzeit-Endpunkt mit dem Modell in der Abfrage-String und Ihrem API-Schlüssel beim Handshake:

wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream Autorisierung: Inhaber YOUR_EMPIRIOLABS_API_KEY

Streame 16 kHz, 16-Bit-Mono-PCM-Audio als Base64 in input_audio_buffer.append Ereignisse. Es gibt kein Commit to Send: Das Modell erkennt, wo jeder Satz endet, basierend auf der darauf folgenden Pause.

{"type": "input_audio_buffer.append", "audio": "<base64 PCM>"}

Transkripte kommen als Ereignisse ein:

  • Teilweise Ergebnisse. conversation.item.input_audio_transcription.delta trägt das Urteil bisher in Text während der Sprecher noch spricht. Nur ASR-Stream.
  • Festgelegte Ergebnisse. conversation.item.input_audio_transcription.completed trägt den fertigen Satz oder die Äußerung in Transkript. Beide Modelle.

Betriebshinweise

  1. Jede Transkriptionsanfrage bringt einen Job zurück, selbst einen kurzen Clip. Die erste Antwort trägt ein job id, nicht das Transkript. Lesen Sie result.text von LOS /v1/jobs/<job_id> Einmal Status ist abgeschlossen.
  2. Anzeige Text von jedem Teilereignis statt des Joins Delta Werte. Im ASR Stream, Text ist bisher immer der ganze Satz, daher bleibt das Ersetzen der angezeigten Zeile bei jedem Ereignis korrekt für die Live-Unterschriften.
  3. ASR-Nachricht ist still, bis der Sprecher pausiert. Es sendet keine teilweisen Ergebnisse, sodass keine Ereignisse ankommen, während jemand spricht. Nutze ASR Stream für Live-Untertitel.
  4. Streame einen Moment der Stille nach den letzten Worten. Ein Satz beruhigt sich, wenn das Modell hört, dass der Sprecher stoppt. Senden Sie nach den letzten Worten weiterhin kurz Audio und warten Sie auf das abgeschlossen Ereignis vor dem Schließen des Sockets, oder der letzte Satz geht verloren.

Preisgestaltung

Alle drei Modelle sind Pay-as-you-go, ohne Abonnement. Jedes ist pro Token bepreist, mit einer Rate für den Audioeingang und einer für die Transkriptausgabe, und es gibt keine zwischengespeicherte Eingangsebene. ASR berechnet jede Anfrage; ASR Stream und ASR Message rechnen jeden fertigen Satz oder jede Äußerung ab. Die Live-Modelle haben höhere Raten als ASR, daher verwenden Sie ASR für Aufnahmen, die keine Ergebnisse benötigen, während der Sprecher spricht. Aktuelle Tarife sind auf den Modellseiten für Qwen Audio 3.1 ASR, ASR-Strom und ASR-Nachricht, und auf der preisseite.

Beginnen Sie mit dem Bau

Versuch es mal Qwen Audio 3.1 ASR in der Playground durch das Hochladen einer Aufnahme, oder ASR-Strom und ASR-Nachricht indem Sie auf Sitzung starten klicken und sprechen. Die API-Referenz für jedes Modell ist bei ASR, ASR-Strom und ASR-Nachricht, und die vollständigen Ereignistabellen sind in der Echtzeit-Sprach-API Führer.

Für Sprachgespräche aus derselben Familie siehe Wie man Qwen3.8 Omni Flash Realtime und Qwen Audio 3.1 verwendet.

Offenlegung: Dieser Artikel wurde mit KI-Unterstützung geschrieben und von EmpirioLabs AI überprüft.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.