Qwen Audio 3.1 ASR Message API

Die Transkription wurde auf Sprachnachrichten und Spracheingaben über eine Buchse abgestimmt, wobei jede Äußerung als vollständiges Transkript zurückgegeben wurde, wenn der Sprecher pausierte.

Alibaba CloudTranskriptionVeröffentlicht 21. Sept. 2026SingaporeProprietärer EndpointNeu

Über Qwen Audio 3.1 ASR Message

Die Transkription wurde auf Sprachnachrichten und Spracheingaben über eine Buchse abgestimmt, wobei jede Äußerung als vollständiges Transkript zurückgegeben wurde, wenn der Sprecher pausierte.

Streamen Sie 16 kHz pcm16-Audio über die Buchse. Jede Äußerung wird vollständig zurückgegeben, wenn der Lautsprecher pausiert.

Auch bekannt als Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message

transcriptionspeech to textrealtimemultilingual

Qwen Audio 3.1 ASR Message Spezifikationen

Modell-ID
qwen-audio-3-1-asr-message
Autor
Alibaba Cloud
Kategorie
Transkription
Veröffentlicht
21. Sept. 2026
Eingabe
Audio
Ausgabe
Text
Region
Singapore
Endpoints
WEBSOCKET/v1/realtime
Alternative Modell-IDs
qwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-message

Qwen Audio 3.1 ASR Message API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M Audio-Eingangstoken
$1.86
Ausgabe
pro 1 Million generierter Token
$1.40
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen Audio 3.1 ASR Message API auf

Qwen Audio 3.1 ASR Message transkribiert einen Live-Audiostream über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID qwen-audio-3-1-asr-message und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Hängen Sie base64-kodiertes 16-Bit-PCM-Audio an und lesen Sie die Transkript-Events, während noch gesprochen wird. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Vollständige Qwen Audio 3.1 ASR Message API-Referenz

Qwen Audio 3.1 ASR Message API-Parameter

Request-Parameter, die die Qwen Audio 3.1 ASR Message API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
input_audio_formatenumpcm16pcm16Codierung des Audios, das du dem Eingangspuffer anhängst: base64 16-Bit-PCM, Mono, bei 16 kHz.

Gut zu wissen

Verbindung Sprachnachrichten-Transkription über einen WebSocket bei wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, authentifiziert mit dem normalen Authorization Bearer-Header. Audio senden Streamen Sie 16 kHz Mono PCM16-Audio mit input_audio_buffer.append. Die Sprachaktivitätserkennung entscheidet, wo jede Äußerung endet, sodass kein Commit gesendet werden kann. Was zurückkommt Jede Äußerung kommt als conversation.item.input_audio_transcription.completed Ereignis ein, sobald der Sprecher pausiert. Dieses Modell sendet keine Teilergebnisse, während der Sprecher spricht; für Live-Untertitel verwenden Sie qwen-audio-3-1-asr-stream. Billing Ein- und Ausgabetoken sind pro 1 Million bepreist, und jede abgeschlossene Äußerung wird eigenständig aus der vom Modell angegebenen Nutzung abgerechnet.

Qwen Audio 3.1 ASR Message API: häufige Fragen

Wie viel kostet die Qwen Audio 3.1 ASR Message API?

Auf EmpirioLabs wird Qwen Audio 3.1 ASR Message nach Verbrauch abgerechnet: Eingabe $1.86 pro 1M Audio-Eingangstoken; Output $1.40 pro 1 Million generierter Token. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet Qwen Audio 3.1 ASR Message?

Qwen Audio 3.1 ASR Message wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich Qwen Audio 3.1 ASR Message im Browser testen, bevor ich integriere?

Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Qwen Audio 3.1 ASR Message läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID qwen-audio-3-1-asr-message und streamen Sie dann Audio in beide Richtungen.

Wie bekomme ich einen Qwen Audio 3.1 ASR Message API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.