Qwen Audio 3.1 Realtime Plus API

Duplex-Sprachgespräche über einen Sockel, mit 27 Stimmen, nativer Websuche, Tool-Anrufen sowie separaten Text- und Audio-Token-Raten.

Alibaba CloudAudiogeneration256K KontextVeröffentlicht 20. Sept. 2026SingaporeProprietärer EndpointNeu

Über Qwen Audio 3.1 Realtime Plus

Duplex-Sprachgespräche über einen Sockel, mit 27 Stimmen, nativer Websuche, Tool-Anrufen sowie separaten Text- und Audio-Token-Raten.

Die Sitzung ist mit session.update-Ereignissen über den Socket konfiguriert, statt mit Anfrageparametern. Die Websuche ist standardmäßig deaktiviert und kann nicht mit Funktionsaufrufen kombiniert werden. Text- und Audio-Tokens werden zu getrennten Sätzen abgebucht.

Auch bekannt als Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus

realtimespeech to speechaudio inaudio outfunction callingweb searchmultilingual

Qwen Audio 3.1 Realtime Plus Spezifikationen

Modell-ID
qwen-audio-3-1-realtime-plus
Autor
Alibaba Cloud
Kategorie
Audiogeneration
Veröffentlicht
20. Sept. 2026
Kontextfenster
256K Token
Max. Ausgabe
16.384 Token
Eingabe
AudioText
Ausgabe
AudioText
Region
Singapore
Endpoints
WEBSOCKET/v1/realtime
Alternative Modell-IDs
qwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plus

Qwen Audio 3.1 Realtime Plus API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingang: Audio
pro 1M Audio-Eingangstoken
$12.80
Eingabe
pro 1M Prompt-Token
$1.60
Ausgabe
pro 1 Million generierter Token
$12.80
Ausgabe: Audio
pro 1M generierten Audio-Tokens
$48.00
Web-Suche
pro Aufruf beim Aufruf
$0.00
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen Audio 3.1 Realtime Plus API auf

Qwen Audio 3.1 Realtime Plus führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID qwen-audio-3-1-realtime-plus und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Vollständige Qwen Audio 3.1 Realtime Plus API-Referenz

Qwen Audio 3.1 Realtime Plus API-Parameter

Request-Parameter, die die Qwen Audio 3.1 Realtime Plus API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
voiceenumlonganqian_v3.1longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf...Sprechstimme für die Sitzung. Setze sie mit session.update, bevor das Modell Audio erzeugt. Diese Stimmen sind spezifisch für dieses Modell.
instructionsstring--Systemanleitung, wie sich das Modell während des Gesprächs verhalten und sprechen sollte.
enable_searchbooleanfalse-Durchsuchen Sie das Web nach Echtzeitinformationen. Kann nicht in derselben Sitzung wie ein Funktionsaufruf verwendet werden. Suchergebnisse werden dem Gespräch...
modalitiesstring["text","audio"]-Welche Ausgabetypen das Modell für eine Runde zurückgibt. Lassen Sie Audio für eine reine Textantwort fallen.
input_audio_formatenumpcm16pcm16Codierung des Audios, das du an den Eingangspuffer anhängst: base64 16-Bit-PCM bei 16 kHz.
output_audio_formatenumpcm24pcm24Codierung des Audios, das das Modell zurückstreamt: 16-Bit-PCM bei 24 kHz.
turn_detectionstring{"type":"server_vad"}-Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell sollte antworten. Bei diesem Modell ist sie standardmäßig...

Gut zu wissen

Verbinden Vollduplex-Stimme über einen WebSocket bei wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, authentifiziert mit dem üblichen Autorisierungsträger-Header. Konfigurieren Sie die Sitzung mit session.update über dem Socket: Sprache, Befehle, Modalitäten und Schalterkennung. Audio senden - Mikrofonton nach input_audio_buffer.append Ereignissen anhängen. - Die Sprachaktivitätserkennung entscheidet, wann Sie aufgehört haben zu sprechen, also streamen Sie etwa eine Sekunde nach Ende der Sprache weiter. Stimmen Die Stimmen dieses Modells sind ein eigenständiges Set. Wählen Sie eine aus der Sprachliste, anstatt eine Stimme von einem anderen Modell zu übertragen, oder lassen Sie sie ungesetzt und die Standardwahl wird für Sie bereitgestellt. Websuche Die Websuche ist standardmäßig ausgeschaltet. Schalten Sie sie mit enable_search ein. Sie kann nicht in derselben Sitzung wie das Funktionsaufruf aktiviert werden, und Suchergebnisse werden dem Gespräch hinzugefügt und zählen als Eingabetoken. Billing Audio- und Texttoken werden in beide Richtungen separat bepreist, und jede abgeschlossene Runde wird eigenständig nach der vom Modell angegebenen Nutzung abgerechnet.

Qwen Audio 3.1 Realtime Plus API: häufige Fragen

Wie viel kostet die Qwen Audio 3.1 Realtime Plus API?

Auf EmpirioLabs wird Qwen Audio 3.1 Realtime Plus nach Verbrauch abgerechnet: Eingang: Audio $12.80 pro 1M Audio-Eingangstoken; Eingabe $1.60 pro 1M Prompt-Token; Output $12.80 pro 1 Million generierter Token; Ausgabe: Audio $48.00 pro 1M generierten Audio-Tokens; Web-Suche $0.00 pro Aufruf beim Aufruf. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von Qwen Audio 3.1 Realtime Plus?

Qwen Audio 3.1 Realtime Plus unterstützt ein Kontextfenster von 256K Token mit bis zu 16.384 Ausgabe-Token pro Antwort.

Welchen Endpoint verwendet Qwen Audio 3.1 Realtime Plus?

Qwen Audio 3.1 Realtime Plus wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich Qwen Audio 3.1 Realtime Plus im Browser testen, bevor ich integriere?

Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Qwen Audio 3.1 Realtime Plus läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID qwen-audio-3-1-realtime-plus und streamen Sie dann Audio in beide Richtungen.

Wie bekomme ich einen Qwen Audio 3.1 Realtime Plus API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.