Qwen3.8 Omni Flash Realtime API

Sprach- und Live-Video-Frames, Sprach-Out über eine Socket, mit 56 Stimmen, Tool-Anrufe während des Gesprächs sowie getrennte Text- und Audio-Token-Raten.

Alibaba CloudAudiogeneration192K KontextVeröffentlicht 21. Sept. 2026SingaporeProprietärer EndpointNeu

Über Qwen3.8 Omni Flash Realtime

Sprach- und Live-Video-Frames, Sprach-Out über eine Socket, mit 56 Stimmen, Tool-Anrufe während des Gesprächs sowie getrennte Text- und Audio-Token-Raten.

Die Sitzung ist mit session.update-Ereignissen über den Socket konfiguriert, anstatt mit Anfrageparametern. Text- und Audio-Tokens werden zu getrennten Sätzen abgerechnet.

Auch bekannt als Alibaba Cloud Qwen3.8 Omni Flash Realtime

realtimespeech to speechaudio inaudio outvideofunction callingmultilingual

Qwen3.8 Omni Flash Realtime Spezifikationen

Modell-ID
qwen3-8-omni-flash-realtime
Autor
Alibaba Cloud
Kategorie
Audiogeneration
Veröffentlicht
21. Sept. 2026
Kontextfenster
192K Token
Max. Ausgabe
65.536 Token
Eingabe
AudioTextVideo
Ausgabe
AudioText
Region
Singapore
Endpoints
WEBSOCKET/v1/realtime
Alternative Modell-IDs
qwen3.8-omni-flash-realtimealibaba/qwen3-8-omni-flash-realtime

Qwen3.8 Omni Flash Realtime API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingang: Audio
pro 1M Audio-Eingangstoken
$1.86
Eingabe
pro 1M Prompt-Token
$0.46
Ausgabe
pro 1 Million generierter Token
$1.40
Ausgabe: Audio
pro 1M generierten Audio-Tokens
$3.74
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen3.8 Omni Flash Realtime API auf

Qwen3.8 Omni Flash Realtime führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID qwen3-8-omni-flash-realtime und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Vollständige Qwen3.8 Omni Flash Realtime API-Referenz

Qwen3.8 Omni Flash Realtime API-Parameter

Request-Parameter, die die Qwen3.8 Omni Flash Realtime API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
voiceenumTinaTina, Cindy, Liora Mira, Raymond, Zane, Katerina, Ryan, Mia, ...Sprechstimme für die Sitzung. Setze sie mit session.update, bevor das Modell Audio erzeugt. Diese Stimmen sind spezifisch für dieses Modell.
instructionsstring--Systemanleitung, wie sich das Modell während des Gesprächs verhalten und sprechen sollte.
modalitiesstring["text","audio"]-Welche Ausgabetypen das Modell für eine Runde zurückgibt. Lassen Sie Audio für eine reine Textantwort fallen.
input_audio_formatenumpcm16pcm16Codierung des Audios, das du an den Eingangspuffer anhängst: base64 16-Bit-PCM bei 16 kHz.
output_audio_formatenumpcm24pcm24Codierung des Audios, das das Modell zurückstreamt: 16-Bit-PCM bei 24 kHz.
turn_detectionstring{"type":"server_vad"}-Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell sollte antworten. Bei diesem Modell ist sie standardmäßig...

Gut zu wissen

Verbinden Vollduplex-Stimme über einen WebSocket bei wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime, authentifiziert mit dem normalen Autorisierungsträger-Header. Konfigurieren Sie die Sitzung mit session.update über den Socket: Sprache, Befehle, Modalitäten und Dreherkennung. Audio und Video senden - Mikrofonaudio als input_audio_buffer.append Ereignisse anhängen. - Live-Videoframes als input_image_buffer.append Ereignisse anhängen. Frames sind kein Nachrichteninhalt, daher wird ein Bild in einem Gesprächselement abgelehnt. - Die Sprachaktivitätserkennung entscheidet, wann Sie aufgehört haben zu sprechen, also streamen Sie etwa eine Sekunde nach dem Ende der Sprache weiter. Stimmen Die Stimmen in diesem Modell sind nicht die gleiche Menge wie bei den Qwen3.5 Omni Echtzeitmodellen. Wählen Sie eine aus der Sprachliste, anstatt eine Stimme zu übertragen, oder lassen Sie sie ungesetzt und der Standard wird für Sie bereitgestellt. Billing Audio- und Texttoken werden in beide Richtungen separat bepreist, und jede abgeschlossene Runde wird eigenständig nach der vom Modell angegebenen Nutzung abgerechnet.

Qwen3.8 Omni Flash Realtime API: häufige Fragen

Wie viel kostet die Qwen3.8 Omni Flash Realtime API?

Auf EmpirioLabs wird Qwen3.8 Omni Flash Realtime nach Verbrauch abgerechnet: Eingang: Audio $1.86 pro 1M Audio-Eingangstoken; Eingabe $0.46 pro 1M Prompt-Token; Output $1.40 pro 1 Million generierter Token; Ausgabe: Audio $3.74 pro 1M generierten Audio-Tokens. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von Qwen3.8 Omni Flash Realtime?

Qwen3.8 Omni Flash Realtime unterstützt ein Kontextfenster von 192K Token mit bis zu 65.536 Ausgabe-Token pro Antwort.

Welchen Endpoint verwendet Qwen3.8 Omni Flash Realtime?

Qwen3.8 Omni Flash Realtime wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich Qwen3.8 Omni Flash Realtime im Browser testen, bevor ich integriere?

Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Qwen3.8 Omni Flash Realtime läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID qwen3-8-omni-flash-realtime und streamen Sie dann Audio in beide Richtungen.

Wie bekomme ich einen Qwen3.8 Omni Flash Realtime API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.