
Speech In, Speech Out über einen Sockel, mit separaten Text- und Audio-Token-Raten und pro-Runde-Abrechnung.
Speech In, Speech Out über einen Sockel, mit separaten Text- und Audio-Token-Raten und pro-Runde-Abrechnung.
Die Sitzung ist mit session.update-Ereignissen über den Socket konfiguriert, anstatt mit Anfrageparametern. Text- und Audio-Tokens werden zu getrennten Sätzen abgerechnet.
Auch bekannt als Alibaba Cloud Qwen3.5 Omni Flash Realtime
qwen3-5-omni-flash-realtime/v1/realtimeqwen3.5-omni-flash-realtimealibaba/qwen3-5-omni-flash-realtimeLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Qwen3.5 Omni Flash Realtime führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen3-5-omni-flash-realtime, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID qwen3-5-omni-flash-realtime und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen3-5-omni-flash-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())Request-Parameter, die die Qwen3.5 Omni Flash Realtime API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| voice | enum | Tina | Tina, Serena, Ethan, Dylan, Sunny, Peter, Kiki, Eric | Sprechstimme für die Sitzung. Setze es auf session.update, bevor das Modell irgendwelche Audioaufnahmen erzeugt. |
| instructions | string | - | - | Systemanleitung, wie sich das Modell während des Gesprächs verhalten und sprechen sollte. |
| modalities | string | ["text","audio"] | - | Welche Ausgabetypen das Modell für eine Runde zurückgibt. Lass "Audio" für eine reine Textantwort weg. |
| input_audio_format | enum | pcm | pcm | Codierung des Audios, das du dem Eingangspuffer anhängst: base64 16-Bit-PCM. |
| output_audio_format | enum | pcm | pcm | Codierung des Audios, das das Modell zurückstreamt: base64 16-Bit-PCM. |
| turn_detection | string | {"type":"server_vad"} | - | Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell soll antworten. Ohne sie hört das Modell zu, antwortet aber... |
Vollduplex-Stimme über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen3-5-omni-flash-realtime, authentifiziert mit dem normalen Authorization Bearer-Header. Konfigurieren Sie die Sitzung mit session.update über den Socket: Sprache, Befehle, Modalitäten und Zugerkennung. Die Stimmen dieses Modells unterscheiden sich von der früheren Omni-Generation, daher sollten Sie eine Stimme einstellen, die es akzeptiert oder den Standard belassen; eine unbekannte Stimme beendet die Sitzung, anstatt einen Fehler zurückzugeben. Text- und Audio-Token werden separat bepreist, und jeder abgeschlossene Zug wird eigenständig aus der vom Modell gemeldeten Nutzung abgerechnet.
Auf EmpirioLabs wird Qwen3.5 Omni Flash Realtime nach Verbrauch abgerechnet: Eingang: Audio $9.00 pro 1M Audio-Eingangstoken; Eingabe $1.10 pro 1M Prompt-Token; Output $6.60 pro 1 Million generierter Token; Ausgabe: Audio $35.40 pro 1M generierten Audio-Tokens. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Qwen3.5 Omni Flash Realtime unterstützt ein Kontextfenster von 256K Token mit bis zu 32.768 Ausgabe-Token pro Antwort.
Qwen3.5 Omni Flash Realtime wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Qwen3.5 Omni Flash Realtime läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID qwen3-5-omni-flash-realtime und streamen Sie dann Audio in beide Richtungen.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.