
Sprach- und Live-Video-Frames, Sprach-Out über eine Socket, mit 56 Stimmen, Tool-Anrufe während des Gesprächs sowie getrennte Text- und Audio-Token-Raten.
Sprach- und Live-Video-Frames, Sprach-Out über eine Socket, mit 56 Stimmen, Tool-Anrufe während des Gesprächs sowie getrennte Text- und Audio-Token-Raten.
Die Sitzung ist mit session.update-Ereignissen über den Socket konfiguriert, anstatt mit Anfrageparametern. Text- und Audio-Tokens werden zu getrennten Sätzen abgerechnet.
Auch bekannt als Alibaba Cloud Qwen3.8 Omni Flash Realtime
qwen3-8-omni-flash-realtime/v1/realtimeqwen3.8-omni-flash-realtimealibaba/qwen3-8-omni-flash-realtimeLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Qwen3.8 Omni Flash Realtime führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID qwen3-8-omni-flash-realtime und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())Request-Parameter, die die Qwen3.8 Omni Flash Realtime API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| voice | enum | Tina | Tina, Cindy, Liora Mira, Raymond, Zane, Katerina, Ryan, Mia, ... | Sprechstimme für die Sitzung. Setze sie mit session.update, bevor das Modell Audio erzeugt. Diese Stimmen sind spezifisch für dieses Modell. |
| instructions | string | - | - | Systemanleitung, wie sich das Modell während des Gesprächs verhalten und sprechen sollte. |
| modalities | string | ["text","audio"] | - | Welche Ausgabetypen das Modell für eine Runde zurückgibt. Lassen Sie Audio für eine reine Textantwort fallen. |
| input_audio_format | enum | pcm16 | pcm16 | Codierung des Audios, das du an den Eingangspuffer anhängst: base64 16-Bit-PCM bei 16 kHz. |
| output_audio_format | enum | pcm24 | pcm24 | Codierung des Audios, das das Modell zurückstreamt: 16-Bit-PCM bei 24 kHz. |
| turn_detection | string | {"type":"server_vad"} | - | Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell sollte antworten. Bei diesem Modell ist sie standardmäßig... |
Verbinden Vollduplex-Stimme über einen WebSocket bei wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime, authentifiziert mit dem normalen Autorisierungsträger-Header. Konfigurieren Sie die Sitzung mit session.update über den Socket: Sprache, Befehle, Modalitäten und Dreherkennung. Audio und Video senden - Mikrofonaudio als input_audio_buffer.append Ereignisse anhängen. - Live-Videoframes als input_image_buffer.append Ereignisse anhängen. Frames sind kein Nachrichteninhalt, daher wird ein Bild in einem Gesprächselement abgelehnt. - Die Sprachaktivitätserkennung entscheidet, wann Sie aufgehört haben zu sprechen, also streamen Sie etwa eine Sekunde nach dem Ende der Sprache weiter. Stimmen Die Stimmen in diesem Modell sind nicht die gleiche Menge wie bei den Qwen3.5 Omni Echtzeitmodellen. Wählen Sie eine aus der Sprachliste, anstatt eine Stimme zu übertragen, oder lassen Sie sie ungesetzt und der Standard wird für Sie bereitgestellt. Billing Audio- und Texttoken werden in beide Richtungen separat bepreist, und jede abgeschlossene Runde wird eigenständig nach der vom Modell angegebenen Nutzung abgerechnet.
Auf EmpirioLabs wird Qwen3.8 Omni Flash Realtime nach Verbrauch abgerechnet: Eingang: Audio $1.86 pro 1M Audio-Eingangstoken; Eingabe $0.46 pro 1M Prompt-Token; Output $1.40 pro 1 Million generierter Token; Ausgabe: Audio $3.74 pro 1M generierten Audio-Tokens. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Qwen3.8 Omni Flash Realtime unterstützt ein Kontextfenster von 192K Token mit bis zu 65.536 Ausgabe-Token pro Antwort.
Qwen3.8 Omni Flash Realtime wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Qwen3.8 Omni Flash Realtime läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID qwen3-8-omni-flash-realtime und streamen Sie dann Audio in beide Richtungen.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.