
Simultane gesprochene Übersetzung über einen WebSocket. Stellen Sie die Zielsprache ein und sprechen Sie dann; das Modell antwortet in dieser Sprache mit Text und Audio.
Simultane gesprochene Übersetzung über einen WebSocket. Stellen Sie die Zielsprache ein und sprechen Sie dann; das Modell antwortet in dieser Sprache mit Text und Audio.
Die Sitzung ist mit session.update-Ereignissen über den Socket statt mit Anfrageparametern konfiguriert. Die Zielsprache ist erforderlich. Text- und Audiotoken werden zu getrennten Gebühren abgerechnet.
Auch bekannt als Alibaba Cloud Qwen3.8 LiveTranslate Flash Realtime
qwen3-8-livetranslate-flash-realtime/v1/realtimeqwen3.8-livetranslate-flash-realtimealibaba/qwen3-8-livetranslate-flash-realtimeLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Qwen3.8 LiveTranslate Flash Realtime ist gesprochene Übersetzung über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID qwen3-8-livetranslate-flash-realtime und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Legen Sie die Zielsprache mit einem session.update fest, bevor Sie Audio senden. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
await ws.send(json.dumps({
"type": "session.update",
"session": {
"voice": "Tina",
"translation": {"language": "en"},
"modalities": ["text", "audio"],
},
}))
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] in ("response.audio_transcript.text", "response.text.text"):
print(event.get("text") or "")
elif event["type"] == "response.done":
break
asyncio.run(main())Request-Parameter, die die Qwen3.8 LiveTranslate Flash Realtime API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| voice | enum | Tina | Tina, Serena, Ethan, Cindy | Sprechstimme für das übersetzte Audio. Setze es mit session.update, bevor das Modell Audio erzeugt. |
| target_language | enum | en | zh, en, ar, de, fr, es, pt, id, it, ko, ru, th, vi, ja, tr, h... | Sprache, in die das Modell übersetzt wird. Erforderlich. Setze es mit session.update, bevor du Audio verschickst. |
| source_language | enum | auto | auto, zh, en, ar, de, fr, es, pt, id, it, ko, ru, th, vi, ja,... | Die Sprache, die du sprichst. Lass Auto stehen, damit das Modell es erkennt. |
| modalities | string | ["text","audio"] | - | Welche Ausgabetypen das Modell für eine Runde zurückgibt. Löschen Sie Audio zugunsten einer reinen Textübersetzung. |
| input_audio_format | enum | pcm | pcm | Codierung des Audios, das du dem Eingangspuffer anhängst: base64 16-Bit-PCM. |
| output_audio_format | enum | pcm | pcm | Codierung des Audios, das das Modell zurückstreamt: base64 16-Bit-PCM. |
Gesprochene Übersetzung über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime, authentifiziert mit dem normalen Authorization Bearer-Header. Setze die Zielsprache mit session.update, bevor du Audio versendest. Verwenden Sie eine Sprache, die dieses Modell akzeptiert, oder lassen Sie die Standard-Tina. Audio- und Texttoken werden separat bepreist, und jede abgeschlossene Runde wird eigenständig aus der vom Modell angegebenen Nutzung berechnet.
Auf EmpirioLabs wird Qwen3.8 LiveTranslate Flash Realtime nach Verbrauch abgerechnet: Eingang: Audio $15.00 pro 1M Audio-Eingangstoken; Eingabe $1.10 pro 1M Prompt-Token; Output $40.00 pro 1 Million generierter Token; Ausgabe: Audio $60.00 pro 1M generierten Audio-Tokens. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Qwen3.8 LiveTranslate Flash Realtime unterstützt ein Kontextfenster von 53K Token mit bis zu 4.096 Ausgabe-Token pro Antwort.
Qwen3.8 LiveTranslate Flash Realtime wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Qwen3.8 LiveTranslate Flash Realtime läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID qwen3-8-livetranslate-flash-realtime und streamen Sie dann Audio in beide Richtungen.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.