Qwen3.8 Omni Flash ist Alibabas Omni-Eingabe-Flash-Modell: Es liest Text, Bilder, Audio und Video und antwortet in Text. Es wird mit einem 1M-Token-Kontext ausgeliefert, der standardmäßig aktiviert ist, Funktionsaufrufe, strikte JSON-Schema-strukturierte Ausgabe und ein eingebautes Tool, die Websuche.
Qwen3.8 Omni Flash ist heute über eine OpenAI-kompatible API auf EmpirioLabs verfügbar, mit Streaming und bis zu 128K Ausgabetoken. Probieren Sie es aus spielplatz oder rufen Sie es von einem OpenAI-kompatiblen Client auf. Die volle Spec und aktuelle Preise leben auf der Qwen3.8 Omni Flash Modellseite und die API-Doku.
Der Versand im selben Launch ist Qwen3.8 LiveTranslate Flash Echtzeit: gesprochene Übersetzung über einen WebSocket. Stellen Sie die Zielsprache ein, sprechen, und das Modell antwortet in dieser Sprache mit Text und Audio. Öffnen Sie es in der spielplatz oder verbinden mit wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime. Details live auf der Echtzeit-Sprach-API Page.
Preisgestaltung
Omni Flash-Abrechnung basiert auf Nutzung mit einer festen Eingangsrate und einer festen Ausgangsrate bei jeder Eingabegröße. Audio- und Video-Token verwenden dieselbe Eingaberate wie Text; der Soundtrack eines Videos wird zusammen mit seinen Videotoken als Audio-Token gezählt. Die Websuche erhebt eine kleine Gebühr pro Anruf, die nur dann anfällt, wenn ein Anruf tatsächlich läuft. Thinking Tokens rechnen als Ausgabe-Tokens ab.
LiveTranslate berechnet jede abgeschlossene Runde nach der vom Modell angegebenen Nutzung ab, mit separaten Tarifen für Audio- und Texttoken. Die aktuellen Sätze für beide Modelle gelten immer auf ihren Modellseiten und die preisseite, die synchron mit dem bleiben, was ihnen aufgeladen wird.
Quickstart
Zeigen Sie ein OpenAI SDK auf die EmpirioLabs-Basis-URL und übergeben Sie qwen3-8-omni-flash als modell:
von openai-import OpenAI-Client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-omni-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "Was wird gesagt und was ist auf dem Bildschirm?"}, {"type": "input_audio", "input_audio": { "format": "mp3", "data": "https://example.com/clip.mp3", }}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)
Dasselbe Modell, auf dem ID funktioniert, /v1/responses, die anthropische Form /v1/messages, und die Google-kompatiblen /v1beta/models/qwen3-8-omni-flash:generateContent Route. Das alternative Id qwen3.8-omni-flash wird auf dasselbe Modell aufgelöst.
LiveTranslate über einen WebSocket
LiveTranslate ist kein HTTP. Verbinde dich mit dem Echtzeit-Socket mit demselben API-Schlüssel, den du sonst überall verwendest, und sende dann ein session.update das die Zielsprache vor jedem Audio einsetzt:
{"type": "session.update", "session": { "voice": "Tina", "translation": {"language": "en"}, "modalities": ["text", "audio"] }}
Dann füge das Mikrofonaudio als input_audio_buffer.append Events. Das Modell übersetzt, während du sprichst, und streamt den Ton zurück. Stimmen auf diesem Modell sind Tina, Serena, Ethan und Cindy. Das alternative ID qwen3.8-livetranslate-flash-realtime resolviert auf dasselbe Modell. Ein Chat-Completions-Aufruf auf diesem Slug wird abgelehnt; der einzige angekündigte Endpunkt ist der Socket.
Denken
Bei Omni Flash ist Deep Thinking standardmäßig aktiviert und wird als folgt zurückgestreamt. reasoning content neben der Antwort. Kontrolliere es mit enable thinking und thinking_budget (bis zu 262.144 Token), oder senden reasoning effort und die Plattform legt es auf ein für das Modell zugeschnittenes Budget zu. Thinking-Tokens werden als Ausgabe-Tokens abgestellt, also deaktivieren Sie das Denken oder legen Sie ein kleines Budget für kurze, latenzempfindliche Züge fest.
Eingebaute Werkzeuge
Websuche zu Omni Flash Fahrgeschäften hinter tool_web_search und ist standardmäßig deaktiviert. Dieses Modell stellt weder den Web-Extractor, Code-Interpreter noch die Bildersuchwerkzeuge frei. Wenn die Suche ausgeführt wird, lautet die Antwort usage.tool_usage MAP zeigt genau an, wie viele Aufrufe gemacht wurden, sodass du die Rechnungsabrechnung pro Tool überprüfen kannst. Eine einzelne Anfrage kann die Suche mehr als einmal aufrufen, und jeder aufgerufene Aufruf wird abgerechnet. LiveTranslate hat keine Websuche.
Strukturierte Ausgabe
Für eine exakte Antwortform auf Omni Flash passe response_format mit {"type": "json_schema",...} und "Streng": Wahr: Das Modell liefert genau die Schlüssel des Schemas zurück, ohne Extras. Einfacher JSON-Modus mit {"type": "json_object"} wird ebenfalls unterstützt.
Dinge, die es wert sind, vor Ihrem ersten Anruf zu wissen
- Omni Flash liest Audio und Video vor und antwortet per Text. Fordern Sie keine Audioausgabe an. Bei diesem Modell gibt es keine Sprachsteuerung.
- Senden Sie Omni Flash-Audio als URL oder als base64-Daten-URI. Verschachtet
input_audio.datamuss eine URL oder eineDaten:URI, nicht rohes Base64. Ein playground MP3-Upload verwendetFormat: "MPEG"; das Aliases zump3. tool_choice: "erforderlich"funktioniert nicht, solange das Denken an ist. Die Anfrage wird mit einem klaren Fehler abgelehnt. Keeptool_choice: "Auto"mit aktiviertem Denken oder festgelegtenable_thinking: falschWenn du einen Funktionsaufruf erzwingen musst.- LiveTranslate benötigt eine Zielsprache in der ersten Sitzung.update. Ohne sie schließt sich der Socket, bevor Audio erzeugt wird. Lassen Sie die Quellsprache auf Auto-Detect nicht eingestellt.
Beide Modelle sind jetzt im playground und über die EmpirioLabs API.



