Qwen3.8 Flash ist das neueste multimodale Modell in Alibabas Qwen3.8-Familie, das am 26. August 2026 veröffentlicht wurde und für schnelle, kostengünstige Codierung, Agenten- und Visionsarbeit entwickelt wurde. Es kombiniert einen 1-Millionen-Token-Kontext mit Text-, Bild- und Videoverständnis, tiefem Denken, das standardmäßig aktiviert ist, und denselben fünf eingebauten Tools wie Qwen3.8 Max.
Qwen3.8 Flash ist heute über eine OpenAI-kompatible API auf EmpirioLabs verfügbar, mit Funktionsaufrufen, striktem JSON-Schema-strukturiertem Output, Streaming und bis zu 128K Output-Tokens. Probier es in der spielplatz oder rufen Sie es von einem OpenAI-kompatiblen Client auf. Die volle Spec und aktuelle Preise leben auf der Qwen3.8 Flash-Modellseite und die API-Doku.
Preisgestaltung
Die Abrechnung basiert auf Nutzung mit einer festen Eingabe- und einer festen Ausgaberate bei jeder Eingabegröße, und es gibt keine separate Cache-Schicht. Websuche, text-to-image Search und image-to-image Search ergeben eine kleine Gebühr pro Anruf, die nur dann gilt, wenn ein Anruf tatsächlich ausgeführt wird; Der Web Extractor und Code Interpreter laufen ohne zusätzliche Kosten. Die aktuellen Zinssätze gelten immer auf der modellblatt und die preisseite, die synchron mit dem bleiben, was ihnen aufgeladen wird.
Quickstart
Zeigen Sie ein OpenAI SDK auf die EmpirioLabs-Basis-URL und übergeben Sie qwen3-8-flash als modell:
von openai-import OpenAI-Client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "What happens in this chart?"}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)
Dasselbe Modell, auf dem ID funktioniert, /v1/responses, die anthropische Form /v1/messages, und die Google-kompatiblen /v1beta/models/qwen3-8-flash:generateContent Route. Das alternative Id qwen3.8-flash wird auf dasselbe Modell aufgelöst.
Denken
Deep Thinking ist standardmäßig aktiviert und wird als folgt zurückgesendet reasoning content neben der Antwort. Kontrolliere es mit enable thinking und thinking_budget (bis zu 262.144 Token), oder senden reasoning effort und die Plattform legt es auf ein für das Modell zugeschnittenes Budget zu. Thinking-Tokens werden als Ausgabe-Tokens abgestellt, also deaktivieren Sie das Denken oder legen Sie ein kleines Budget für kurze, latenzempfindliche Züge fest.
Eingebaute Werkzeuge
Fünf eingebaute Werkzeuge fahren dahinter tool_* Schalter: tool_web_search, tool_web_extractor, tool_code_interpreter, tool_web_search_image, und tool_image_search. Der Web-Extractor erfordert eine Websuche, und sowohl der Extractor als auch der Code-Interpreter laufen nur, wenn das Denken aktiviert ist. Wenn Werkzeuge laufen, ist die Reaktion usage.tool_usage MAP zeigt genau an, wie viele Anrufe getätigt wurden, sodass Sie die Rechnung pro Tool überprüfen können.
Strukturierte Ausgabe
Für eine exakte Antwortform passieren Sie response_format mit {"type": "json_schema",...} und "Streng": Wahr: Das Modell liefert genau die Schlüssel des Schemas zurück, ohne Extras. Einfacher JSON-Modus mit {"type": "json_object"} wird ebenfalls unterstützt.
Dinge, die es wert sind, vor Ihrem ersten Anruf zu wissen
- Alle fünf eingebauten Tools sind standardmäßig aktiviert und suchen nach einem aufgerufenen Aufruf die Rechnung. Eine einzelne Anfrage kann die Websuche mehrfach ausführen, und jede Aufrufung wird abgerechnet. Für einen einfachen Chat ohne Werkzeuggebühren setze dich
tool_web_search,tool_web_search_image, undtool_image_searchzufalsch. tool_choice: "erforderlich"funktioniert nicht, solange das Denken an ist. Die Anfrage wird mit einem klaren Fehler abgelehnt. Keeptool_choice: "Auto"mit aktiviertem Denken oder festgelegtenable_thinking: falschWenn du einen Funktionsaufruf erzwingen musst.- Im JSON-Modus muss das Wort "JSON" in deinen Nachrichten verwendet werden. A
{"type": "json_object"}Die Anfrage wird abgelehnt, es sei denn, das Wort taucht irgendwo im Gespräch auf. JSON-Schema-Anfragen haben keine solche Anforderung.
Qwen3.8 Flash ist jetzt verfügbar in der spielplatz und durch die EmpirioLabs API.



