Zuhause Blog

Wie man die Qwen3.8 Flash API nutzt

Wie man die Qwen3.8 Flash API nutzt

Aug 26, 2026

EmpirioLabs AI

Qwen3.8 Flash ist das neueste multimodale Modell in Alibabas Qwen3.8-Familie, das am 26. August 2026 veröffentlicht wurde und für schnelle, kostengünstige Codierung, Agenten- und Visionsarbeit entwickelt wurde. Es kombiniert einen 1-Millionen-Token-Kontext mit Text-, Bild- und Videoverständnis, tiefem Denken, das standardmäßig aktiviert ist, und denselben fünf eingebauten Tools wie Qwen3.8 Max.

Qwen3.8 Flash ist heute über eine OpenAI-kompatible API auf EmpirioLabs verfügbar, mit Funktionsaufrufen, striktem JSON-Schema-strukturiertem Output, Streaming und bis zu 128K Output-Tokens. Probier es in der spielplatz oder rufen Sie es von einem OpenAI-kompatiblen Client auf. Die volle Spec und aktuelle Preise leben auf der Qwen3.8 Flash-Modellseite und die API-Doku.

Preisgestaltung

Die Abrechnung basiert auf Nutzung mit einer festen Eingabe- und einer festen Ausgaberate bei jeder Eingabegröße, und es gibt keine separate Cache-Schicht. Websuche, text-to-image Search und image-to-image Search ergeben eine kleine Gebühr pro Anruf, die nur dann gilt, wenn ein Anruf tatsächlich ausgeführt wird; Der Web Extractor und Code Interpreter laufen ohne zusätzliche Kosten. Die aktuellen Zinssätze gelten immer auf der modellblatt und die preisseite, die synchron mit dem bleiben, was ihnen aufgeladen wird.

Quickstart

Zeigen Sie ein OpenAI SDK auf die EmpirioLabs-Basis-URL und übergeben Sie qwen3-8-flash als modell:

von openai-import OpenAI-Client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "What happens in this chart?"}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)

Dasselbe Modell, auf dem ID funktioniert, /v1/responses, die anthropische Form /v1/messages, und die Google-kompatiblen /v1beta/models/qwen3-8-flash:generateContent Route. Das alternative Id qwen3.8-flash wird auf dasselbe Modell aufgelöst.

Denken

Deep Thinking ist standardmäßig aktiviert und wird als folgt zurückgesendet reasoning content neben der Antwort. Kontrolliere es mit enable thinking und thinking_budget (bis zu 262.144 Token), oder senden reasoning effort und die Plattform legt es auf ein für das Modell zugeschnittenes Budget zu. Thinking-Tokens werden als Ausgabe-Tokens abgestellt, also deaktivieren Sie das Denken oder legen Sie ein kleines Budget für kurze, latenzempfindliche Züge fest.

Eingebaute Werkzeuge

Fünf eingebaute Werkzeuge fahren dahinter tool_* Schalter: tool_web_search, tool_web_extractor, tool_code_interpreter, tool_web_search_image, und tool_image_search. Der Web-Extractor erfordert eine Websuche, und sowohl der Extractor als auch der Code-Interpreter laufen nur, wenn das Denken aktiviert ist. Wenn Werkzeuge laufen, ist die Reaktion usage.tool_usage MAP zeigt genau an, wie viele Anrufe getätigt wurden, sodass Sie die Rechnung pro Tool überprüfen können.

Strukturierte Ausgabe

Für eine exakte Antwortform passieren Sie response_format mit {"type": "json_schema",...} und "Streng": Wahr: Das Modell liefert genau die Schlüssel des Schemas zurück, ohne Extras. Einfacher JSON-Modus mit {"type": "json_object"} wird ebenfalls unterstützt.

Dinge, die es wert sind, vor Ihrem ersten Anruf zu wissen

  • Alle fünf eingebauten Tools sind standardmäßig aktiviert und suchen nach einem aufgerufenen Aufruf die Rechnung. Eine einzelne Anfrage kann die Websuche mehrfach ausführen, und jede Aufrufung wird abgerechnet. Für einen einfachen Chat ohne Werkzeuggebühren setze dich tool_web_search, tool_web_search_image, und tool_image_search zu falsch.
  • tool_choice: "erforderlich" funktioniert nicht, solange das Denken an ist. Die Anfrage wird mit einem klaren Fehler abgelehnt. Keep tool_choice: "Auto" mit aktiviertem Denken oder festgelegt enable_thinking: falsch Wenn du einen Funktionsaufruf erzwingen musst.
  • Im JSON-Modus muss das Wort "JSON" in deinen Nachrichten verwendet werden. A {"type": "json_object"} Die Anfrage wird abgelehnt, es sei denn, das Wort taucht irgendwo im Gespräch auf. JSON-Schema-Anfragen haben keine solche Anforderung.

Qwen3.8 Flash ist jetzt verfügbar in der spielplatz und durch die EmpirioLabs API.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.