Qwen3.5 Flash API

Vision-Sprachmodell mit hybrider linearer Aufmerksamkeit plus spärlichem MoE, 1M-Kontext und schneller multimodaler text/image /Video-Inferenz.

Alibaba CloudTextgenerierung1M KontextVeröffentlicht 24. Feb. 2026SingaporeProprietärer Endpoint

Über Qwen3.5 Flash

Vision-Sprachmodell mit hybrider linearer Aufmerksamkeit plus spärlichem MoE, 1M-Kontext und schneller multimodaler text/image /Video-Inferenz.

Auch bekannt als Alibaba Cloud Qwen3.5 Flash, Qwen3.5-Flash, qwen3-5-flash

visionweb searchcode interpreterfunction callingreasoning

Qwen3.5 Flash Spezifikationen

Modell-ID
qwen3-5-flash
Anbieter
Alibaba Cloud
Kategorie
Textgenerierung
Veröffentlicht
24. Feb. 2026
Kontextfenster
1M Token
Max. Ausgabe
32.768 Token
Eingabe
TextBildVideo
Ausgabe
Text
Strukturierte Ausgabe
JSON-Modus
Region
Singapore
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/qwen3-5-flash:generateContent
Alternative Modell-IDs
qwen3.5-flash

Qwen3.5 Flash API-PreiseSpare bis zu 10%

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M prompte Token
$0.10$0.090
Ausgabe
pro 1M generierte Token
$0.40$0.368
Web-Suche
pro Anfrage, wenn aktiviert
$0.015
Bildsuche
pro Anruf
$0.012
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen3.5 Flash API auf

Qwen3.5 Flash bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID qwen3-5-flash. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-5-flash",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-5-flash",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Vollständige Qwen3.5 Flash API-Referenz

Qwen3.5 Flash API-Parameter

Request-Parameter, die die Qwen3.5 Flash API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
temperaturenumber0.70 bis 2Temperatur wird geprochen. 0 = deterministisch, 2 = maximale Zufälligkeit.
top_pnumber0.90 bis 1Kernprobenwahrscheinlichkeitsmasse. Niedriger = fokussierter.
max_tokensnumber40961 bis 32768Maximale Token in der Antwort.
enable_thinkingbooleantrue-Aktivieren Sie den erweiterten Denkmodus. Langsamere, aber verbesserte Aufgaben mit viel Schlussfolgerung.
vl_high_resolution_imagesbooleantrue-Verwenden Sie für Eingabebilder eine höhere Auflösung. Bessere Details zu höheren Kosten.
max_pixelsnumber26214401 bis 99999999Maximale Pixel pro Eingabebild. Größer = mehr Details, aber langsamer / mehr Token.
tool_web_searchbooleanfalse-Suchen Sie im Internet nach Echtzeitinformationen.
tool_web_extractorbooleantrue-Extrahieren und lesen Sie Inhalte aus URLs. Erfordert Websuche und Nachdenken.
tool_code_interpreterbooleantrue-Führe Python-Code in einer Sandbox aus. Erfordert Nachdenken.
tool_web_search_imagebooleantrue-Suchen Sie im Internet nach Bildern aus Textbeschreibungen.
tool_image_searchbooleantrue-Finden Sie ähnliche Bilder aus einem hochgeladenen Bild.
video_fpsnumber20.1 bis 10Bilder pro Sekunde, die aus Eingabevideo zur Analyse abgeschnitten wurden.
treat_images_as_videobooleanfalse-Behandle eine Sequenz von Eingabebildern als Video zur zeitlichen Überlegung.
response_formatenum--Geben Sie die Ausgabe als gültiges JSON-Objekt (JSON-Modus) zurück. Beschreibe die Felder, die du in deinem Prompt verwenden möchtest.
1 weiterer Parameter in den Docs

Gut zu wissen

Eingebaute Tools (abgerechnet nur bei Aufruf) - Web-Suche: $0.015/call Web-Extraktor: kostenlos - Code-Interpreter: kostenlos - Text-to-Bild-Suche: $0.012/call Bild-to-Bild-Suche: $0.012/call Andere - Denk-Token werden als Ausgabe-Token in Rechnung gestellt Text-to-Image-Suche und Bild-to-Bild-Suche verwenden Sie die Bild-Suche Preiszeile. Jede aufgerufene bildsuche wird mit dem angegebenen pro aufruf abgerechnet.

Per-tool billing (usage.tool_usage)

When this model invokes tools (web search, code interpreter, etc.) inside a single request, the response carries a normalized usage.tool_usage map alongside the token counts. The example below shows the shape — exact field names, units, and which tools appear can vary slightly per provider:

"usage": {
  "prompt_tokens": 123,
  "completion_tokens": 456,
  "cost_usd": 0.0042,
  "tool_usage": {"web_search": 3, "code_interpreter": 1}
}

The tool counts are already factored into cost_usd — they are surfaced for transparency so you can audit per-tool billing. The field is omitted when no tools were invoked.

:variant1

Unterstützt Text-, Bild- und Videoeingaben. Die Websuche ist über tool_web_search verfügbar und fügt $0.01 pro Abfrage hinzu, wenn sie aktiviert ist. Denk-Token werden als Output-Token abgerechnet. Explizite Cache-Steuerungen werden nicht unterstützt.

Qwen3.5 Flash Varianten

Varianten sind alternative Versionen von Qwen3.5 Flash mit eigener Modell-ID. Je nach Variante können sich Serving-Region, Preise oder unterstützte Parameter unterscheiden; alles andere funktioniert gleich.

Qwen3.5 Flash :variant1Spare bis zu 68%

Modell-ID
qwen3-5-flash:variant1
Region
China
Kontextfenster
1M Token
Strukturierte Ausgabe
JSON-Modus
Batch API
Verfügbar, 35% Rabatt auf den Listenpreis
Typ
Spezifikation
Preis
Eingabe
pro 1M prompte Token
$0.090<=128K $0.029128K-256K $0.115256K-1M $0.172
Ausgabe
pro 1M generierte Token
$0.368<=128K $0.287128K-256K $1.147256K-1M $1.72
Web-Suche
pro Abfrage, wenn aktiviert
$0.01
:variant1 im Playground testen

Qwen3.5 Flash API: häufige Fragen

Wie viel kostet die Qwen3.5 Flash API?

Auf EmpirioLabs wird Qwen3.5 Flash nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von Qwen3.5 Flash?

Qwen3.5 Flash unterstützt ein Kontextfenster von 1M Token mit bis zu 32.768 Ausgabe-Token pro Antwort.

Ist die Qwen3.5 Flash API OpenAI-kompatibel?

Ja. Qwen3.5 Flash bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID qwen3-5-flash verwendest.

Welche Qwen3.5 Flash Varianten sind verfügbar?

Qwen3.5 Flash ist als 2 Modell-IDs verfügbar: der Standard qwen3-5-flash plus qwen3-5-flash:variant1 (China). Varianten können sich in Serving-Region, Preisen oder unterstützten Parametern unterscheiden; die Preistabellen stehen auf dieser Seite.

Kann ich Qwen3.5 Flash im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt Qwen3.5 Flash im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen Qwen3.5 Flash API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.