
Qwen3.5 4B ist ein kostengünstiges multimodales Schlussfolgerungsmodell mit 256K Kontext, Bild- und Videoeingabe, Funktionswerkzeugen und strukturierter Ausgabe.
Qwen3.5 4B ist ein kostengünstiges multimodales Schlussfolgerungsmodell mit 256K Kontext, Bild- und Videoeingabe, Funktionswerkzeugen und strukturierter Ausgabe.
Unterstützt Text-, Bild- und Videoeingabe, Streaming, Funktionstools, strukturierte JSON-Ausgabe, Seed-Steuerung und standardmäßig aktivierten Denkmodus. Verwenden Sie reasoning_effort oder thinking_budget für begrenztes Denken oder enable_thinking=falsch für direkte Antworten. Automatische Cache-Lesearten werden mit der vom Modelldienst gemeldeten Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt.
Auch bekannt als Alibaba Cloud Qwen3.5 4B
qwen3-5-4b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-5-4b:generateContentqwen3.5-4bLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Qwen3.5 4B bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID qwen3-5-4b. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-5-4b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-5-4b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Request-Parameter, die die Qwen3.5 4B API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 bis 2 | Temperatur wird geprochen. 0 ist deterministisch und 2 ist maximale Zufälligkeit. |
| top_p | number | 0.95 | 0 bis 1 | Kernprobenwahrscheinlichkeitsmasse. Niedrigere Werte machen die Ausgaben fokussierter. |
| max_tokens | integer | 4096 | 1 bis 32768 | Maximale Ausgabe-Token. |
| stop | string | - | - | Bis zu 4 Zeichenketten, bei denen das Modell aufhört, weitere Token zu generieren. |
| enable_thinking | boolean | true | - | Aktiviere das Schließen, bevor du antwortest. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Der Aufwand des Schlussfolgerungsaufwands. Keiner verhindert das Denken. Niedrige, mittlere, hohe und maximale begrenzte Denkbudgets, die auf das gewählte Modell... |
| thinking_budget | integer | 4096 | 1024 bis 32768 | Maximale Token, die für das Denken beim Denken reserviert sind, ist aktiviert. |
| top_k | integer | 20 | 1 bis 200 | Begrenze das Sampling auf die besten K Kandidatentoken, wenn sie unterstützt werden. |
| min_p | number | 0 | 0 bis 1 | Mindestwahrscheinlichkeitsschwelle für Token-Sampling. |
| frequency_penalty | number | 0 | -2 bis 2 | Strafe basiert darauf, wie oft ein Token bereits aufgetaucht ist. |
| presence_penalty | number | 0 | -2 bis 2 | Strafe für Token, die bereits im generierten Text erschienen sind. |
| repetition_penalty | number | 1 | 0.1 bis 2 | Strafe wird von SGLang verwendet, um wiederholte Texte zu reduzieren. |
| seed | integer | - | 0 bis 2147483647 | Optionaler zufälliger Seed für reproduzierbare Stichproben. |
| logprobs | boolean | false | - | Geben Sie Token-Log-Wahrscheinlichkeiten zurück, wenn sie unterstützt werden. |
Unterstützt Text-, Bild- und Videoeingabe, Streaming, Funktionstools, strukturierte JSON-Ausgabe, Seed-Steuerung und standardmäßig aktivierten Denkmodus. Verwenden Sie reasoning_effort oder thinking_budget für begrenztes Denken oder enable_thinking=falsch für direkte Antworten. Automatische Cache-Lesearten werden mit der vom Modelldienst gemeldeten Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt.
Auf EmpirioLabs wird Qwen3.5 4B nach Verbrauch abgerechnet: Eingabe $0.04 pro 1M Prompt-Token; Output $0.07 pro 1 Million generierter Token; Implizite Cache-Leseart $0.02 pro 1M zwischengespeicherten Eingabetoken. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Qwen3.5 4B unterstützt ein Kontextfenster von 256K Token mit bis zu 32.768 Ausgabe-Token pro Antwort.
Ja. Qwen3.5 4B bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID qwen3-5-4b verwendest.
Ja. Der EmpirioLabs Playground führt Qwen3.5 4B im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.