Qwen3.5 4B API

Qwen3.5 4B ist ein kostengünstiges multimodales Schlussfolgerungsmodell mit 256K Kontext, Bild- und Videoeingabe, Funktionswerkzeugen und strukturierter Ausgabe.

Alibaba CloudTextgenerierung256K KontextVeröffentlicht 2. März 2026Native Inferenz

Über Qwen3.5 4B

Qwen3.5 4B ist ein kostengünstiges multimodales Schlussfolgerungsmodell mit 256K Kontext, Bild- und Videoeingabe, Funktionswerkzeugen und strukturierter Ausgabe.

Unterstützt Text-, Bild- und Videoeingabe, Streaming, Funktionstools, strukturierte JSON-Ausgabe, Seed-Steuerung und standardmäßig aktivierten Denkmodus. Verwenden Sie reasoning_effort oder thinking_budget für begrenztes Denken oder enable_thinking=falsch für direkte Antworten. Automatische Cache-Lesearten werden mit der vom Modelldienst gemeldeten Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt.

Auch bekannt als Alibaba Cloud Qwen3.5 4B

reasoningvisionvideofunction callingcachemultimodaljson modelogprobs

Qwen3.5 4B Spezifikationen

Modell-ID
qwen3-5-4b
Anbieter
Alibaba Cloud
Kategorie
Textgenerierung
Veröffentlicht
2. März 2026
Kontextfenster
256K Token
Max. Ausgabe
32.768 Token
Eingabe
TextBildVideo
Ausgabe
Text
Strukturierte Ausgabe
JSON Schema
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-5-4b:generateContent
Alternative Modell-IDs
qwen3.5-4b

Qwen3.5 4B API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M Prompt-Token
$0.04
Ausgabe
pro 1 Million generierter Token
$0.07
Implizite Cache-Leseart
pro 1M zwischengespeicherten Eingabetoken
$0.02
Websuche (Linkup)
pro Aufruf beim Aufruf
$0.013
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen3.5 4B API auf

Qwen3.5 4B bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID qwen3-5-4b. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-5-4b",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-5-4b",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Vollständige Qwen3.5 4B API-Referenz

Qwen3.5 4B API-Parameter

Request-Parameter, die die Qwen3.5 4B API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
temperaturenumber0.70 bis 2Temperatur wird geprochen. 0 ist deterministisch und 2 ist maximale Zufälligkeit.
top_pnumber0.950 bis 1Kernprobenwahrscheinlichkeitsmasse. Niedrigere Werte machen die Ausgaben fokussierter.
max_tokensinteger40961 bis 32768Maximale Ausgabe-Token.
stopstring--Bis zu 4 Zeichenketten, bei denen das Modell aufhört, weitere Token zu generieren.
enable_thinkingbooleantrue-Aktiviere das Schließen, bevor du antwortest.
reasoning_effortenummediumnone, low, medium, high, maxDer Aufwand des Schlussfolgerungsaufwands. Keiner verhindert das Denken. Niedrige, mittlere, hohe und maximale begrenzte Denkbudgets, die auf das gewählte Modell...
thinking_budgetinteger40961024 bis 32768Maximale Token, die für das Denken beim Denken reserviert sind, ist aktiviert.
top_kinteger201 bis 200Begrenze das Sampling auf die besten K Kandidatentoken, wenn sie unterstützt werden.
min_pnumber00 bis 1Mindestwahrscheinlichkeitsschwelle für Token-Sampling.
frequency_penaltynumber0-2 bis 2Strafe basiert darauf, wie oft ein Token bereits aufgetaucht ist.
presence_penaltynumber0-2 bis 2Strafe für Token, die bereits im generierten Text erschienen sind.
repetition_penaltynumber10.1 bis 2Strafe wird von SGLang verwendet, um wiederholte Texte zu reduzieren.
seedinteger-0 bis 2147483647Optionaler zufälliger Seed für reproduzierbare Stichproben.
logprobsbooleanfalse-Geben Sie Token-Log-Wahrscheinlichkeiten zurück, wenn sie unterstützt werden.
8 weitere Parameter in den Docs

Gut zu wissen

Unterstützt Text-, Bild- und Videoeingabe, Streaming, Funktionstools, strukturierte JSON-Ausgabe, Seed-Steuerung und standardmäßig aktivierten Denkmodus. Verwenden Sie reasoning_effort oder thinking_budget für begrenztes Denken oder enable_thinking=falsch für direkte Antworten. Automatische Cache-Lesearten werden mit der vom Modelldienst gemeldeten Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt.

Qwen3.5 4B API: häufige Fragen

Wie viel kostet die Qwen3.5 4B API?

Auf EmpirioLabs wird Qwen3.5 4B nach Verbrauch abgerechnet: Eingabe $0.04 pro 1M Prompt-Token; Output $0.07 pro 1 Million generierter Token; Implizite Cache-Leseart $0.02 pro 1M zwischengespeicherten Eingabetoken. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von Qwen3.5 4B?

Qwen3.5 4B unterstützt ein Kontextfenster von 256K Token mit bis zu 32.768 Ausgabe-Token pro Antwort.

Ist die Qwen3.5 4B API OpenAI-kompatibel?

Ja. Qwen3.5 4B bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID qwen3-5-4b verwendest.

Kann ich Qwen3.5 4B im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt Qwen3.5 4B im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen Qwen3.5 4B API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.