Qwen3.6 35B A3B API

Qwen3.6 35B A3B ist ein 256-fachkundiges mixture-of-experts Schlussfolgermodell mit 128K Kontext, Funktionswerkzeugen und streng strukturierter JSON-Ausgabe.

Alibaba CloudTextgenerierung128K KontextVeröffentlicht 16. Apr. 2026Native InferenzNeu

Über Qwen3.6 35B A3B

Qwen3.6 35B A3B ist ein 256-fachkundiges mixture-of-experts Schlussfolgermodell mit 128K Kontext, Funktionswerkzeugen und streng strukturierter JSON-Ausgabe.

Nur Text. Dieser Build akzeptiert keine Bild- oder Videoeingänge, im Gegensatz zum Basis-Qwen3.6 35B A3B. Gewichte Bedient aus dem 2-Bit-Eschamoe W2-Build, veröffentlicht von Escha Labs (eschalabs.com) als EschaLabs/Qwen3.6-35B-A3B-Escha-W2 auf Hugging Face, unter Apache-2.0. Die Experten sind auf 2 Bits quantisiert, gemischt pro Projektion (gate_up_proj bei 2-Bit und down_proj bei 3-Bit), die dichten Schichten sind int8, und der KV-Cache ist FP16. Escha Labs veröffentlicht den Qualitätsvergleich mit einer FP8-Basislinie desselben Modells: Parität oder besser bei Mathematik, Graduiertenwissenschaften, Werkzeugnutzung und Langzeitkontext, etwa 2 Prozent niedriger bei umfassendem Wissen und etwa 7 Prozent niedriger bei der Langzeit-Codegenerierung, was die eine klare Lücke darstellt. Siehe die Modellkarte für die vollständige Benchmark-Tabelle und das Protokoll. Behavior Unterstützt Streaming, Funktionstools, strukturierte JSON-Ausgabe einschließlich strikter Schemata und standardmäßig aktivierten Denkmodus. Setze enable_thinking=falsch für direkte Antworten. Mit weiterem Nachdenken kommt die Begründung in reasoning_content und die Antwort inhaltlich, also lies beides. Ein niedriger max_tokens mit Nachdenken kann vollständig für das Denken verwendet werden, also lassen Sie Raum für die Antwort. Caching Automatische Prefix-Cache-Reads werden bei der Meldung mit der cached-Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt. Das Stornieren einer Streaming-Anfrage während der Generation berechnet nur die bis zu diesem Zeitpunkt produzierten Token.

Auch bekannt als EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B

reasoningfunction callingjson modecache

Qwen3.6 35B A3B Spezifikationen

Modell-ID
qwen3-6-35b-a3b
Autor
Alibaba Cloud
Kategorie
Textgenerierung
Veröffentlicht
16. Apr. 2026
Kontextfenster
128K Token
Max. Ausgabe
16.384 Token
Eingabe
Text
Ausgabe
Text
Strukturierte Ausgabe
JSON Schema
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContent
Alternative Modell-IDs
qwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2

Qwen3.6 35B A3B API-PreiseSpare bis zu 72%

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M Prompt-Token
$0.248$0.07
Ausgabe
pro 1 Million generierter Token
$1.485$0.42
Implizite Cache-Leseart
pro 1M zwischengespeicherten Eingabetoken
$0.035
Websuche (Linkup)
pro Aufruf beim Aufruf
$0.013
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen3.6 35B A3B API auf

Qwen3.6 35B A3B bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID qwen3-6-35b-a3b. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-6-35b-a3b",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-6-35b-a3b",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Vollständige Qwen3.6 35B A3B API-Referenz

Qwen3.6 35B A3B API-Parameter

Request-Parameter, die die Qwen3.6 35B A3B API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
temperaturenumber0.70 bis 2Temperatur wird geprochen. 0 ist deterministisch und 2 ist maximale Zufälligkeit.
top_pnumber0.950 bis 1Kernprobenwahrscheinlichkeitsmasse. Niedrigere Werte machen die Ausgaben fokussierter.
max_tokensnumber40961 bis 16384Maximale Ausgabe-Token.
stopstring--Bis zu 4 Zeichenketten, bei denen das Modell aufhört, weitere Token zu generieren.
enable_thinkingbooleantrue-Aktiviere das Schließen, bevor du antwortest.
reasoning_effortenummediumnone, low, medium, high, maxDer Aufwand des Schlussfolgerungsaufwands. Keiner verhindert das Denken. Niedrige, mittlere, hohe und maximale begrenzte Denkbudgets, die auf das gewählte Modell...
top_knumber201 bis 200Begrenze das Sampling auf die besten K Kandidatentoken, wenn sie unterstützt werden.
min_pnumber00 bis 1Mindestwahrscheinlichkeitsschwelle für Token-Sampling.
frequency_penaltynumber0-2 bis 2Strafe basiert darauf, wie oft ein Token bereits aufgetaucht ist.
presence_penaltynumber0-2 bis 2Strafe für Token, die bereits im generierten Text erschienen sind.
seednumber-0 bis 2147483647Optionaler zufälliger Seed für reproduzierbare Stichproben.
response_formatenum-text, json_object, json_schemaBeschränkt die Ausgabe auf gültiges JSON. Verwenden Sie den JSON-Modus für jedes JSON-Objekt oder stellen Sie ein JSON-Schema bereit, um eine exakte Antwortform zu...
web_search_linkupbooleanfalse-Optionale Websuche, betrieben von Linkup. Wenn aktiviert, werden aktuelle Webquellen mit Ihrer neuesten Benutzernachricht als Abfrage abgerufen und dem Modell als zusätzlicher Kontext bereitgestellt. Fügt $0.013 pro Aufruf hinzu, wenn er aufgerufen wird, zusätzlich zu den normalen Tokenkosten des Modells. Standardmäßig deaktiviert.
disable_formattingbooleanfalse-Wenn aktiviert, fügt das Gateway den "Sources"-Footer nicht an Assistant-Antworten an, die die Linkup-Websuche verwendet haben. Nützlich, wenn die Modellausgabe an...

Gut zu wissen

Nur Text. Dieser Build akzeptiert keine Bild- oder Videoeingänge, im Gegensatz zum Basis-Qwen3.6 35B A3B. Gewichte Bedient aus dem 2-Bit-Eschamoe W2-Build, veröffentlicht von Escha Labs (eschalabs.com) als EschaLabs/Qwen3.6-35B-A3B-Escha-W2 auf Hugging Face, unter Apache-2.0. Die Experten sind auf 2 Bits quantisiert, gemischt pro Projektion (gate_up_proj bei 2-Bit und down_proj bei 3-Bit), die dichten Schichten sind int8, und der KV-Cache ist FP16. Escha Labs veröffentlicht den Qualitätsvergleich mit einer FP8-Basislinie desselben Modells: Parität oder besser bei Mathematik, Graduiertenwissenschaften, Werkzeugnutzung und Langzeitkontext, etwa 2 Prozent niedriger bei umfassendem Wissen und etwa 7 Prozent niedriger bei der Langzeit-Codegenerierung, was die eine klare Lücke darstellt. Siehe die Modellkarte für die vollständige Benchmark-Tabelle und das Protokoll. Behavior Unterstützt Streaming, Funktionstools, strukturierte JSON-Ausgabe einschließlich strikter Schemata und standardmäßig aktivierten Denkmodus. Setze enable_thinking=falsch für direkte Antworten. Mit weiterem Nachdenken kommt die Begründung in reasoning_content und die Antwort inhaltlich, also lies beides. Ein niedriger max_tokens mit Nachdenken kann vollständig für das Denken verwendet werden, also lassen Sie Raum für die Antwort. Caching Automatische Prefix-Cache-Reads werden bei der Meldung mit der cached-Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt. Das Stornieren einer Streaming-Anfrage während der Generation berechnet nur die bis zu diesem Zeitpunkt produzierten Token.

Qwen3.6 35B A3B API: häufige Fragen

Wie viel kostet die Qwen3.6 35B A3B API?

Auf EmpirioLabs wird Qwen3.6 35B A3B nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von Qwen3.6 35B A3B?

Qwen3.6 35B A3B unterstützt ein Kontextfenster von 128K Token mit bis zu 16.384 Ausgabe-Token pro Antwort.

Ist die Qwen3.6 35B A3B API OpenAI-kompatibel?

Ja. Qwen3.6 35B A3B bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID qwen3-6-35b-a3b verwendest.

Kann ich Qwen3.6 35B A3B im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt Qwen3.6 35B A3B im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen Qwen3.6 35B A3B API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.