
Qwen3.6 35B A3B ist ein 256-fachkundiges mixture-of-experts Schlussfolgermodell mit 128K Kontext, Funktionswerkzeugen und streng strukturierter JSON-Ausgabe.
Qwen3.6 35B A3B ist ein 256-fachkundiges mixture-of-experts Schlussfolgermodell mit 128K Kontext, Funktionswerkzeugen und streng strukturierter JSON-Ausgabe.
Nur Text. Dieser Build akzeptiert keine Bild- oder Videoeingänge, im Gegensatz zum Basis-Qwen3.6 35B A3B. Gewichte Bedient aus dem 2-Bit-Eschamoe W2-Build, veröffentlicht von Escha Labs (eschalabs.com) als EschaLabs/Qwen3.6-35B-A3B-Escha-W2 auf Hugging Face, unter Apache-2.0. Die Experten sind auf 2 Bits quantisiert, gemischt pro Projektion (gate_up_proj bei 2-Bit und down_proj bei 3-Bit), die dichten Schichten sind int8, und der KV-Cache ist FP16. Escha Labs veröffentlicht den Qualitätsvergleich mit einer FP8-Basislinie desselben Modells: Parität oder besser bei Mathematik, Graduiertenwissenschaften, Werkzeugnutzung und Langzeitkontext, etwa 2 Prozent niedriger bei umfassendem Wissen und etwa 7 Prozent niedriger bei der Langzeit-Codegenerierung, was die eine klare Lücke darstellt. Siehe die Modellkarte für die vollständige Benchmark-Tabelle und das Protokoll. Behavior Unterstützt Streaming, Funktionstools, strukturierte JSON-Ausgabe einschließlich strikter Schemata und standardmäßig aktivierten Denkmodus. Setze enable_thinking=falsch für direkte Antworten. Mit weiterem Nachdenken kommt die Begründung in reasoning_content und die Antwort inhaltlich, also lies beides. Ein niedriger max_tokens mit Nachdenken kann vollständig für das Denken verwendet werden, also lassen Sie Raum für die Antwort. Caching Automatische Prefix-Cache-Reads werden bei der Meldung mit der cached-Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt. Das Stornieren einer Streaming-Anfrage während der Generation berechnet nur die bis zu diesem Zeitpunkt produzierten Token.
Auch bekannt als EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B
qwen3-6-35b-a3b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContentqwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Qwen3.6 35B A3B bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID qwen3-6-35b-a3b. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-6-35b-a3b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Request-Parameter, die die Qwen3.6 35B A3B API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 bis 2 | Temperatur wird geprochen. 0 ist deterministisch und 2 ist maximale Zufälligkeit. |
| top_p | number | 0.95 | 0 bis 1 | Kernprobenwahrscheinlichkeitsmasse. Niedrigere Werte machen die Ausgaben fokussierter. |
| max_tokens | number | 4096 | 1 bis 16384 | Maximale Ausgabe-Token. |
| stop | string | - | - | Bis zu 4 Zeichenketten, bei denen das Modell aufhört, weitere Token zu generieren. |
| enable_thinking | boolean | true | - | Aktiviere das Schließen, bevor du antwortest. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Der Aufwand des Schlussfolgerungsaufwands. Keiner verhindert das Denken. Niedrige, mittlere, hohe und maximale begrenzte Denkbudgets, die auf das gewählte Modell... |
| top_k | number | 20 | 1 bis 200 | Begrenze das Sampling auf die besten K Kandidatentoken, wenn sie unterstützt werden. |
| min_p | number | 0 | 0 bis 1 | Mindestwahrscheinlichkeitsschwelle für Token-Sampling. |
| frequency_penalty | number | 0 | -2 bis 2 | Strafe basiert darauf, wie oft ein Token bereits aufgetaucht ist. |
| presence_penalty | number | 0 | -2 bis 2 | Strafe für Token, die bereits im generierten Text erschienen sind. |
| seed | number | - | 0 bis 2147483647 | Optionaler zufälliger Seed für reproduzierbare Stichproben. |
| response_format | enum | - | text, json_object, json_schema | Beschränkt die Ausgabe auf gültiges JSON. Verwenden Sie den JSON-Modus für jedes JSON-Objekt oder stellen Sie ein JSON-Schema bereit, um eine exakte Antwortform zu... |
| web_search_linkup | boolean | false | - | Optionale Websuche, betrieben von Linkup. Wenn aktiviert, werden aktuelle Webquellen mit Ihrer neuesten Benutzernachricht als Abfrage abgerufen und dem Modell als zusätzlicher Kontext bereitgestellt. Fügt $0.013 pro Aufruf hinzu, wenn er aufgerufen wird, zusätzlich zu den normalen Tokenkosten des Modells. Standardmäßig deaktiviert. |
| disable_formatting | boolean | false | - | Wenn aktiviert, fügt das Gateway den "Sources"-Footer nicht an Assistant-Antworten an, die die Linkup-Websuche verwendet haben. Nützlich, wenn die Modellausgabe an... |
Nur Text. Dieser Build akzeptiert keine Bild- oder Videoeingänge, im Gegensatz zum Basis-Qwen3.6 35B A3B. Gewichte Bedient aus dem 2-Bit-Eschamoe W2-Build, veröffentlicht von Escha Labs (eschalabs.com) als EschaLabs/Qwen3.6-35B-A3B-Escha-W2 auf Hugging Face, unter Apache-2.0. Die Experten sind auf 2 Bits quantisiert, gemischt pro Projektion (gate_up_proj bei 2-Bit und down_proj bei 3-Bit), die dichten Schichten sind int8, und der KV-Cache ist FP16. Escha Labs veröffentlicht den Qualitätsvergleich mit einer FP8-Basislinie desselben Modells: Parität oder besser bei Mathematik, Graduiertenwissenschaften, Werkzeugnutzung und Langzeitkontext, etwa 2 Prozent niedriger bei umfassendem Wissen und etwa 7 Prozent niedriger bei der Langzeit-Codegenerierung, was die eine klare Lücke darstellt. Siehe die Modellkarte für die vollständige Benchmark-Tabelle und das Protokoll. Behavior Unterstützt Streaming, Funktionstools, strukturierte JSON-Ausgabe einschließlich strikter Schemata und standardmäßig aktivierten Denkmodus. Setze enable_thinking=falsch für direkte Antworten. Mit weiterem Nachdenken kommt die Begründung in reasoning_content und die Antwort inhaltlich, also lies beides. Ein niedriger max_tokens mit Nachdenken kann vollständig für das Denken verwendet werden, also lassen Sie Raum für die Antwort. Caching Automatische Prefix-Cache-Reads werden bei der Meldung mit der cached-Eingaberate berechnet. Explizite Cache-Kontrollen werden nicht unterstützt. Das Stornieren einer Streaming-Anfrage während der Generation berechnet nur die bis zu diesem Zeitpunkt produzierten Token.
Auf EmpirioLabs wird Qwen3.6 35B A3B nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Qwen3.6 35B A3B unterstützt ein Kontextfenster von 128K Token mit bis zu 16.384 Ausgabe-Token pro Antwort.
Ja. Qwen3.6 35B A3B bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID qwen3-6-35b-a3b verwendest.
Ja. Der EmpirioLabs Playground führt Qwen3.6 35B A3B im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.