
Qwen3.6 35B A3B는 128K 문맥, 함수 도구, 엄격한 구조화된 JSON 출력을 가진 256명의 전문가 mixture-of-experts 추론 모델입니다.
Qwen3.6 35B A3B는 128K 문맥, 함수 도구, 엄격한 구조화된 JSON 출력을 가진 256명의 전문가 mixture-of-experts 추론 모델입니다.
텍스트 전용. 이 빌드는 기본 Qwen3.6 35B A3B와 달리 이미지 또는 비디오 입력을 받지 않습니다. 가중치 Escha Labs(eschalabs.com)가 Apache-2.0 하에서 Hugging Face에 EschaLabs/Qwen3.6-35B-A3B-Escha-W2 발매한 2비트 에스카모 W2 빌드에서 제공됩니다. 전문가들은 2비트로 양자화되며, 투영마다 혼합되고(gate_up_proj는 2비트, down_proj는 3비트), 밀집 계층은 int8이며, KV 캐시는 FP16입니다. Escha Labs는 동일한 모델의 FP8 기준선과의 품질 비교를 발표합니다: 수학, 대학원 과학, 도구 사용, 긴 맥락에서 패리티 이상, 광범위한 지식에서는 약 2% 낮고, 장기 범위 코드 생성에서는 약 7% 낮은데, 이것이 유일한 명백한 격차입니다. 전체 벤치마크 테이블과 프로토콜은 모델 카드를 참조하세요. Behavior 스트리밍, 함수 도구, 엄격한 스키마를 포함한 구조화된 JSON 출력, 그리고 기본적으로 Thinking 모드를 지원합니다. 직접적인 답변을 위해 enable_thinking=false로 설정하세요. thinking을 켜면 추론은 reasoning_content에, 답변은 content에 도착하므로 둘 다 읽으세요. thinking on에서는 낮은 max_tokens을 전적으로 추론에 쓸 수 있으니, 답변을 위한 여유를 남겨두세요. 캐싱 자동 프리픽스 캐시 읽기는 보고될 때 캐시 입력 속도로 청구됩니다. 명시적인 캐시 제어는 지원되지 않습니다. 스트리밍 요청을 생성 중간에 취소하면 그 시점까지 생성된 토큰만 청구됩니다.
다른 이름 EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B
qwen3-6-35b-a3b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContentqwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
Qwen3.6 35B A3B은(는) OpenAI 호환 Chat Completions API를 제공합니다. 아무 OpenAI SDK나 EmpirioLabs API 키와 함께 https://api.empiriolabs.ai/v1로 지정하고 모델 ID qwen3-6-35b-a3b를 사용하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-6-35b-a3b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)EmpirioLabs에서 Qwen3.6 35B A3B API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 ~ 2 | 샘플링 온도. 0은 결정론적이고 2는 최대 무작위성입니다. |
| top_p | number | 0.95 | 0 ~ 1 | 핵 샘플링 확률 질량. 값이 낮을수록 출력이 더 집중됩니다. |
| max_tokens | number | 4096 | 1 ~ 16384 | 최대 출력 토큰. |
| stop | string | - | - | 최대 4개의 문자열에서 모델이 더 이상 토큰 생성을 멈춥니다. |
| enable_thinking | boolean | true | - | 답변하기 전에 추론을 가능하게 하세요. |
| reasoning_effort | enum | medium | none, low, medium, high, max | 추론 노력 수준. 어떤 것도 사고를 막지 못한다. 로우, 미디엄, 하이, 최대는 선택한 모델에 맞춘 제한된 사고 예산을 설정합니다. |
| top_k | number | 20 | 1 ~ 200 | 지원되는 경우 상위 K 후보 토큰으로 샘플링을 제한하세요. |
| min_p | number | 0 | 0 ~ 1 | 토큰 샘플링의 최소 확률 임계값. |
| frequency_penalty | number | 0 | -2 ~ 2 | 토큰이 이미 등장한 빈도에 따라 벌칙이 적용됩니다. |
| presence_penalty | number | 0 | -2 ~ 2 | 생성된 텍스트에 이미 나타난 토큰에 대한 페널티가 있습니다. |
| seed | number | - | 0 ~ 2147483647 | 재현 가능한 샘플링을 위한 선택적 무작위 시드. |
| response_format | enum | - | text, json_object, json_schema | 출력을 유효한 JSON 형식으로 제한하세요. JSON 객체에 대해 JSON 모드를 사용하거나, 정확한 응답 형태를 강제하는 JSON 스키마를 제공하세요. |
| web_search_linkup | boolean | false | - | Linkup이 제공하는 선택적 웹 검색. 활성화되면 최신 웹 소스를 쿼리로 최신 사용자 메시지를 검색하여 모델에 추가 맥락으로 제공합니다. 모델의 일반적인 토큰 비용 외에 호출당 $0.013 추가 비용이 발생합니다. 기본적으로 비활성화되어 있습니다. |
| disable_formatting | boolean | false | - | 활성화되면 게이트웨이는 Linkup 웹 검색을 사용한 어시스턴트 응답에 "Sources" 풋을 추가하지 않습니다. 모델 출력이 장식이 전혀 예상되지 않는 다른 시스템으로 전송될 때 유용합니다. |
텍스트 전용. 이 빌드는 기본 Qwen3.6 35B A3B와 달리 이미지 또는 비디오 입력을 받지 않습니다. 가중치 Escha Labs(eschalabs.com)가 Apache-2.0 하에서 Hugging Face에 EschaLabs/Qwen3.6-35B-A3B-Escha-W2 발매한 2비트 에스카모 W2 빌드에서 제공됩니다. 전문가들은 2비트로 양자화되며, 투영마다 혼합되고(gate_up_proj는 2비트, down_proj는 3비트), 밀집 계층은 int8이며, KV 캐시는 FP16입니다. Escha Labs는 동일한 모델의 FP8 기준선과의 품질 비교를 발표합니다: 수학, 대학원 과학, 도구 사용, 긴 맥락에서 패리티 이상, 광범위한 지식에서는 약 2% 낮고, 장기 범위 코드 생성에서는 약 7% 낮은데, 이것이 유일한 명백한 격차입니다. 전체 벤치마크 테이블과 프로토콜은 모델 카드를 참조하세요. Behavior 스트리밍, 함수 도구, 엄격한 스키마를 포함한 구조화된 JSON 출력, 그리고 기본적으로 Thinking 모드를 지원합니다. 직접적인 답변을 위해 enable_thinking=false로 설정하세요. thinking을 켜면 추론은 reasoning_content에, 답변은 content에 도착하므로 둘 다 읽으세요. thinking on에서는 낮은 max_tokens을 전적으로 추론에 쓸 수 있으니, 답변을 위한 여유를 남겨두세요. 캐싱 자동 프리픽스 캐시 읽기는 보고될 때 캐시 입력 속도로 청구됩니다. 명시적인 캐시 제어는 지원되지 않습니다. 스트리밍 요청을 생성 중간에 취소하면 그 시점까지 생성된 토큰만 청구됩니다.
EmpirioLabs에서 Qwen3.6 35B A3B은(는) 종량제로 청구됩니다. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
Qwen3.6 35B A3B은(는) 128K 토큰 컨텍스트 윈도우를 지원합니다 (응답당 최대 16,384 출력 토큰).
네. Qwen3.6 35B A3B은(는) OpenAI 호환 Chat Completions API를 제공하므로, 기존 OpenAI SDK에서 base_url을 https://api.empiriolabs.ai/v1로 지정하고 모델 ID를 qwen3-6-35b-a3b로 설정하면 바로 동작합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Qwen3.6 35B A3B을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.