블로그

Qwen3.8 플래시 API 사용 방법

Qwen3.8 플래시 API 사용 방법

Aug 26, 2026

EmpirioLabs AI

Qwen3.8 플래시는 알리바바의 Qwen3.8 계열 중 최신 멀티모달 모델로, 2026년 8월 26일에 출시되었으며, 빠르고 저비용의 코딩, 에이전트, 비전 작업을 위해 설계되었습니다. 1M 토큰 컨텍스트와 텍스트, 이미지, 비디오 이해, 기본 켜진 깊은 사고, 그리고 Qwen3.8 Max와 동일한 다섯 가지 내장 도구를 결합합니다.

Qwen3.8 플래시는 오늘 EmpirioLabs에서 OpenAI 호환 API를 통해 기능, 엄격한 JSON 스키마 구조화 출력, 스트리밍, 최대 128K 출력 토큰을 지원합니다. 한번 해봐. 뚱 베어 또는 OpenAI 호환 클라이언트에서 호출. 전체 사양과 현재 비율은 Qwen3.8 플래시 모델 페이지 그리고 API 문서·.

제품정보

청구는 사용량 기반으로, 각 프롬프트 크기마다 고정 입력 속도와 고정 출력 비율이 있으며, 별도의 캐시 계층이 없습니다. 웹 검색, text-to-image 검색, image-to-image 검색은 통화당 소액의 수수료를 추가하며, 이는 실제로 통화가 진행될 때만 적용됩니다; 웹 추출기와 코드 인터프리터는 추가 비용 없이 작동합니다. 현재 요율은 항상 모델 페이지 그리고 가격표, 당신이 청구 된 것과 동기화에 머물.

퀵스타트

EmpirioLabs 기본 URL에서 OpenAI SDK를 포인트로 전달 qwen3-8-flash 모형으로:

openai로부터 가져오기 OpenAI 클라이언트 = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "이 차트에서 무슨 일이 일어나고 있나?"}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}, ], ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)

동일 모델에서 id가 작동합니다 /v1/responses 에, 인류형 /v1/messages 에, 그리고 구글 호환 /v1beta/models/qwen3-8-flash:생성 콘텐츠 경로. 대체 ID QWEN3.8-플래시 동일한 모델로 해결됩니다.

사고

딥 싱킹은 기본적으로 켜져 있고 스트리밍으로 돌아옵니다 사이트 맵 답변과 함께. 다음으로 제어합니다 enable thinking을 활성화 그리고 thinking_budget (최대 262,144개의 토큰까지), 또는 전송 이유 effort 플랫폼은 모델을 예산 크기에 매핑합니다. 생각하는 토큰은 출력 토큰으로 청구되므로, 생각을 비활성화하거나 짧고 지연에 민감한 턴에 대한 작은 예산을 설정하세요.

내장 도구

내장 공구 다섯 개가 뒤에 탑승해 tool_* 토글: tool_web_search 에·, tool_web_extractor·, tool_code_interpreter·, tool_web_search_image, 그리고 tool_image_search. 웹 익스트랙터는 웹 검색이 필요하며, 익스트랙터와 코드 인터프리터 모두 사고가 활성화된 상태에서만 실행됩니다. 도구가 실행될 때, 반응은 usage.tool_usage Map은 정확히 몇 건의 통화가 이루어졌는지 보고하므로, 도구별 청구 감사를 할 수 있습니다.

통합 출력

정확한 응답 형태를 원한다면 패스 response_format 이름 * {"type": "json_schema",...} 그리고 "엄격": 참: 모델은 스키마의 키를 정확히 반환하며 추가 요소 없이 반환합니다. 일반 JSON 모드 {"type": "json_object"} 또한 지원됩니다.

첫 통화 전에 알아야 할 사항들

  • 내장 다섯 가지 도구 모두 기본적으로 켜져 있으며, 호출된 통화당 청구서를 검색합니다. 단일 요청은 웹 검색을 여러 번 실행할 수 있으며, 각 호출마다 청구됩니다. 공구 비용 없이 평범한 채팅을 원한다면, 셋 tool_web_search 에·, tool_web_search_image, 그리고 tool_image_search거짓·.
  • tool_choice: "필수" 생각이 켜져 있을 때는 작동하지 않습니다. 요청은 명백한 오류와 함께 거절됩니다. 지키세요 tool_choice: "자동" 생각이 활성화된 상태, 또는 설정된 상태에서 enable_thinking: 거짓 함수 호출을 강제해야 할 때.
  • JSON 모드는 메시지에 "json"이라는 단어가 있어야 합니다. A {"type": "json_object"} 요청은 대화 중 어딘가에 단어가 나타나지 않는 한 거부됩니다. JSON 스키마 요청에는 그런 요구사항이 없습니다.

Qwen3.8 플래시는 현재 뚱 베어 그리고 EmpirioLabs API·.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.