Accueil Blog

Comment utiliser l’API Flash Qwen3.8

Comment utiliser l’API Flash Qwen3.8

Aug 26, 2026

EmpirioLabs AI

Qwen3.8 Flash est le tout nouveau modèle multimodal de la famille Qwen3.8 d’Alibaba, sorti le 26 août 2026, conçu pour un travail rapide et économique en codage, agents et vision. Il associe un contexte de jeton 1M à une compréhension du texte, de l’image et de la vidéo, une réflexion approfondie activée par défaut, et les mêmes cinq outils intégrés que Qwen3.8 Max.

Qwen3.8 Flash est disponible aujourd’hui sur EmpirioLabs via une API compatible OpenAI, avec appels de fonctions, sortie structurée strictement JSON Schema, streaming et jusqu’à 128K jetons de sortie. Essaie-le dans le aire de jeux ou appelez-le d'un client compatible OpenAI. L'ensemble de la spec et les taux actuels vivent sur le Page modèle Flash Qwen3.8 et les Docs API.

Prix

La facturation est basée sur l’utilisation avec un taux d’entrée et un taux de sortie fixe à chaque taille de prompt, et il n’y a pas de niveau de cache séparé. La recherche web, la recherche text-to-image et la recherche image-to-image ajoutent un petit frais par appel qui ne s’applique que lorsqu’un appel est effectivement lancé; L’extracteur web et l’interpréteur de code fonctionnent sans frais supplémentaires. Les tarifs actuels sont toujours en cours page modèle et les page de prix, qui restent en phase avec ce qui vous est facturé.

Démarrer rapidement

Pointez n'importe quel SDK OpenAI à l'URL de base d'EmpirioLabs et passez qwen3-8-flash comme modèle:

depuis openai import OpenAI client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY »,) resp = client.chat.completions.create(model="qwen3-8-flash », messages=[ {"role »: « user », « content »: [ {"type »: « text », « text »: « Que se passe-t-il dans ce graphique ?"}, {"type »: « image_url », « image_url »: {"url »: « https://example.com/chart.png"}}, ]}, ], extra_body={"enable_thinking »: True, « thinking_budget »: 8192},) print(resp.choices[0].message.content)

Le même modèle d’ID fonctionne /v1/responses, la forme anthropique /v1/messages, et le modèle compatible Google /v1beta/models/qwen3-8-flash:générer du contenu Route. L’id alternatif qwen3.8-flash se résout selon le même modèle.

Réflexion

La réflexion profonde est activée par défaut et revient en courant comme raisonnement contenu Avec la réponse. Contrôlez-le avec considérer et thinking_budget (jusqu’à 262 144 jetons), ou envoyer raisonnement effort et la plateforme l’associe à un budget adapté au modèle. Les jetons pensants facturent comme des jetons de sortie, donc désactivez la pensée ou fixez un petit budget pour des tours courts et sensibles à la latence.

Outils intégrés

Cinq outils intégrés roulent derrière tool_* Basculements: tool_web_search, tool_web_extractor, tool_code_interpreter, tool_web_search_image, et tool_image_search. L’extracteur web nécessite une recherche web, et l’extracteur ainsi que l’interpréteur de code s’exécutent uniquement lorsque la réflexion est activée. Quand les outils s’exécutent, la réponse est usage.tool_usage MAP indique exactement combien d’appels ont été effectués, afin que vous puissiez auditer la facturation par outil.

Sortie structurée

Pour une forme de réponse exacte, passez response_format avec {"type »: « json_schema »,...} et « strict »: vrai: le modèle retourne exactement les clés du schéma sans supplémentaires. Mode JSON simple avec {"type »: « json_object"} est également pris en charge.

Des choses qui valent la peine d’être connues avant votre premier appel

  • Les cinq outils intégrés sont par défaut activés, et les recherches facturent par appel invoqué. Une seule requête peut effectuer plusieurs recherches web, et chaque invocation est facturée. Pour un chat simple, sans frais d’outils, définissez tool_web_search, tool_web_search_image, et tool_image_search à faux.
  • tool_choice: « obligatoire » ne fonctionne pas tant que la réflexion est activée. La demande est rejetée avec une erreur évidente. Garde tool_choice: « auto » avec pensée activée, ou définie enable_thinking: faux Quand il faut forcer un appel de fonction.
  • Le mode JSON nécessite le mot « json » dans vos messages. A {"type »: « json_object"} La demande est rejetée à moins que le mot n’apparaisse quelque part dans la conversation. Les requêtes de schéma JSON n’ont pas cette exigence.

Qwen3.8 Flash est disponible dès maintenant dans le aire de jeux et à travers le EmpirioLabs API.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.