Qwen3.7 Flash est disponible sur EmpirioLabs. C’est la gamme rapide de la série Qwen3.7 de la vision d’Alibaba, conçue pour la compréhension multimodale, l’utilisation d’outils agents et le travail en contexte long, avec une fenêtre de contexte de 1 million de jetons, une pensée commutable, ainsi que des entrées texte, image et vidéo. Il fonctionne sur une API compatible OpenAI, donc vous pouvez passer à elle en changeant un champ.
Ce que Qwen3.7 Flash fait bien
Flash est la gamme de vitesse et de coût de la famille Qwen3.7, donc il convient aux travaux à fort volume où vous souhaitez toujours avoir un raisonnement réel: compréhension des documents et captures d’écran, réponse vidéo aux questions, pipelines d’extraction et boucles d’agents qui appellent des outils. Il lit les images et les vidéos, appelle des outils avec des fonctions standard, renvoie du JSON à la demande, et peut rechercher sur le web, exécuter du code et lire des URL via des outils intégrés. Un déploiement singapourien et un déploiement en Chine sont disponibles, vous pouvez donc choisir celui qui correspond à vos besoins en latence et en prix.
Comment l’appeler
Envoyez une compilation de chat standard:
curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « qwen3-7-flash », « messages »: [ {"rôle »: « utilisateur », « contenu »: « Résumer le rapport de ce trimestre en cinq puces."} ] }'
La réponse finale revient Contenu, et lorsque la pensée est sur le raisonnement du modèle est dans raisonnement contenu.
Contrôler la réflexion
La réflexion est active par défaut. Désactivez-le pour les appels courts et sensibles à la latence, ou fixez un budget pour le nombre de tokens que le modèle peut dépenser en raisonnant. Vous pouvez aussi utiliser raisonnement effort avec aucun, bas, moyen, haut ou max, ce qui correspond à un budget dimensionné pour ce modèle:
{ « modèle »: « qwen3-7-flash », « messages »: [{"rôle »: « utilisateur », « contenu »: « Planifiez une migration et justifiez l’ordre."}], « enable_thinking »: vrai, « thinking_budget »: 32768 }
Les jetons de raisonnement sont présentés comme des jetons de sortie.
Images et vidéo
Passez des images et des vidéos comme éléments de contenu dans un message utilisateur en plus de votre texte, puis posez une question sur ce qu’ils affichent. Vous pouvez ajouter plus d’une entrée dans une seule requête:
{ « modèle »: « qwen3-7-flash », « messages »: [{"rôle »: « utilisateur », « contenu »: [ {"type »: « text », « texte »: « Qu’est-ce qui a changé entre ces deux captures d’écran ?"}, {"type »: « image_url », « image_url »: {"URL »: « https://example.com/before.png"}}, {"type »: « image_url », « image_url »: {"URL »: « https://example.com/after.png"}} ]}] }
Outils intégrés
Qwen3.7 Flash inclut la recherche web, un extracteur web pour lire les URL, un interpréteur de code, ainsi que la recherche text-to-image et image-to-image. Chacune est un bascule, et elles ne sont facturées que lorsque le modèle les invoque effectivement. Web Extractor et Code Interpreter doivent activer la réflexion:
{ « modèle »: « qwen3-7-flash », « messages »: [{"rôle »: « utilisateur », « contenu »: « Qu’est-ce qui a été livré dans la dernière version ?"}], « tool_web_search »: vrai }
Lorsque les outils s’exécutent, la réponse porte un usage.tool_usage Mappe-le à côté des comptes de tokens pour pouvoir auditer exactement ce qui a été invoqué.
Sortie structurée et appel de fonction
Utilisation response_format avec {"type »: « json_object"} forcer un objet JSON valide, et passer Outils Pour l’appel de fonction standard lorsque vous voulez que le modèle appelle dans votre propre code.
Mise en cache des prompts
Les préfixes répétés des prompts sont mis en cache automatiquement, et les jetons d’entrée en cache facturent à un débit bien inférieur à celui des entrées nouvelles. Si vous envoyez une longue invite système partagée ou un en-tête de document à travers de nombreuses requêtes, vous bénéficiez de cette réduction sans rien changer dans votre code.
Régions
Le défaut qwen3-7-flash est le déploiement de Singapour. qwen3-7-flash:variant1 est le déploiement par la Chine du même modèle à des taux plus faibles. Les deux utilisent les mêmes paramètres, donc on peut passer de l’un à l’autre uniquement avec le champ du modèle.
Prix
Qwen3.7 Flash est un paiement à l’usage, facturé par jeton. Les tarifs d’entrée et de sortie diminuent pour les invites courtes et augmentent pour les très longues, les factures d’entrée mises en cache à un tarif réduit, et les outils intégrés ne coûtent que de petits frais par appel lorsqu’ils fonctionnent. Voir les tarifs en direct sur le Page modèle Flash Qwen3.7 et les page de prix, et essaie dans le aire de jeux.



