Qwen3.7 Flash ist auf EmpirioLabs verfügbar. Es ist die schnelle Stufe der Qwen3.7-Vision-Sprachreihe von Alibaba, entwickelt für multimodales Verständnis, den Einsatz von agentischen Werkzeugen und Langkontextarbeiten, mit einem 1-Millionen-Token-Kontextfenster, umschaltbarem Denken sowie Text-, Bild- und Videoeingaben. Es läuft auf einer OpenAI-kompatiblen API, sodass man durch Änderung eines Feldes darauf wechseln kann.
Wofür Qwen3.7 Flash gut ist
Flash ist die Geschwindigkeits- und Kostenstufe der Qwen3.7-Familie, daher eignet es sich für großvolumige Arbeiten, bei denen man noch echte Argumentation braucht: Dokument- und Screenshot-Verständnis, Video-Fragen, Extraktionspipelines und Agentenschleifen, die Werkzeuge aufrufen. Es liest Bilder und Videos, ruft Werkzeuge mit Standard-Funktionsaufrufen auf, gibt JSON auf Abruf zurück und kann im Web suchen, Code ausführen und URLs über integrierte Tools lesen. Sowohl ein Singapur- als auch ein China-Einsatz sind verfügbar, sodass du die Wahl wählen kannst, die zu deinen Latenz- und Preisbedürfnissen passt.
Wie man es nennt,
Senden Sie eine Standard-Chat-Komplettierung:
curl https://api.empiriolabs.ai/v1/chat/completions \ -h "Autorisierung: Inhaber $EMPIRIOLABS_API_KEY" \ -H "Inhaltstyp: application/json" \ -d '{ "model": "qwen3-7-flash", "messages": [ {"role": "user", "content": "Zusammenfassen Sie diesen Quartalsbericht" in fünf Punkten."} ] }'
Die endgültige Antwort kommt zurück Inhalt, und wenn das Denken auf ist, ist die Argumentation des Modells in reasoning content.
Kontrolliere das Denken
Das Denken ist standardmäßig aktiviert. Schalten Sie es für kurze, latenzabhängige Aufrufe aus oder legen Sie ein Budget fest, wie viele Token das Modell für Argumentation verwenden darf. Du kannst auch verwenden reasoning effort Mit keinen, niedrig, mittel, hoch oder maximal, was einem für dieses Modell großen Budget entspricht:
{ "model": "qwen3-7-flash", "messages": [{"role": "user", "content": "Plane eine Migration und bewege die Reihenfolge."}], "enable_thinking": true, "thinking_budget": 32768 }
Reasoning-Tokens werden als Ausgabetoken abgerechnet.
Bilder und Video
Geben Sie Bilder und Videos als Inhaltsteile einer Nutzernachricht zusammen mit Ihrem Text und stellen Sie dann eine Frage dazu, was sie zeigen. Sie können mehr als eine Eingabe in einer einzigen Anfrage anhängen:
{ "model": "qwen3-7-flash", "messages": [{"role": "user", "content": [ {"type": "text", "text": "was hat sich zwischen diesen beiden screenshots geändert?"}, {"type": "image_url", "image_url": {"url": "https://example.com/before.png"}}, {"type": "image_url", "image_url": {"url": "https://example.com/after.png"}} ]}] }
Eingebaute Werkzeuge
Qwen3.7 Flash wird mit Websuche, einem Web-Extractor zum Lesen von URLs, einem Code-Interpreter sowie text-to-image und image-to-image-Suche ausgeliefert. Jeder ist ein Schalter und wird nur dann abgerechnet, wenn das Modell sie tatsächlich aufruft. Web Extractor und Code Interpreter müssen aktiviert werden:
{ "model": "qwen3-7-flash", "messages": [{"role": "user", "content": "Was wurde in der neuesten Version ausgeliefert?"}], "tool_web_search": true }
Wenn Werkzeuge ausgeführt werden, trägt die Antwort ein usage.tool_usage Map neben den Token-Zählen, damit du genau prüfen kannst, was aufgerufen wurde.
Strukturierte Ausgabe und Funktionsaufruf
Verwendung response_format mit {"type": "json_object"} um ein gültiges JSON-Objekt zu erzwingen und zu passieren Werkzeuge Für Standardfunktionsaufrufe, wenn du möchtest, dass das Modell in deinen eigenen Code aufruft.
Prompt-Caching
Wiederholte Prompt-Präfixe werden automatisch zwischengespeichert, und zwischengespeicherte Eingabetoken werden mit einem deutlich geringeren Satz abgerechnet als frische Eingaben. Wenn du einen langen geteilten System-Prompt oder Dokumentkopf über viele Anfragen hinweg sendest, bekommst du diesen Rabatt, ohne etwas an deinem Code ändern zu müssen.
Regionen
Der Standard qwen3-7-flash ist der Einsatz in Singapur. qwen3-7-flash:variant1 ist der Einsatz desselben Modells in China zu niedrigeren Raten. Beide nehmen die gleichen Parameter, sodass du allein mit dem Modellfeld zwischen ihnen wechseln kannst.
Preisgestaltung
Qwen3.7 Flash ist Pay-as-you-go, berechnet pro Token. Eingabe- und Ausgaberaten werden bei kürzeren Prompts gesenkt und bei sehr langen Eingaben erhöht, zwischengespeicherte Eingaberechnungen zu einem reduzierten Tarif, und die eingebauten Tools kosten nur eine kleine Gebühr pro Anruf, wenn sie laufen. Sehen Sie sich die Live-Tarife auf der Qwen3.7 Flash-Modellseite und die preisseite, und probiere es in der spielplatz.



