Qwen3.7 Flash API

Schnelles Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Werkzeugnutzung und agentische Aufgaben, mit implizitem Caching und einem 1M Token-Kontext.

Alibaba CloudTextgenerierung1M KontextVeröffentlicht 15. Juli 2026SingaporeProprietärer EndpointNeu

Über Qwen3.7 Flash

Schnelles Qwen3.7 Vision-Sprachmodell für Text, Bild, Video, Werkzeugnutzung und agentische Aufgaben, mit implizitem Caching und einem 1M Token-Kontext.

Unterstützt Text-, Bild- und Videoeingaben, den Denkmodus mit enable_thinking und thinking_budget bis zu 131072 Tokens, Funktionsaufrufe, strukturierte Ausgabe, Websuche, Webextraktor, Code-Interpreter, Bildersuchwerkzeuge, Präfixfortsetzung und implizites Kontext-Caching. Websuch- und Bildsuchwerkzeuge werden pro aufgerufenem Aufruf abgerechnet. Thinking Tokens werden als Output Tokens beworben.

Auch bekannt als Alibaba Cloud Qwen3.7 Flash, Qwen3.7-Flash, qwen3-7-flash

reasoningvisionvideoweb searchcode interpreterfunction callingprefix continuationcacheagentic coding

Qwen3.7 Flash Spezifikationen

Modell-ID
qwen3-7-flash
Anbieter
Alibaba Cloud
Kategorie
Textgenerierung
Veröffentlicht
15. Juli 2026
Kontextfenster
1M Token
Max. Ausgabe
65.536 Token
Eingabe
TextBildVideo
Ausgabe
Text
Strukturierte Ausgabe
JSON-Modus
Region
Singapore
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/qwen3-7-flash:generateContent
Alternative Modell-IDs
qwen3.7-flash

Qwen3.7 Flash API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M Prompt-Token
<=32K $0.0332K-256K $0.10256K-1M $0.20
Ausgabe
pro 1 Million generierter Token
<=32K $0.1332K-256K $0.40256K-1M $0.80
Implizite Cache-Leseart
pro 1M zwischengespeicherten Eingabetoken
<=32K $0.00632K-256K $0.02256K-1M $0.04
Web-Suche
pro Aufruf beim Aufruf
$0.03
Text-zu-Bild-Suche
pro Aufruf beim Aufruf
$0.03
Bild-zu-Bild-Suche
pro Aufruf beim Aufruf
$0.03
Netzextraktor
pro Aufruf beim Aufruf
$0.00
Code-Interpreter
pro Aufruf beim Aufruf
$0.00
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen3.7 Flash API auf

Qwen3.7 Flash bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID qwen3-7-flash. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-7-flash",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-7-flash",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Vollständige Qwen3.7 Flash API-Referenz

Qwen3.7 Flash API-Parameter

Request-Parameter, die die Qwen3.7 Flash API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
temperaturenumber0.70 bis 2Temperatur wird geprochen. 0 ist deterministisch und 2 ist maximale Zufälligkeit.
top_pnumber0.90 bis 1Kernprobenwahrscheinlichkeitsmasse. Niedrigere Werte machen die Ausgaben fokussierter.
max_tokensnumber40961 bis 65536Maximale Ausgabe-Token.
stopstring--Bis zu 4 Zeichenketten, bei denen das Modell aufhört, weitere Token zu generieren.
enable_thinkingbooleantrue-Aktiviere das Schließen, bevor du antwortest.
reasoning_effortenummediumnone, low, medium, high, maxDer Aufwand des Schlussfolgerungsaufwands. Keiner verhindert das Denken. Niedrige, mittlere, hohe und maximale begrenzte Denkbudgets, die auf das gewählte Modell...
thinking_budgetnumber327681 bis 131072Maximale Token, die für das Denken beim Denken reserviert sind, ist aktiviert.
vl_high_resolution_imagesbooleantrue-Verwenden Sie eine höher aufgelöste Verarbeitung für Bildeingaben.
max_pixelsnumber26214404096 bis 16777216Maximale Pixelanzahl pro Bild, wenn hochauflösende Verarbeitung deaktiviert ist.
video_fpsnumber20.1 bis 10Bilder pro Sekunde, um von Videoeingängen abzutasten.
treat_images_as_videobooleanfalse-Behandle eine Abfolge von Bildern als Videoframes.
tool_web_searchbooleantrue-Suchen Sie im Internet nach Echtzeitinformationen. Fügt $0.03 die Anfragekosten für jeden aufgerufenen Aufruf hinzu.
tool_web_extractorbooleantrue-Extrahieren und lesen Sie Inhalte aus URLs. Erfordert Websuche und Nachdenken.
tool_code_interpreterbooleantrue-Führe Python-Code in einer Sandbox aus. Erfordert Nachdenken.
4 weitere Parameter in den Docs

Gut zu wissen

Die Token-Preisgestaltung ist nach Prompt-Größe abgestuft und steigt über 32K und erneut über 256K Eingabetoken. Zwischengespeicherte Prompt-Token werden zum impliziten Cache-Tarif für die entsprechende Stufe berechnet. Websuche, Text-zu-Bild-Suche und Bild-zu-Bild-Suche werden nur beim Aufruf abgerechnet. Text-zu-Bild-Suche und Bild-zu-Bild-Suche verwenden die Preiszeile für Bildersuche. Thinking Tokens werden als Output Tokens beworben.

Per-tool billing (usage.tool_usage)

When this model invokes built-in tools inside a single request, the response carries a normalized usage.tool_usage map alongside the token counts. Tool counts are already factored into cost_usd and are surfaced for transparency.

:variant1

China-Preise sind im Vergleich zu Singapur günstiger. Die Token-Preisgestaltung ist nach Prompt-Größe abgestuft und steigt über 32K und erneut über 256K Eingabetoken. Implizite Cache-Eingabe verwendet die Zeile mit gecachtem Token. Websuche, Text-zu-Bild-Suche und Bild-zu-Bild-Suche werden nur beim Aufruf abgerechnet. Text-zu-Bild-Suche und Bild-zu-Bild-Suche verwenden die Preiszeile für Bildersuche. China Pay-Tool Calls sind jeweils $0.01. Thinking Tokens werden als Output Tokens beworben.

Qwen3.7 Flash Varianten

Varianten sind alternative Versionen von Qwen3.7 Flash mit eigener Modell-ID. Je nach Variante können sich Serving-Region, Preise oder unterstützte Parameter unterscheiden; alles andere funktioniert gleich.

Qwen3.7 Flash :variant1Spare bis zu 18%

Modell-ID
qwen3-7-flash:variant1
Region
China
Kontextfenster
1M Token
Strukturierte Ausgabe
JSON-Modus
Typ
Spezifikation
Preis
Eingabe
pro 1M Prompt-Token
$0.03<=32K $0.028$0.1032K-256K $0.083$0.20256K-1M $0.165
Ausgabe
pro 1 Million generierter Token
$0.13<=32K $0.11$0.4032K-256K $0.33$0.80256K-1M $0.66
Implizite Cache-Leseart
pro 1M zwischengespeicherten Eingabetoken
<=32K $0.006$0.0232K-256K $0.017$0.04256K-1M $0.033
Web-Suche
pro Aufruf beim Aufruf
$0.01
Text-zu-Bild-Suche
pro Aufruf beim Aufruf
$0.01
Bild-zu-Bild-Suche
pro Aufruf beim Aufruf
$0.01
Netzextraktor
pro Aufruf beim Aufruf
$0.00
Code-Interpreter
pro Aufruf beim Aufruf
$0.00
:variant1 im Playground testen

Qwen3.7 Flash API: häufige Fragen

Wie viel kostet die Qwen3.7 Flash API?

Auf EmpirioLabs wird Qwen3.7 Flash nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von Qwen3.7 Flash?

Qwen3.7 Flash unterstützt ein Kontextfenster von 1M Token mit bis zu 65.536 Ausgabe-Token pro Antwort.

Ist die Qwen3.7 Flash API OpenAI-kompatibel?

Ja. Qwen3.7 Flash bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID qwen3-7-flash verwendest.

Welche Qwen3.7 Flash Varianten sind verfügbar?

Qwen3.7 Flash ist als 2 Modell-IDs verfügbar: der Standard qwen3-7-flash plus qwen3-7-flash:variant1 (China). Varianten können sich in Serving-Region, Preisen oder unterstützten Parametern unterscheiden; die Preistabellen stehen auf dieser Seite.

Kann ich Qwen3.7 Flash im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt Qwen3.7 Flash im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen Qwen3.7 Flash API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.