DeepSeek V4.1 Flash ist auf EmpirioLabs verfügbar. Es ist das leichte Flaggschiff der neuen Architekturfamilie von DeepSeek: ein 552B-Parameter-mixture-of-experts-Modell mit 8B aktiven Parametern für Eingabe und 16B für Ausgabe, natives Bildverständnis, einem 1M Token-Kontextfenster und bis zu 384K Ausgabetokens. DeepSeek berichtet Benchmark-Ergebnisse vor DeepSeek V4 Pro.
Was das Modell bewirkt
V4.1 Flash liest Text und Bilder in derselben Anfrage vor, sodass Sie Screenshots, Diagramme und Fotos zusammen mit einer Eingabeaufforderung senden können. Hybrides Denken ist standardmäßig aktiviert: Das Modell reduziert, bevor es antwortet, und Sie können das Denken für Antworten mit geringerer Latenz deaktivieren oder es mit einem Denkbudget begrenzen. Funktionsaufrufe und JSON-Modus funktionieren auf der Standard-Chat-Komplettionsoberfläche, und die optionale Linkup-Websuche fügt aktuellen Webkontext hinzu, wenn Sie sie aktivieren.
Wie man DeepSeek V4.1 Flash anruft
Verwenden Sie den OpenAI-kompatiblen Chat-Completions-Endpunkt und setzen Sie es ein modell zu deepseek-v4-1-flash. Bildteile verwenden den Standard image_url Inhaltsblock:
curl https://api.empiriolabs.ai/v1/chat/completions \ -h 'Authorization: Bearer $EMPIRIOLABS_API_KEY' \ -H 'Content-Type: application/json' \ -d '{ "model": "deepseek-v4-1-flash", "enable_thinking": true, "thinking_budget": 32768, "messages": [ { "role": "user", "content": [ {"type": "text", "text": "Was zeigt dieses Diagramm?" Fasse den Trend in zwei Sätzen zusammen."}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}} ] } }'
Die gleiche Modell-ID funktioniert auf den auf der Modellseite aufgeführten Endpunkten Responses, Messages und Gemini-kompatiblen Endpunkten.
Betriebshinweise
- JSON-Modus (a
response_formatvon Typjson_object) benötigt das Wort JSON irgendwo in deinen Nachrichten. Das strenge JSON-Schema-Antwortformat ist bei diesem Modell nicht verfügbar. - Reasoning Tokens werden als Ausgabetoken abgerechnet. Set
enable thinkingzufalschfür kurze, latenzempfindliche Antworten oder niedrigerethinking_budgetum die Begründung zu begrenzen.
Preisgestaltung
Die Tokennutzung wird mit einer veröffentlichten Eingaberate und einer veröffentlichten Ausgaberate berechnet, ohne separate zwischengespeicherte Eingaberate. Die Linkup-Websuche erhebt nur dann eine kleine Gebühr pro Anruf. Siehe live modellblatt und preisseite Für aktuelle Zinssätze.
Beginnen Sie mit dem Bau
Probier DeepSeek v4.1 Flash in der Spielplatzlesen sie die API-Dokumentation, oder sie mit anderen Modellen in der Modellkatalog.
Offenlegung: Dieser Artikel wurde mit KI-Unterstützung geschrieben und von EmpirioLabs AI überprüft.



