DeepSeek V4.1 Flash está disponible en EmpirioLabs. Es el buque insignia ligero de la nueva familia de arquitectura de DeepSeek: un modelo de mixture-of-experts de 552B parámetros con 8B de parámetros activos para entrada y 16B para salida, comprensión nativa de imágenes, una ventana de contexto de 1M de tokens y hasta 384K tokens de salida. DeepSeek publica resultados de benchmarks por delante de DeepSeek V4 Pro.
Qué hace el modelo
La versión 4.1 Flash lee texto e imágenes en la misma solicitud, así que puedes enviar capturas de pantalla, diagramas y fotos junto con un prompt. El pensamiento híbrido está activado por defecto: el modelo razona antes de responder, y puedes desactivar el pensamiento para respuestas con menor latencia o limitarlo con un presupuesto de pensamiento. La llamada de función y el modo JSON funcionan en la superficie estándar de completación de chat, y la búsqueda web opcional de Linkup añade contexto web reciente cuando la activas.
Cómo llamar a DeepSeek V4.1 Flash
Utiliza el endpoint de completación de chats compatible con OpenAI y establece modelo a deepseek-v4-1-flash. Las partes de imagen utilizan el estándar image_url Bloque de contenido:
curl https://api.empiriolabs.ai/v1/chat/completions \ -H 'Autorización: Portador $EMPIRIOLABS_API_KEY' \ -H 'Tipo-Contenido: application/json' \ -d '{ "modelo": "deepseek-v4-1-flash", "enable_thinking": true, "thinking_budget": 32768, "mensajes": [ { "rol": "usuario", "contenido": [ {"tipo": "texto", "texto": "¿Qué muestra este gráfico? Resume la tendencia en dos frases."}, {"tipo": "image_url", "image_url": {"url": "https://example.com/chart.png"}} ] } ] }'
El mismo id de modelo funciona en los endpoints compatibles con Respuestas, Mensajes y Gemini que aparecen en la página del modelo.
Notas operativas
- Modo JSON (a
response_formatde tipojson_object) requiere la palabra json en algún lugar de tus mensajes. El formato estricto de respuesta de esquema JSON no está disponible en este modelo. - Los tokens de razonamiento se presentan como tokens de salida. Set
habilitar pensarafalsopara abreviar, respuestas sensibles a la latencia, o inferioresthinking_budgetpara vincular el razonamiento.
Precios
El uso de tokens se factura a una tasa de entrada publicada y una a una de salida publicada, sin una tasa de entrada en caché separada. La búsqueda web de Linkup añade una pequeña comisión por llamada solo cuando se ejecuta. Ver la transmisión en directo página modelo y página de precios para las tarifas actuales.
Empieza a construir
Prueba DeepSeek v4.1 Flash en el Playground, leer el Documentación de la API, o compararlo con otros modelos en el Catálogo de modelos.
Divulgación: Este artículo fue escrito con asistencia AI y revisado por EmpirioLabs AI.



