Qwen3.7 Flash está disponible en EmpirioLabs. Es la versión rápida de la serie Qwen3.7 de Alibaba, diseñada para la comprensión multimodal, el uso de herramientas agenticas y el trabajo de contexto largo, con una ventana de contexto de token de 1M, pensamiento conmutable y entrada de texto, imagen y vídeo. Funciona con una API compatible con OpenAI, así que puedes cambiar a ella cambiando un campo.
En qué es bueno el Flash Qwen3.7
Flash es el nivel de velocidad y coste de la familia Qwen3.7, así que se adapta a trabajos de alto volumen donde aún quieres razonamiento real disponible: comprensión de documentos y capturas de pantalla, respuesta a preguntas en vídeo, pipelines de extracción y bucles de agentes que llaman a herramientas. Lee imágenes y vídeos, llama a herramientas con función estándar, devuelve JSON bajo demanda y puede buscar en la web, ejecutar código y leer URLs mediante herramientas integradas. Hay disponibles tanto un despliegue en Singapur como uno en China, así que puedes elegir el que se adapte a tus necesidades de latencia y precios.
Cómo llamarlo
Envía una finalización estándar de chat:
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "qwen3-7-flash", "mensajes": [ {"rol": "usuario", "contenido": "Resume el informe de este trimestre en cinco viñetas."} ] }'
La respuesta final vuelve a entrar Contenido, y cuando el pensamiento está en el razonamiento del modelo está en reasoning content.
Controla el pensamiento
El pensamiento está activado por defecto. Desactivarlo para llamadas cortas y sensibles a la latencia, o establece un presupuesto para cuántos tokens puede gastar el modelo en razonamiento. También puedes usar reasoning effort con ninguno, bajo, medio, alto o máximo, que se corresponde a un presupuesto para este modelo:
{ "model": "qwen3-7-flash", "mensajes": [{"rol": "usuario", "contenido": "Planifica una migración y justifica el orden."}], "enable_thinking": cierto, "thinking_budget": 32768 }
Los tokens de razonamiento se anuncian como tokens de salida.
Imágenes y vídeo
Pasa imágenes y vídeos como partes de contenido en un mensaje de usuario junto a tu texto, y luego haz una pregunta sobre lo que muestran. Puedes adjuntar más de una entrada en una sola petición:
{ "modelo": "qwen3-7-flash", "mensajes": [{"rol": "usuario", "contenido": [ {"tipo": "texto", "texto": "¿Qué cambió entre estas dos capturas de pantalla?"}, {"tipo": "image_url", "image_url": {"URL": "https://example.com/before.png"}}, {"tipo": "image_url", "image_url": {"URL": "https://example.com/after.png"}} ]}] }
Herramientas integradas
Qwen3.7 Flash incluye búsqueda web, extractor web para leer URLs, intérprete de código y búsqueda text-to-image y image-to-image. Cada uno es un interruptor y solo se factura cuando el modelo realmente los invoca. Web Extractor e Intérprete de Código necesitan habilitar el pensamiento:
{ "modelo": "qwen3-7-flash", "mensajes": [{"rol": "usuario", "contenido": "¿Qué se incluyó en la última versión?"}], "tool_web_search": verdadero }
Cuando se ejecutan herramientas, la respuesta lleva un usage.tool_usage Mapea junto a los tokens para poder auditar exactamente qué se invocó.
Salida estructurada y llamada de funciones
Uso response_format con {"tipo": "json_object"} forzar un objeto JSON válido y pasar Herramientas Para la llamada a funciones estándar cuando quieres que el modelo lo llame a tu propio código.
Caché de prompts
Los prefijos repetidos de prompt se almacenan en caché automáticamente, y los tokens de entrada en caché facturan a una tasa mucho menor que la entrada nueva. Si envías una indicación o encabezado de documento compartido largo a través de muchas solicitudes, obtienes ese descuento sin cambiar nada en tu código.
Regiones
El predeterminado qwen3-7-flash es el despliegue en Singapur. qwen3-7-flash:variant1 es el despliegue en China del mismo modelo a tasas más bajas. Ambos toman los mismos parámetros, así que puedes cambiar entre ellos solo con el campo del modelo.
Precios
Qwen3.7 Flash es pagar por uso, facturado por token. Las tarifas de entrada y salida disminuyen para los prompts cortos y suben para los muy largos, las facturas de entrada almacenadas en caché a un precio reducido, y las herramientas integradas solo cuestan una pequeña tarifa por llamada cuando se ejecutan. Consulta las tarifas en directo en la Página de modelos Flash Qwen3.7 y el página de precios, y pruébalo en el parque infantil.



