Qwen3.8 Flash es el modelo multimodal más reciente de la familia Qwen3.8 de Alibaba, lanzado el 26 de agosto de 2026, diseñado para trabajos rápidos y económicos de codificación, agentes y visión. Combina un contexto de token de 1M con comprensión de texto, imagen y vídeo, pensamiento profundo activado por defecto, y las mismas cinco herramientas integradas que Qwen3.8 Max.
Qwen3.8 Flash está disponible en EmpirioLabs hoy a través de una API compatible con OpenAI, con llamadas a funciones, salida estructurada estricta en esquema JSON, streaming y hasta 128K tokens de salida. Pruébalo en el parque infantil o llamarlo de cualquier cliente compatible con OpenAI. La especificaciones completas y las tasas actuales viven en Página del modelo Flash de Qwen3.8 y el API docs.
Precios
La facturación se basa en el uso, con una tarifa fija de entrada y una tasa fija de salida en cada tamaño de prompt, y no existe un nivel de caché separado. La búsqueda web, text-to-image búsqueda y image-to-image búsqueda añaden una pequeña tarifa por llamada que solo se aplica cuando una llamada realmente se ejecuta; El extractor web y el intérprete de código funcionan sin coste adicional. Las tarifas actuales siempre están en la página modelo y el página de precios, que se mantienen en sincronía con lo que se cobra.
Quickstart
Indique cualquier SDK OpenAI en la URL base EmpirioLabs y pase qwen3-8-flash como modelo:
desde openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "What is happens in this chart?"}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)
El mismo id de modelo funciona /v1/responses, el de forma antrópica /v1/messages, y el compatible con Google /v1beta/models/qwen3-8-flash:generateContent Ruta. El id alternativo qwen3.8-flash se resuelve con el mismo modelo.
Pensamiento
El pensamiento profundo está activado por defecto y vuelve a fluir como reasoning content junto con la respuesta. Contrólalo con habilitar pensar y thinking_budget (hasta 262.144 fichas), o enviar reasoning effort y la plataforma lo asigna a un presupuesto adaptado al modelo. Los tokens de pensamiento se facturan como tokens de salida, así que desactiva el pensamiento o establece un presupuesto pequeño para turnos cortos y sensibles a la latencia.
Herramientas integradas
Cinco herramientas integradas van detrás tool_* Interruptores: tool_web_search, tool_web_extractor, tool_code_interpreter, tool_web_search_image, y tool_image_search. El extractor web requiere búsqueda web, y tanto el extractor como el intérprete de código se ejecutan solo mientras el pensamiento está habilitado. Cuando las herramientas se ejecutan, la respuesta es usage.tool_usage MAP informa exactamente cuántas llamadas se han hecho, para poder auditar la facturación por herramienta.
Salida estructurada
Para una forma de respuesta exacta, pasa response_format con {"tipo": "json_schema",...} y "estricto": cierto: el modelo devuelve exactamente las claves del esquema sin añadidos. Modo JSON simple con {"tipo": "json_object"} también está soportado.
Cosas que merece la pena saber antes de tu primera llamada
- Las cinco herramientas integradas están activadas por defecto, y las búsquedas facturan por llamada invocada. Una sola solicitud puede ejecutar la búsqueda web varias veces, y cada invocación se factura. Para un chat sencillo sin comisiones de herramientas, establece
tool_web_search,tool_web_search_image, ytool_image_searchafalso. tool_choice: "obligatorio"No funciona mientras está pensando. La solicitud es rechazada con un error evidente. Mantenertool_choice: "auto"con el pensamiento activado o establecidoenable_thinking: falsoCuando necesitas forzar una llamada de función.- El modo JSON necesita la palabra "json" en tus mensajes. A
{"tipo": "json_object"}La solicitud se rechaza a menos que la palabra aparezca en algún momento de la conversación. Las solicitudes de esquema JSON no tienen tal requisito.
Qwen3.8 Flash ya está disponible en el parque infantil y a través de la EmpirioLabs API.



