Inicio Blog

Cómo usar la API Flash de Qwen3.8

Cómo usar la API Flash de Qwen3.8

Aug 26, 2026

EmpirioLabs AI

Qwen3.8 Flash es el modelo multimodal más reciente de la familia Qwen3.8 de Alibaba, lanzado el 26 de agosto de 2026, diseñado para trabajos rápidos y económicos de codificación, agentes y visión. Combina un contexto de token de 1M con comprensión de texto, imagen y vídeo, pensamiento profundo activado por defecto, y las mismas cinco herramientas integradas que Qwen3.8 Max.

Qwen3.8 Flash está disponible en EmpirioLabs hoy a través de una API compatible con OpenAI, con llamadas a funciones, salida estructurada estricta en esquema JSON, streaming y hasta 128K tokens de salida. Pruébalo en el parque infantil o llamarlo de cualquier cliente compatible con OpenAI. La especificaciones completas y las tasas actuales viven en Página del modelo Flash de Qwen3.8 y el API docs.

Precios

La facturación se basa en el uso, con una tarifa fija de entrada y una tasa fija de salida en cada tamaño de prompt, y no existe un nivel de caché separado. La búsqueda web, text-to-image búsqueda y image-to-image búsqueda añaden una pequeña tarifa por llamada que solo se aplica cuando una llamada realmente se ejecuta; El extractor web y el intérprete de código funcionan sin coste adicional. Las tarifas actuales siempre están en la página modelo y el página de precios, que se mantienen en sincronía con lo que se cobra.

Quickstart

Indique cualquier SDK OpenAI en la URL base EmpirioLabs y pase qwen3-8-flash como modelo:

desde openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "What is happens in this chart?"}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)

El mismo id de modelo funciona /v1/responses, el de forma antrópica /v1/messages, y el compatible con Google /v1beta/models/qwen3-8-flash:generateContent Ruta. El id alternativo qwen3.8-flash se resuelve con el mismo modelo.

Pensamiento

El pensamiento profundo está activado por defecto y vuelve a fluir como reasoning content junto con la respuesta. Contrólalo con habilitar pensar y thinking_budget (hasta 262.144 fichas), o enviar reasoning effort y la plataforma lo asigna a un presupuesto adaptado al modelo. Los tokens de pensamiento se facturan como tokens de salida, así que desactiva el pensamiento o establece un presupuesto pequeño para turnos cortos y sensibles a la latencia.

Herramientas integradas

Cinco herramientas integradas van detrás tool_* Interruptores: tool_web_search, tool_web_extractor, tool_code_interpreter, tool_web_search_image, y tool_image_search. El extractor web requiere búsqueda web, y tanto el extractor como el intérprete de código se ejecutan solo mientras el pensamiento está habilitado. Cuando las herramientas se ejecutan, la respuesta es usage.tool_usage MAP informa exactamente cuántas llamadas se han hecho, para poder auditar la facturación por herramienta.

Salida estructurada

Para una forma de respuesta exacta, pasa response_format con {"tipo": "json_schema",...} y "estricto": cierto: el modelo devuelve exactamente las claves del esquema sin añadidos. Modo JSON simple con {"tipo": "json_object"} también está soportado.

Cosas que merece la pena saber antes de tu primera llamada

  • Las cinco herramientas integradas están activadas por defecto, y las búsquedas facturan por llamada invocada. Una sola solicitud puede ejecutar la búsqueda web varias veces, y cada invocación se factura. Para un chat sencillo sin comisiones de herramientas, establece tool_web_search, tool_web_search_image, y tool_image_search a falso.
  • tool_choice: "obligatorio" No funciona mientras está pensando. La solicitud es rechazada con un error evidente. Mantener tool_choice: "auto" con el pensamiento activado o establecido enable_thinking: falso Cuando necesitas forzar una llamada de función.
  • El modo JSON necesita la palabra "json" en tus mensajes. A {"tipo": "json_object"} La solicitud se rechaza a menos que la palabra aparezca en algún momento de la conversación. Las solicitudes de esquema JSON no tienen tal requisito.

Qwen3.8 Flash ya está disponible en el parque infantil y a través de la EmpirioLabs API.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.