Fugu Max está disponible en EmpirioLabs. Fugu no es un modelo único. Es un conductor: una llamada API dispersa la solicitud a través de un conjunto de modelos expertos y compone su trabajo en una única respuesta. Fugu Max es el miembro rentable de esa familia, aprovechando el conjunto más amplio que ha reunido Sakana, incluyendo modelos de peso abierto y especializados, y formando un equipo del tamaño adecuado para cada tarea en lugar de recurrir siempre a la opción más cara.
Lo que soporta Fugu Max
Fugu Max acepta entrada de texto e imagen con una ventana de contexto de token de 1M. Soporta llamada a funciones, salida estructurada estricta con esquema JSON y búsqueda web integrada con búsqueda de páginas. El razonamiento siempre está activado.
La salida está limitada a 131.072 tokens por solicitud. La entrada de imagen se acepta a través de las partes normales de contenido compatibles con OpenAI, y EmpirioLabs se encarga de la subida.
Cómo llamar a Fugu Max
Utiliza el endpoint de completación de chats compatible con OpenAI y establece modelo a fugu-max:
curl https://api.empiriolabs.ai/v1/chat/completions \ -H 'Autorización: Portador $EMPIRIOLABS_API_KEY' \ -H 'Tipo-Contenido: application/json' \ -d '{ "modelo": "fugu-max", "mensajes": [ { "rol": "usuario", "contenido": "Compara tres enfoques para limitar la velocidad de una API pública y recomienda uno para un servicio de 5000 req/s." } ] }'
El mismo modelo está disponible a través de los endpoints de generación de contenido compatibles con Respuestas, Mensajes y Google. Cambiar desde otro modelo Fugu es un cambio de una línea, ya que el contrato de solicitud y respuesta es idéntico.
Búsqueda web y salida estructurada
Set tool_web_search a Cierto cuando una respuesta necesita información actual. El modelo realiza sus propias búsquedas y busca páginas, cita fuentes cuando las tiene y reporta exactamente lo que usó en usage.tool_usage, por ejemplo {"web_search": 3, "web_extractor": 1}. Esos recuentos son facturables y ya están incluidos en el coste declarado.
Para una salida legible por máquina, pasa un esquema JSON estricto en response_format. Fugu Max devuelve exactamente un JSON conforme, así que puedes analizar el resultado sin necesidad de reparación.
Tres cosas que los oyentes se equivocan
1. El número de fichas es mayor que tu prompt. Como el conductor funciona expandiéndose a otros modelos, la orquestación que realiza es un uso real de tokens y se factura como tokens de entrada y salida ordinarios. Un prompt de una frase con búsqueda web activada puede reportar decenas de miles de tokens de entrada. Esto es de esperar, no es un error, y por eso el retorno Uso Bloquear es el número contra el que presupuestar, no la longitud de tu propio mensaje.
2. El streaming no llega token por token. Stream: True es aceptado y es útil para mantener vivas las peticiones largas, pero el director almacena toda la orquestación y entrega el razonamiento y la respuesta en una ráfaga al final. Si tu interfaz muestra un efecto de escritura, espera que permanezca inactiva y luego la rellene de inmediato.
3. Solo existen tres niveles de razonamiento. reasoning effort acepta Alto, xhigh, y max, y nada más. Enviando Grave, Medio, o ninguno devuelve un 400. En Fugu Max, max se acepta como alias de xhigh. El razonamiento no puede desconectarse. Por separado, max_tokens debe ser al menos 16, y valores pequeños pueden truncar o vaciar la respuesta porque el conductor necesita espacio para trabajar.
Precios
Fugu Max es de pago por uso sin suscripción, y es el único modelo de Fugu con una tasa fija de token en cada longitud de contexto, así que un prompt largo nunca te traslada a un nivel superior. La búsqueda web integrada y la obtención de páginas se facturan por llamada ejecutada además de tokens, y una sola petición puede ejecutarse más de una. Las tarifas actuales para entrada, salida, entrada en caché y las herramientas web por llamada están en el Página del modelo Fugu Max y el página de precios, que siempre muestran el catálogo en vivo.
Pruébalo
Ejecuta un prompt en el parque infantil, o leer la referencia completa del parámetro en el API docs.



