Fugu Max está disponível no EmpirioLabs. O Fugu não é um modelo único. É um condutor: uma chamada API espalha a solicitação por um conjunto de modelos especialistas e compõe seu trabalho em uma única resposta. O Fugu Max é o membro econômico dessa família, aproveitando o maior conjunto que a Sakana já reuniu, incluindo modelos abertos e especializados, e montando uma equipe do tamanho certo para cada tarefa, em vez de sempre buscar a opção mais cara.
O que o Fugu Max suporta
O Fugu Max recebe entrada de texto e imagem com uma janela de contexto de token de 1M. Ele suporta chamada de funções, saída estruturada estrita com esquema JSON e busca web embutida com busca de página. O raciocínio está sempre ativo.
A saída é limitada a 131.072 tokens por requisição. A entrada de imagem é aceita pelas partes normais de conteúdo compatíveis com OpenAI, e EmpirioLabs cuida do encanamento de upload para você.
Como chamar o Fugu Max
Use o endpoint de conclusão de chat compatível com OpenAI e configure modelo para fugu-max:
curl https://api.empiriolabs.ai/v1/chat/completions \ -H 'Autorização: Portador $EMPIRIOLABS_API_KEY' \ -h 'Tipo-Conteúdo: application/json' \ -d '{ "modelo": "fugu-max", "mensagens": [ { "função": "usuário", "conteúdo": "Compare três abordagens para limitar a taxa de uma API pública e recomende uma para um serviço de 5000 req/s." } ] }'
O mesmo modelo está disponível através dos endpoints de geração de conteúdo compatíveis com o Google, Respostas, Mensagens e Resposta. A troca de outro modelo Fugu é uma mudança rápida, já que o contrato de solicitação e resposta é idêntico.
Busca na web e saída estruturada
Definir tool_web_search para Verdade quando uma resposta precisa de informações atuais. O modelo executa suas próprias buscas e busca páginas, cita fontes quando as possui e reporta exatamente o que usou em usage.tool_usage, por exemplo {"web_search": 3, "web_extractor": 1}. Essas contagens são faturáveis e já estão incluídas no custo declarado.
Para saída legível por máquina, passe um esquema JSON rigoroso em response_format. O Fugu Max retorna exatamente conforme em JSON, então você pode analisar o resultado sem precisar de um passo de reparo.
Três coisas que os ouvintes erram
1. A contagem de tokens é maior que o seu prompt. Como o condutor trabalha espalhando-se para outros modelos, a orquestração que ele realiza é uso real de tokens e é anunciada como tokens de entrada e saída comuns. Um prompt de uma frase com busca na web ativada pode reportar dezenas de milhares de tokens de entrada. Isso é esperado, não um bug, e é por isso que os retornados Uso Bloqueio é o valor para o orçamento, e não o tamanho da sua própria mensagem.
2. O streaming não chega token por token. Stream: True é aceito e é útil para manter longos pedidos ativos, mas o maestro armazena toda a orquestração e entrega o raciocínio e a resposta em uma rajada no final. Se sua interface mostrar um efeito de digitação, espere que ela fique ociosa e depois preencha de uma vez.
3. Existem apenas três níveis de raciocínio. raciocinação esforço aceita alto, xhigh, e max, e nada mais. Enviando baixo, Médio, ou nenhum Retorna 400. No Fugu Max, max é aceita como um pseudônimo de xhigh. O raciocínio não pode ser desligado. Separadamente, max_tokens deve ser pelo menos 16, e valores pequenos podem truncar ou esvaziar a resposta porque o condutor precisa de espaço para funcionar.
Preços
O Fugu Max é pago conforme você não tem assinatura, e é o único modelo Fugu com uma taxa fixa de token em todos os contextos, então um prompt longo nunca te move para um nível superior. Busca web e busca de página integradas são cobradas por chamada executada além dos tokens, e uma única requisição pode rodar mais de uma. As taxas atuais para entrada, saída, entrada em cache e as ferramentas web por chamada estão no Página do modelo Fugu Max e o página de preços, que sempre renderizam o catálogo ao vivo.
Experimente
Execute um prompt no playground, ou ler a referência completa do parâmetro no Documentos de API.



