Fugu Ultra v2.0 está disponível no EmpirioLabs. O Fugu não é um modelo único. É um condutor: uma chamada de API espalha a solicitação por um conjunto de modelos especialistas e compõe seu trabalho em uma única resposta. Ultra é o topo de linha dessa família, e a versão 2.0 é ajustada para capacidade máxima em trabalhos complexos e em múltiplas etapas, como raciocínio autônomo, pesquisa e desenvolvimento de software.
O que o Fugu Ultra v2.0 suporta
O Fugu Ultra v2.0 recebe entrada de texto e imagem com uma janela de contexto de token de 1M. Ele suporta chamada de funções, saída estruturada com esquema JSON rigoroso e busca web embutida que cita suas fontes quando elas estão disponíveis. O raciocínio está sempre ativado, e a saída é limitada a 131.072 tokens por requisição.
Como chamar Fugu Ultra v2.0
Use o endpoint de conclusão de chat compatível com OpenAI e configure modelo para fugu-ultra-v2-0:
curl https://api.empiriolabs.ai/v1/chat/completions \ -H 'Autorização: Portador $EMPIRIOLABS_API_KEY' \ -H 'Tipo-de-Conteúdo: application/json' \ -d '{ "modelo": "fugu-ultra-v2-0", "reasoning_effort": "xhigh", "mensagens": [ { "função": "usuário", "conteúdo": "Projete um plano de migração para mover um serviço pesado e com muita escrita para um novo banco de dados, e sinalize o que pode dar errado." } ] }'
O mesmo modelo está disponível através dos endpoints de geração de conteúdo compatíveis com o Google Respostas, Mensagens e Respostas. Quando o condutor retorna um resumo de raciocínio, ele chega como message.reasoning_content junto com a resposta.
Migrando da v1.0 ou v1.1
Os IDs de versão são explícitos e fixados, então nada se move sob você. fugu-ultra-v1-0 e fugu-ultra-v1-1 Continue servindo seus próprios instantâneos e o legado fugu-ultra O ID permanece fixado na v1.0. Mudar para a v2.0 é uma mudança de uma linha.
Uma diferença real de comportamento para verificar antes de migrar: tratamentos v1.1 max como um nível máximo de raciocínio distinto acima xhigh. Na v2.0, max é aceita como um pseudônimo de xhigh. Código que deliberadamente buscava as versões 1.1 max Ainda roda na versão 2.0, mas agora seleciona o mesmo esforço que xhigh.
Três coisas que os ouvintes erram
1. A contagem de tokens é maior que o seu prompt. A expansão do condutor para outros modelos é o uso real de tokens, anunciado como tokens de entrada e saída comuns. Um prompt curto com busca na web ativada pode reportar uma contagem de tokens de entrada de seis dígitos. Orçamento contra os retornados Uso Bloqueio, não o tamanho da sua própria mensagem.
2. O nível de contexto é escolhido pela entrada faturada, não pelo seu prompt. O Fugu Ultra v2.0 tem uma taxa maior acima de 272K tokens de entrada, e esse limite é medido na entrada faturada total, incluindo orquestração. Então, um prompt modesto ainda pode chegar ao nível superior em um pedido pesado. Se a estabilidade de nível importa mais para você do que a capacidade máxima, o Fugu Max tem uma taxa fixa em cada comprimento de contexto.
3. O streaming não chega token por token. Stream: True é aceito e mantém longos pedidos vivos, mas o maestro armazena toda a orquestração e entrega o raciocínio e a resposta em uma única rajada no final. Os pedidos podem levar de alguns segundos a alguns minutos, então defina tempos de espera generosos para os clientes. Também vale notar max_tokens deve ser pelo menos 16, e valores pequenos podem truncar ou esvaziar a resposta.
Preços
O Fugu Ultra v2.0 é pago conforme você se utiliza, sem assinatura. Entrada, saída e entrada em cache são em nível de contexto, com uma taxa maior acima de 272K tokens de entrada, e a entrada em cache é cobrada com um grande desconto em relação à entrada comum. A busca web embutida não cobra taxa separada no Ultra, pois seu custo já está dentro dos tokens de orquestração. As taxas atuais estão no Página do modelo Fugu Ultra v2.0 e o página de preços, que sempre renderizam o catálogo ao vivo.
Experimente
Execute um prompt no playground, ou ler a referência completa do parâmetro no Documentos de API.



