《Fugu Max》在EmpirioLabs上有售。 Fugu 不是单一模型。它是指挥者:一个 API 将请求推导出专家模型池,并将他们的作品整合成一个统一的答案。Fugu Max 是该家族中最具成本效益的成员,汲取 Sakana 组建的最广泛模型,包括开放重量和专用模型,并为每项任务组建合适规模的团队,而非总是选择最昂贵的方案。
Fugu Max 支持什么
Fugu Max 通过 100 万令牌上下文窗口接受文本和图像输入。它支持函数调用、严格的 JSON 模式结构化输出,以及内置带页面取用功能的网页搜索。推理功能始终开启。
每个请求的输出上限为131,072个令牌。图片输入通过正常兼容的OpenAI内容部分接受,EmpirioLabs会帮你处理上传流程。
如何称呼Fugu Max
使用兼容 OpenAI 的聊天完成终端并设置 模型 到 Fugu-Max编号:
curl https://api.empiriolabs.ai/v1/chat/completions \ -h '授权:承载者 $EMPIRIOLABS_API_KEY' \ -h '内容类型:application/json' \ -d '{ “model”: “fugu-max”, “messages”: [ { “role”: “user”, “content”: “比较三种限制公共API的方法,并推荐一个用于5000req/s服务的一种。” } ] }''
同样的模型也可以通过Responses、Messages和兼容Google的内容生成端点获得。从另一个Fugu模型切换只需一行,因为请求和响应契约是相同的。
网页搜索与结构化输出
设定 tool_web_search (英语) 到 确实如此 当答案需要最新信息时。模型运行自己的搜索和页面取用,引用来源(有来源时),并准确报告所用内容 usage.tool_usage例如, {“web_search”: 3, “web_extractor”: 1}.这些计数是可计费的,并且已经包含在报告成本中。
对于机器可读输出,输入严格的 JSON 模式 response_format.Fugu Max 返回的 JSON 完全符合规范,所以你可以在不需修复的情况下解析结果。
来电者会犯错的三件事
1. 代币数量比你的提示词还多。 由于指挥通过向其他模型展开,它执行的编排是真实的令牌使用,并被标注为普通的输入和输出令牌。一个开启网页搜索的一句话提示词可以报告数万个输入令牌。这是预期中的,不是错误,这也是返回的原因 用途 block是预算的数字,而不是你自己消息的长度。
2. 流媒体不是通过令牌到达的。 流媒体:真实 被接受且有助于保持长请求的存活,但指挥会缓冲整个编曲,并在结尾一次性传递推理和答案。如果你的界面显示打字效果,预计它会处于空闲状态,然后一次性填充。
3. 只有三种推理层次。 推理(e) 接受 高, (中文), 高, 和 最大数,仅此而已。发送中 低, (中文), 媒介,或者 无 返回400。关于Fugu Max, 最大数 被接受为 的别名 高.推理无法关闭。单独, max_tokens 必须至少为16,且小值可能会截断或清空答案,因为导体需要工作空间。
定价
Fugu Max 是按需付费,无需订阅,它是唯一在每个上下文长度下都采用统一令牌费率的 Fugu 型号,因此长提示不会让你进入更高层级。内置的网页搜索和页面取用是按执行调用计费的,除了令牌之外,单个请求可以运行多个请求。当前输入、输出、缓存输入和每次调用的网页工具费率都在 Fugu Max 模型页面 页:1 定价页面,这些总是实时目录。



