
लागत-कुशल बहु-एजेंट कंडक्टर जो 1M संदर्भ, छवि इनपुट और वेब खोज के साथ प्रति कार्य एक सही आकार की विशेषज्ञ टीम को इकट्ठा करता है।
लागत-कुशल बहु-एजेंट कंडक्टर जो 1M संदर्भ, छवि इनपुट और वेब खोज के साथ प्रति कार्य एक सही आकार की विशेषज्ञ टीम को इकट्ठा करता है।
पाठ और छवि इनपुट, एक 1M टोकन संदर्भ, फ़ंक्शन कॉलिंग, सख्त JSON स्कीमा संरचित आउटपुट और अंतर्निहित वेब खोज का समर्थन करता है। उच्च और xhigh प्रयास स्तर के साथ तर्क हमेशा चालू रहता है; अधिकतम को xhigh के उपनाम के रूप में स्वीकार किया जाता है। प्रत्येक संदर्भ लंबाई पर एक फ्लैट टोकन दर। अंतर्निहित वेब खोज और पृष्ठ निष्पादित कॉल प्रति बिल प्राप्त करते हैं। पूर्ण ऑर्केस्ट्रेशन टोकन उपयोग प्रदर्शित इनपुट, आउटपुट और कैश दरों पर बिल किया जाता है।
इस नाम से भी जाना जाता है Sakana AI Fugu Max
fugu-max/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/fugu-max:generateContentfugu-max-v1.0sakana/fugu-maxsakana/fugu-max-v1.0EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Fugu Max OpenAI-संगत Chat Completions API देता है। किसी भी OpenAI SDK को अपनी EmpirioLabs API key के साथ https://api.empiriolabs.ai/v1 पर सेट करें और model id fugu-max उपयोग करें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "fugu-max",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="fugu-max",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)EmpirioLabs पर Fugu Max API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| max_tokens | integer | 32768 | 16 से 131072 | अंतिम उत्तर के लिए आउटपुट टोकन की अधिकतम संख्या। कम से कम 16 होना चाहिए। कंडक्टर को काम करने के लिए जगह की आवश्यकता होती है, इसलिए बहुत छोटे मान उत्तर को छोटा या... |
| reasoning_effort | enum | high | high, xhigh, max | फुगु मैक्स कितना कठिन कारण है। रीजनिंग हमेशा चालू रहती है। डिफ़ॉल्ट उच्च है; Xhigh और MAX एक ही अधिकतम प्रयास के उपनाम हैं। |
| tool_web_search | boolean | false | - | अंतर्निहित वेब खोज सक्षम करें. प्रत्येक आह्वान किए गए कॉल के लिए अनुरोध लागत में $0.007 जोड़ता है, और एक अनुरोध एक से अधिक कॉल चला सकता है. पृष्ठ प्राप्त करने का बिल... |
| tools | array | [] | - | OpenAI-संगत फ़ंक्शन कॉलिंग टूल परिभाषाएँ। |
| tool_choice | object | - | - | OpenAI-संगत उपकरण विकल्प नियंत्रण। |
| response_format | enum | - | - | संरचित JSON आउटपुट लौटाएं। JSON मोड कोई भी वैध JSON ऑब्जेक्ट लौटाता है; JSON स्कीमा मोड आपके द्वारा प्रदान की जाने वाली सटीक स्कीमा को लागू करता है। |
फुगु मैक्स लागत-कुशल मल्टी-एजेंट कंडक्टर है: प्रत्येक अनुरोध कार्य के लिए विशेषज्ञ मॉडलों की एक सही आकार की टीम को इकट्ठा करता है और उनके काम को एक ही उत्तर में लिखता है। विलंबता और स्ट्रीमिंग - सरल संकेत आमतौर पर कुछ सेकंड में वापस आ जाते हैं, और कंडक्टर के काम करने पर भारी संकेत में अधिक समय लगता है। - मॉडल समाप्त होने पर पूरा उत्तर एक ही बार में लौटाया जाता है, टोकन द्वारा टोकन नहीं। स्ट्रीमिंग स्वीकार की जाती है, लेकिन यह टोकन उत्पन्न करने के बजाय स्ट्रीमिंग के बजाय अंत में पूरी प्रतिक्रिया प्रदान करता है। - max_tokens कम से कम 16 वर्ष का होना चाहिए। उदार हेडरूम छोड़ दें, क्योंकि बहुत छोटी सीमाएं उत्तर को छोटा या खाली कर सकती हैं। क्षमताएं - 1M टोकन संदर्भ के साथ पाठ और छवि इनपुट। - हमेशा चालू तर्क। उच्च डिफ़ॉल्ट है, xhigh प्रयास बढ़ाता है, और max को xhigh के उपनाम के रूप में स्वीकार किया जाता है। - फ़ंक्शन कॉलिंग, सख्त JSON स्कीमा संरचित आउटपुट, और अंतर्निहित वेब खोज जो उपलब्ध होने पर अपने स्रोतों का हवाला देती है। बिलिंग - पूर्ण टोकन उपयोग पर बिल किया जाता है, जिसमें मॉडल आंतरिक रूप से उपयोग किए जाने वाले ऑर्केस्ट्रेशन टोकन भी शामिल हैं, इसलिए छोटे संकेतों में भी कुछ लागत आती है। - प्रत्येक संदर्भ लंबाई पर एक फ्लैट टोकन दर, जिसमें लंबे संकेतों के लिए कोई उच्च दर नहीं है। - अंतर्निहित वेब खोज और पेज फ़ेच को प्रति निष्पादित कॉल पर दिखाई गई दरों पर बिल किया जाता है, और एक एकल अनुरोध एक से अधिक कॉल चला सकता है।
When this model invokes tools (web search, code interpreter, etc.) inside a single request, the response carries a normalized usage.tool_usage map alongside the token counts. The example below shows the shape, exact field names, units, and which tools appear can vary slightly per provider:
"usage": {
"prompt_tokens": 123,
"completion_tokens": 456,
"cost_usd": 0.0042,
"tool_usage": {"web_search": 3, "code_interpreter": 1}
}The tool counts are already factored into cost_usd, they are surfaced for transparency so you can audit per-tool billing. The field is omitted when no tools were invoked.
EmpirioLabs पर Fugu Max का बिल उपयोग के अनुसार बनता है: इनपुट $2.00 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $6.00 प्रति 1M जेनरेट किए गए टोकन; अंतर्निहित कैश पढ़ा गया $0.25 प्रति 1M कैश्ड इनपुट टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Fugu Max 1M टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 1,31,072 आउटपुट टोकन के साथ।
हां। Fugu Max OpenAI-संगत Chat Completions API देता है, इसलिए मौजूदा OpenAI SDKs base_url को https://api.empiriolabs.ai/v1 पर सेट करके और model id fugu-max रखकर काम करते हैं।
हां। EmpirioLabs playground ब्राउज़र में Fugu Max को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।