
भाषण में, भाषण बाहर, एक सॉकेट पर, स्वर और गति की पैरालिंग्विस्टिक समझ के साथ।
भाषण में, भाषण बाहर, एक सॉकेट पर, स्वर और गति की पैरालिंग्विस्टिक समझ के साथ।
सत्र अनुरोध पैरामीटर के बजाय सॉकेट पर session.update ईवेंट के साथ कॉन्फ़िगर किया गया है।
इस नाम से भी जाना जाता है StepAudio Realtime, StepFun StepAudio 2.5 Realtime
stepaudio-2-5-realtime/v1/realtimestepaudio-2.5-realtimestepfun/stepaudio-2-5-realtimeEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
StepAudio 2.5 Realtime HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime पर एक WebSocket के ज़रिए लाइव बातचीत करता है। मॉडल id stepaudio-2-5-realtime के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। ऑडियो दोनों दिशाओं में base64 16-bit PCM के रूप में जाता है। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())EmpirioLabs पर StepAudio 2.5 Realtime API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| voice | enum | soft-spoken-gentleman | soft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l... | सत्र आवाज, मॉडल ऑडियो का उत्पादन करने से पहले session.update के साथ सेट करें। एक बार मॉडल के बोलने के बाद इसे बदला नहीं जा सकता है, और कोई अन्य मान अस्वीकार कर दिया... |
| instructions | string | - | - | सत्र के लिए सिस्टम निर्देश: व्यक्तित्व, बोलने की शैली और सीमाएँ। |
| modalities | string | ["text","audio"] | - | सत्र के लिए प्रतिक्रिया के तौर-तरीके। |
| volume_ratio | number | 1 | 0.1 से 2 | बोले गए उत्तर की लाउडनेस, डिफ़ॉल्ट के सापेक्ष। स्वीकृत सीमा 0.1 से 2.0 है। |
| input_audio_format | enum | pcm16 | pcm16 | आपके द्वारा भेजे जाने वाले ऑडियो की एन्कोडिंग। 16-बिट पीसीएम। |
| output_audio_format | enum | pcm16 | pcm16 | ऑडियो की एन्कोडिंग, मॉडल लौटाता है। 16-बिट पीसीएम। |
| turn_detection | string | {"type":"server_vad"} | - | सर्वर-साइड आवाज गतिविधि का पता लगाना। तय करता है कि आपने कब बोलना बंद कर दिया है और मॉडल को जवाब देना चाहिए। इसके बिना मॉडल सुनता है लेकिन कभी जवाब नहीं देता है,... |
wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime पर WebSocket पर पूर्ण-डुप्लेक्स आवाज, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। ऑडियो pcm16 अंदर और बाहर है। मॉडल बोलते समय सुनता है, इसलिए इसे मध्य-उत्तर में बाधित किया जा सकता है, और सर्वर-साइड वॉयस एक्टिविटी डिटेक्शन यह तय करता है कि कब जवाब देना है। पहले ऑडियो से पहले session.update के साथ आवाज सेट करें; एक बार मॉडल के बोलने के बाद इसे बदला नहीं जा सकता है, और केवल सात सूचीबद्ध आवाज़ें स्वीकार की जाती हैं। बातचीत केवल चीनी और अंग्रेजी है। प्रत्येक पूर्ण मोड़ को मॉडल रिपोर्ट के उपयोग से अपने आप बिल किया जाता है।
EmpirioLabs पर StepAudio 2.5 Realtime का बिल उपयोग के अनुसार बनता है: इनपुट $1.50 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $10.00 प्रति 1M जेनरेट किए गए टोकन; अंतर्निहित कैश पढ़ा गया $0.30 प्रति 1M कैश्ड इनपुट टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
StepAudio 2.5 Realtime 256K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 1,31,072 आउटपुट टोकन के साथ।
StepAudio 2.5 Realtime api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। StepAudio 2.5 Realtime अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id stepaudio-2-5-realtime के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।