StepAudio 3 Realtime एपीआई

भाषण में, भाषण बाहर, एक सॉकेट पर। इंटरप्टिबल मिड-रिप्ले, वॉयस एक्टिविटी डिटेक्शन के साथ यह तय करना कि कब जवाब देना है।

StepFunऑडियो जनरेशन256K कॉन्टेक्स्टरिलीज 6 अग॰ 2026Internationalस्वामित्व वाला एंडपॉइंटनया

StepAudio 3 Realtime के बारे में

भाषण में, भाषण बाहर, एक सॉकेट पर। इंटरप्टिबल मिड-रिप्ले, वॉयस एक्टिविटी डिटेक्शन के साथ यह तय करना कि कब जवाब देना है।

सत्र अनुरोध पैरामीटर के बजाय सॉकेट पर session.update ईवेंट के साथ कॉन्फ़िगर किया गया है।

इस नाम से भी जाना जाता है StepFun StepAudio 3 Realtime

realtimespeech to speechaudio inaudio outvoice control

StepAudio 3 Realtime की विशेषताएं

मॉडल ID
stepaudio-3-realtime
निर्माता
StepFun
श्रेणी
ऑडियो जनरेशन
रिलीज
6 अग॰ 2026
कॉन्टेक्स्ट विंडो
256K टोकन
अधिकतम आउटपुट
1,31,072 टोकन
इनपुट
ऑडियोटेक्स्ट
आउटपुट
ऑडियोटेक्स्ट
रीजन
International
एंडपॉइंट
WEBSOCKET/v1/realtime
वैकल्पिक मॉडल ID
stepaudio-3-realtime-previewstepfun/stepaudio-3-realtime

StepAudio 3 Realtime API की कीमतें

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
इनपुट
प्रति 1M प्रॉम्प्ट टोकन
$1.50
उत्पादन
प्रति 1M जेनरेट किए गए टोकन
$10.00
अंतर्निहित कैश पढ़ा गया
प्रति 1M कैश्ड इनपुट टोकन
$0.30
पूरे कीमत पेज पर तुलना करें

StepAudio 3 Realtime API को कैसे कॉल करें

StepAudio 3 Realtime HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-3-realtime पर एक WebSocket के ज़रिए लाइव बातचीत करता है। मॉडल id stepaudio-3-realtime के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। ऑडियो दोनों दिशाओं में base64 16-bit PCM के रूप में जाता है। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-3-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
StepAudio 3 Realtime API का पूरा संदर्भ

StepAudio 3 Realtime API के पैरामीटर

EmpirioLabs पर StepAudio 3 Realtime API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
voiceenumsoft-spoken-gentlemansoft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l...सत्र आवाज, मॉडल ऑडियो का उत्पादन करने से पहले session.update के साथ सेट करें। एक बार मॉडल के बोलने के बाद इसे बदला नहीं जा सकता है, और कोई अन्य मान अस्वीकार कर दिया...
instructionsstring--सत्र के लिए सिस्टम निर्देश: व्यक्तित्व, बोलने की शैली और सीमाएँ।
modalitiesstring["text","audio"]-सत्र के लिए प्रतिक्रिया के तौर-तरीके।
volume_rationumber10.1 से 2बोले गए उत्तर की लाउडनेस, डिफ़ॉल्ट के सापेक्ष। स्वीकृत सीमा 0.1 से 2.0 है।
input_audio_formatenumpcm16pcm16आपके द्वारा भेजे जाने वाले ऑडियो की एन्कोडिंग। 16-बिट पीसीएम।
output_audio_formatenumpcm16pcm16ऑडियो की एन्कोडिंग, मॉडल लौटाता है। 16-बिट पीसीएम।
turn_detectionstring{"type":"server_vad"}-सर्वर-साइड आवाज गतिविधि का पता लगाना। तय करता है कि आपने कब बोलना बंद कर दिया है और मॉडल को जवाब देना चाहिए। इसके बिना मॉडल सुनता है लेकिन कभी जवाब नहीं देता है,...

जानने योग्य

wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-3-realtime पर WebSocket पर पूर्ण-डुप्लेक्स आवाज, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। ऑडियो pcm16 अंदर और बाहर है। मॉडल बोलते समय सुनता है, इसलिए इसे मध्य-उत्तर में बाधित किया जा सकता है, और सर्वर-साइड वॉयस गतिविधि का पता लगाना तय करता है कि कब उत्तर देना है। पहले ऑडियो से पहले session.update के साथ आवाज सेट करें; एक बार मॉडल के बोलने के बाद इसे बदला नहीं जा सकता है, और केवल सात सूचीबद्ध आवाज़ें स्वीकार की जाती हैं। बातचीत केवल चीनी और अंग्रेजी है। प्रत्येक पूर्ण मोड़ को मॉडल रिपोर्ट के उपयोग से अपने आप बिल किया जाता है। यह मॉडल पूर्वावलोकन में है और इसकी क्षमताएं बदल सकती हैं।

StepAudio 3 Realtime API: आम सवाल

StepAudio 3 Realtime API की कीमत कितनी है?

EmpirioLabs पर StepAudio 3 Realtime का बिल उपयोग के अनुसार बनता है: इनपुट $1.50 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $10.00 प्रति 1M जेनरेट किए गए टोकन; अंतर्निहित कैश पढ़ा गया $0.30 प्रति 1M कैश्ड इनपुट टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

StepAudio 3 Realtime की context window कितनी है?

StepAudio 3 Realtime 256K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 1,31,072 आउटपुट टोकन के साथ।

StepAudio 3 Realtime कौन सा endpoint उपयोग करता है?

StepAudio 3 Realtime api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में StepAudio 3 Realtime आज़मा सकता हूं?

EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। StepAudio 3 Realtime अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id stepaudio-3-realtime के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।

StepAudio 3 Realtime की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।