
एक सॉकेट पर डुप्लेक्स भाषण वार्तालाप, 27 आवाजों, मूल वेब खोज, टूल कॉलिंग, और अलग-अलग टेक्स्ट और ऑडियो टोकन दरों के साथ।
एक सॉकेट पर डुप्लेक्स भाषण वार्तालाप, 27 आवाजों, मूल वेब खोज, टूल कॉलिंग, और अलग-अलग टेक्स्ट और ऑडियो टोकन दरों के साथ।
सत्र के साथ कॉन्फ़िगर किया गया है session.update ईवेंट सॉकेट पर अनुरोध पैरामीटर के बजाय। वेब खोज डिफ़ॉल्ट रूप से बंद है और फ़ंक्शन कॉलिंग के साथ संयोजित नहीं किया जा सकता। पाठ और ऑडियो टोकन बिल अलग-अलग दरों पर।
इस नाम से भी जाना जाता है Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus
qwen-audio-3-1-realtime-plus/v1/realtimeqwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plusEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Qwen Audio 3.1 Realtime Plus HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus पर एक WebSocket के ज़रिए लाइव बातचीत करता है। मॉडल id qwen-audio-3-1-realtime-plus के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। ऑडियो दोनों दिशाओं में base64 16-bit PCM के रूप में जाता है। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())EmpirioLabs पर Qwen Audio 3.1 Realtime Plus API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| voice | enum | longanqian_v3.1 | longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf... | सत्र के लिए बोलने की आवाज। मॉडल द्वारा कोई ऑडियो बनाने से पहले इसे session.update के साथ सेट करें। ये आवाज़ें इस मॉडल के लिए विशिष्ट हैं। |
| instructions | string | - | - | बातचीत के दौरान मॉडल को कैसे व्यवहार करना चाहिए और बोलना चाहिए, इसके लिए सिस्टम मार्गदर्शन। |
| enable_search | boolean | false | - | वास्तविक समय की जानकारी के लिए वेब पर खोजें। फ़ंक्शन कॉलिंग के समान सत्र में उपयोग नहीं किया जा सकता है। खोज परिणाम वार्तालाप में जोड़े जाते हैं और इनपुट टोकन के रूप... |
| modalities | string | ["text","audio"] | - | कौन सा आउटपुट प्रकार मॉडल एक मोड़ के लिए लौटाता है। केवल-पाठ उत्तर के लिए ऑडियो ड्रॉप करें। |
| input_audio_format | enum | pcm16 | pcm16 | आपके द्वारा इनपुट बफर में जोड़े गए ऑडियो की एन्कोडिंग: 16 kHz पर बेस 64 16-बिट पीसीएम। |
| output_audio_format | enum | pcm24 | pcm24 | ऑडियो की एन्कोडिंग मॉडल वापस स्ट्रीम करता है: 24 kHz पर 16-बिट पीसीएम। |
| turn_detection | string | {"type":"server_vad"} | - | सर्वर-साइड वॉयस एक्टिविटी डिटेक्शन। यह तय करता है कि आपने कब बोलना बंद कर दिया है और मॉडल को जवाब देना चाहिए। यह इस मॉडल पर डिफ़ॉल्ट रूप से चालू है। |
कनेक्ट करना wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus पर वेबसॉकेट पर पूर्ण-डुप्लेक्स आवाज, सामान्य प्राधिकरण वाहक हेडर के साथ प्रमाणित। सॉकेट पर session.update के साथ सत्र को कॉन्फ़िगर करें: आवाज, निर्देश, तौर-तरीके और टर्न डिटेक्शन। ऑडियो भेजना - माइक्रोफ़ोन ऑडियो को input_audio_buffer.append ईवेंट के रूप में जोड़ें। - वॉयस एक्टिविटी डिटेक्शन यह तय करता है कि आपने कब बोलना बंद कर दिया है, इसलिए भाषण समाप्त होने के बाद लगभग एक सेकंड तक स्ट्रीमिंग करते रहें। आवाज़ें इस मॉडल की आवाज़ें इसका अपना सेट हैं। किसी अन्य मॉडल से आवाज़ ले जाने के बजाय वॉयस लिस्ट में से एक चुनें, या इसे अनसेट छोड़ दें और आपके लिए डिफ़ॉल्ट आपूर्ति की जाती है। वेब खोज वेब खोज डिफ़ॉल्ट रूप से बंद है। इसे enable_search के साथ चालू करें। इसे फ़ंक्शन कॉलिंग के समान सत्र में सक्षम नहीं किया जा सकता है, और खोज परिणाम बातचीत में जोड़े जाते हैं और इनपुट टोकन के रूप में गिने जाते हैं। बिलिंग ऑडियो और टेक्स्ट टोकन की कीमत दोनों दिशाओं में अलग-अलग होती है, और प्रत्येक पूर्ण मोड़ को मॉडल रिपोर्ट के उपयोग से अपने आप बिल किया जाता है।
EmpirioLabs पर Qwen Audio 3.1 Realtime Plus का बिल उपयोग के अनुसार बनता है: इनपुट: ऑडियो $12.80 प्रति 1M ऑडियो इनपुट टोकन; इनपुट $1.60 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $12.80 प्रति 1M जेनरेट किए गए टोकन; आउटपुट: ऑडियो $48.00 प्रति 1M जनरेट किए गए ऑडियो टोकन; वेब खोज $0.00 प्रति कॉल जब लागू किया जाता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Qwen Audio 3.1 Realtime Plus 256K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 16,384 आउटपुट टोकन के साथ।
Qwen Audio 3.1 Realtime Plus api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। Qwen Audio 3.1 Realtime Plus अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id qwen-audio-3-1-realtime-plus के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।