
भाषण और लाइव वीडियो फ्रेम, 56 आवाजों के साथ एक सॉकेट पर भाषण, बातचीत के दौरान टूल कॉलिंग, और अलग-अलग टेक्स्ट और ऑडियो टोकन दर।
भाषण और लाइव वीडियो फ्रेम, 56 आवाजों के साथ एक सॉकेट पर भाषण, बातचीत के दौरान टूल कॉलिंग, और अलग-अलग टेक्स्ट और ऑडियो टोकन दर।
सत्र के साथ कॉन्फ़िगर किया गया है session.update इवेंट के बजाय अनुरोध पैरामीटर पर सॉकेट पर। पाठ और ऑडियो टोकन बिल अलग-अलग दरों पर।
इस नाम से भी जाना जाता है Alibaba Cloud Qwen3.8 Omni Flash Realtime
qwen3-8-omni-flash-realtime/v1/realtimeqwen3.8-omni-flash-realtimealibaba/qwen3-8-omni-flash-realtimeEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Qwen3.8 Omni Flash Realtime HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime पर एक WebSocket के ज़रिए लाइव बातचीत करता है। मॉडल id qwen3-8-omni-flash-realtime के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। ऑडियो दोनों दिशाओं में base64 16-bit PCM के रूप में जाता है। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())EmpirioLabs पर Qwen3.8 Omni Flash Realtime API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| voice | enum | Tina | Tina, Cindy, Liora Mira, Raymond, Zane, Katerina, Ryan, Mia, ... | सत्र के लिए बोलने की आवाज। मॉडल द्वारा कोई ऑडियो बनाने से पहले इसे session.update के साथ सेट करें। ये आवाज़ें इस मॉडल के लिए विशिष्ट हैं। |
| instructions | string | - | - | बातचीत के दौरान मॉडल को कैसे व्यवहार करना चाहिए और बोलना चाहिए, इसके लिए सिस्टम मार्गदर्शन। |
| modalities | string | ["text","audio"] | - | कौन सा आउटपुट प्रकार मॉडल एक मोड़ के लिए लौटाता है। केवल-पाठ उत्तर के लिए ऑडियो ड्रॉप करें। |
| input_audio_format | enum | pcm16 | pcm16 | आपके द्वारा इनपुट बफर में जोड़े गए ऑडियो की एन्कोडिंग: 16 kHz पर बेस 64 16-बिट पीसीएम। |
| output_audio_format | enum | pcm24 | pcm24 | ऑडियो की एन्कोडिंग मॉडल वापस स्ट्रीम करता है: 24 kHz पर 16-बिट पीसीएम। |
| turn_detection | string | {"type":"server_vad"} | - | सर्वर-साइड वॉयस एक्टिविटी डिटेक्शन। यह तय करता है कि आपने कब बोलना बंद कर दिया है और मॉडल को जवाब देना चाहिए। यह इस मॉडल पर डिफ़ॉल्ट रूप से चालू है। |
कनेक्ट करना wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime पर वेबसॉकेट पर पूर्ण-डुप्लेक्स आवाज, सामान्य प्राधिकरण वाहक हेडर के साथ प्रमाणित। सॉकेट पर session.update के साथ सत्र को कॉन्फ़िगर करें: आवाज, निर्देश, तौर-तरीके और टर्न डिटेक्शन। ऑडियो और वीडियो भेजना - माइक्रोफ़ोन ऑडियो को input_audio_buffer.append ईवेंट के रूप में जोड़ें। - लाइव वीडियो फ़्रेम को input_image_buffer.append ईवेंट के रूप में जोड़ें। फ़्रेम संदेश सामग्री नहीं हैं, इसलिए वार्तालाप आइटम के अंदर की छवि को अस्वीकार कर दिया जाता है। - वॉयस एक्टिविटी डिटेक्शन यह तय करता है कि आपने कब बोलना बंद कर दिया है, इसलिए भाषण समाप्त होने के बाद लगभग एक सेकंड तक स्ट्रीमिंग करते रहें। आवाज़ें इस मॉडल की आवाज़ें Qwen3.5 Omni रीयलटाइम मॉडल के समान सेट नहीं हैं। आवाज को पार करने के बजाय आवाज सूची में से एक चुनें, या इसे अनसेट छोड़ दें और आपके लिए डिफ़ॉल्ट प्रदान किया जाता है। बिलिंग ऑडियो और टेक्स्ट टोकन की कीमत दोनों दिशाओं में अलग-अलग होती है, और प्रत्येक पूर्ण मोड़ को मॉडल रिपोर्ट के उपयोग से अपने आप बिल किया जाता है।
EmpirioLabs पर Qwen3.8 Omni Flash Realtime का बिल उपयोग के अनुसार बनता है: इनपुट: ऑडियो $1.86 प्रति 1M ऑडियो इनपुट टोकन; इनपुट $0.46 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $1.40 प्रति 1M जेनरेट किए गए टोकन; आउटपुट: ऑडियो $3.74 प्रति 1M जनरेट किए गए ऑडियो टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Qwen3.8 Omni Flash Realtime 192K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 65,536 आउटपुट टोकन के साथ।
Qwen3.8 Omni Flash Realtime api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। Qwen3.8 Omni Flash Realtime अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id qwen3-8-omni-flash-realtime के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।