अलीबाबा के दो नए वॉयस मॉडल EmpirioLabs पर लाइव हैं, और दोनों अनुरोधों के बजाय बातचीत हैं। आप एक वेबसॉकेट खोलते हैं, माइक्रोफ़ोन ऑडियो स्ट्रीम करते हैं, और स्पीकर के बात करते समय ऑडियो वापस आ जाता है।
Qwen3.8 ओमनी फ्लैश रीयलटाइम वह है जो देख भी सकता है। आपके द्वारा पहले से भेजे जा रहे ऑडियो के साथ, आप लाइव वीडियो फ़्रेम को पुश कर सकते हैं, और यह एक ही मोड़ में स्क्रीन पर क्या है, इसके बारे में सवालों के जवाब देगा। इसमें 56 आवाजें हैं और बातचीत के बीच में आपके कार्यों को कॉल किया जाता है।
क्वेन ऑडियो 3.1 रीयलटाइम प्लस वह है जो चीजों को देख सकता है। इसमें मूल वेब खोज है जिसे आप प्रति सत्र चालू कर सकते हैं, अपनी खुद की 27 आवाज़ें और 256K संदर्भ है।
playground में या तो प्रयास करें: ओमनी फ्लैश रीयलटाइम या ऑडियो 3.1 रीयलटाइम प्लस. सत्र शुरू करें और बात करें पर क्लिक करें.
कनेक्ट करना
प्लेटफ़ॉर्म पर प्रत्येक मॉडल के लिए एक रीयलटाइम एंडपॉइंट होता है, और आप एक क्वेरी पैरामीटर के साथ मॉडल चुनते हैं। उसी एपीआई कुंजी के साथ हैंडशेक को प्रमाणित करें जिसका उपयोग आप हर जगह करते हैं:
wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime प्राधिकरण: वाहक YOUR_EMPIRIOLABS_API_KEY
प्रोटोकॉल व्यापक रूप से उपयोग किए जाने वाले रीयलटाइम ईवेंट आकार का अनुसरण करता है, इसलिए उस सम्मेलन के खिलाफ लिखा गया क्लाइंट अपरिवर्तित काम करता है। सॉकेट पर सत्र को कॉन्फ़िगर करें session.update, माइक्रोफ़ोन ऑडियो को इस रूप में जोड़ें input_audio_buffer.append, और ऑडियो को वापस पढ़ें प्रतिक्रिया.ऑडियो.डेल्टा मिलान प्रतिलेख के साथ response.audio_transcript.डेल्टा।.
{"प्रकार": "session.update", "session": { "आवाज": "टीना", "तौर-तरीके": ["पाठ", "ऑडियो"] }}
ऑडियो 16-बिट पीसीएम के रूप में दोनों तरह से यात्रा करता है। ये दोनों मॉडल 16 किलोहर्ट्ज़ ऊपर जाते हैं और 24 किलोहर्ट्ज़ वापस आते हैं। द session.created कनेक्ट पर आपको प्राप्त होने वाला ईवेंट उस सत्र के लिए प्रारूपों की रिपोर्ट करता है, इसलिए उन्हें मानने के बजाय वहां पढ़ें।
Omni Flash रीयलटाइम पर वीडियो फ्रेम
फ़्रेम ऑडियो बफर के बगल में अपने स्वयं के बफर में जाते हैं:
{"प्रकार": "input_image_buffer.append", "छवि": "<base64 JPEG या PNG>"}
उन्हें ऐसे भेजें जैसे आप कैमरे से फ्रेम करते हैं, फिर पूछें कि आप इसे उसी स्पोकन टर्न में क्या दिखा रहे हैं। यह 50 मोड़ और 240 सेकंड का वीडियो इतिहास और 100 मोड़ और 600 सेकंड तक ऑडियो रखता है। पुराना इतिहास संदर्भ से बाहर हो जाता है क्योंकि वे सीमाएं पारित हो जाती हैं।
ऑडियो 3.1 पर वेब खोज
खोज तब तक बंद है जब तक आप इसके लिए नहीं पूछते हैं, और आप सत्र में इसके लिए पूछते हैं:
{"type": "session.update", "session": {"enable_search": true}}
इसके साथ, मॉडल उन चीजों के बारे में सवालों के जवाब दे सकता है जो इसे प्रशिक्षित करने के बाद हुई थीं। परिणाम बातचीत में जोड़े जाते हैं, इसलिए एक मोड़ जो खोज करता है, वह एक की तुलना में काफी बड़ी इनपुट टोकन गिनती की रिपोर्ट करता है जो नहीं करता है।
मूल्य निर्धारण
दोनों मॉडल मॉडल रिपोर्ट के उपयोग से प्रत्येक पूर्ण मोड़ को बिल करते हैं, दोनों दिशाओं में ऑडियो टोकन और टेक्स्ट टोकन के लिए अलग-अलग दरों के साथ। यह विभाजन मायने रखता है: एक बोला गया उत्तर ज्यादातर ऑडियो टोकन होता है, और ड्रॉप करके टेक्स्ट-ओनली उत्तर मांगता है ऑडियो से तौर-तरीके वास्तव में कम लागत है। वर्तमान दरें पर रहती हैं ओमनी फ्लैश रीयलटाइम तथा ऑडियो 3.1 रीयलटाइम प्लस मॉडल पेज और पर मूल्य निर्धारण पृष्ठ, जो आपसे जो शुल्क लिया जाता है उसके साथ तालमेल बिठाते हैं। किसी भी मॉडल में कैश्ड इनपुट टियर नहीं है, इसलिए प्रत्येक इनपुट टोकन सामान्य दर पर बिल करता है।
आपके पहले सत्र से पहले जानने लायक बातें
- सत्र रिपोर्ट की आवाज वापस न भेजें। दोनों मॉडल कनेक्ट पर एक आवाज की घोषणा करते हैं जिसे उनका अपना जनरेटर तब मना कर देता है, जो पहले मोड़ को मारता है। आवाज को अनसेट छोड़ दें और प्लेटफ़ॉर्म उस मॉडल के लिए एक कार्यशील डिफ़ॉल्ट सेट करता है, या स्वयं वॉयस लिस्ट में से एक चुनें। दो सूचियों में कोई नाम नहीं है, इसलिए एक पर काम करने वाली आवाज दूसरे पर काम नहीं करेगी।
- आवाज गतिविधि का पता लगाने के लिए आग लगाने के लिए एक पल के मौन की आवश्यकता होती है। ये मॉडल तय करते हैं कि आपने रुकते हुए सुनकर बात करना बंद कर दिया है। यदि आपका क्लाइंट स्पीकर द्वारा अंतिम शब्द समाप्त करने के तुरंत बाद ऑडियो स्ट्रीम को काट देता है, तो कुछ भी प्रतिबद्ध नहीं होता है और कोई उत्तर नहीं आता है, जो बिल्कुल टूटे हुए सत्र जैसा दिखता है। भाषण समाप्त होने के बाद लगभग एक सेकंड तक स्ट्रीमिंग करते रहें।
- वीडियो फ़्रेम संदेश सामग्री नहीं हैं। वे गुजरते हैं
input_image_buffer.append. एक छवि के अंदर रखनाconversation.item.createसामग्री सरणी को अस्वीकार कर दिया जाता है, और कुछ मॉडलों पर यह बिना किसी उपयोगकर्ता संदेश के बारी छोड़ देता है। - ऑडियो 3.1 पर, वेब खोज और फ़ंक्शन कॉलिंग परस्पर अनन्य हैं। प्रति सत्र एक सक्षम करें, दोनों नहीं।
- एक नया सॉकेट एक नई बातचीत है। कनेक्शन में कोई सर्वर-साइड मेमोरी नहीं है, इसलिए एक क्लाइंट जो पुन: कनेक्ट करता है, उसे मॉडल के पास अभी भी जो भी संदर्भ होना चाहिए उसे फिर से चलाना चाहिए।
पूर्ण ईवेंट तालिकाएँ, ध्वनि सूचियाँ और ऑडियो प्रारूप रीयलटाइम वॉयस एपीआई डॉक्स। दोनों मॉडल अब उपलब्ध हैं।



