Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream और Qwen Audio 3.1 ASR संदेश EmpirioLabs पर उपलब्ध हैं। ASR रिकॉर्ड किए गए ऑडियो को ट्रांसक्रिप्ट करता है पोस्ट /v1/audio/transcriptions. ASR स्ट्रीम और ASR संदेश लाइव ऑडियो को ट्रांसक्राइब करते हैं wss://api.empiriolabs.ai/v1/realtime. तीनों एपीआई और Playground में काम करते हैं।
तीन मॉडल
qwen-audio-3-1-asrछोटी क्लिप और लंबी रिकॉर्डिंग को ट्रांसक्रिप्ट करता है, और वाक्य खंडों और शब्द टाइमस्टैम्प के साथ प्रतिलेख लौटाता है। चीनी बोलियों सहित भाषा का स्वचालित रूप से पता लगाया जाता है।qwen-audio-3-1-asr-streamलाइव कैप्शन के लिए बनाया गया है। यह वक्ता के बात करते समय अब तक वाक्य भेजता है, फिर प्रत्येक विराम पर तय वाक्य।qwen-audio-3-1-asr-messageध्वनि संदेशों और ध्वनि इनपुट के लिए बनाया गया है। यह प्रत्येक उच्चारण को एक पूर्ण प्रतिलेख के रूप में लौटाता है जब स्पीकर रुक जाता है, जिसका कोई आंशिक परिणाम नहीं होता है।
एक रिकॉर्डिंग का प्रतिलेखन
कर्ल https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -F मॉडल =qwen-audio-3-1-asr \ -F file=@meeting.mp3
एक JSON बॉडी के साथ audio_url या audio_base64 फ़ाइल अपलोड के स्थान पर काम करता है। प्रतिक्रिया एक काम है:
{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "स्थिति": "प्रसंस्करण", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }
काम को तब तक पोल करें जब तक स्थिति है पूरा:
कर्ल https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY"
प्रतिलेख में है result.text, वाक्य खंडों के साथ परिणाम.खंड और शब्द टाइमस्टैम्प में परिणाम.शब्द. छोटी क्लिप सेकंड में समाप्त हो जाती है; लंबी रिकॉर्डिंग में अधिक समय लगता है।
WebSocket पर लाइव ट्रांसक्रिप्शन
क्वेरी स्ट्रिंग में मॉडल के साथ रीयलटाइम एंडपॉइंट खोलें और हैंडशेक पर अपनी एपीआई कुंजी खोलें:
wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream प्राधिकरण: वाहक YOUR_EMPIRIOLABS_API_KEY
16 kHz स्ट्रीम करें, 16-बिट मोनो PCM ऑडियो बेस 64 के रूप में input_audio_buffer.append घटनाओं। भेजने के लिए कोई प्रतिबद्धता नहीं है: मॉडल यह पता लगाता है कि प्रत्येक वाक्य उसके बाद आने वाले विराम से कहाँ समाप्त होता है।
{"प्रकार": "input_audio_buffer.append", "ऑडियो": "<base64 पीसीएम>"}
प्रतिलेख घटनाओं के रूप में आते हैं:
- आंशिक परिणाम।
conversation.item.input_audio_transcription.deltaअब तक की सजा को वहन करता हैटेक्स्टजबकि स्पीकर अभी भी बात कर रहा है। केवल एएसआर स्ट्रीम। - व्यवस्थित परिणाम।
conversation.item.input_audio_transcription.completedसमाप्त वाक्य या उच्चारण को वहन करता हैप्रतिलेख. दोनों मॉडल।
परिचालन नोट्स
- प्रत्येक ट्रांसक्रिप्शन अनुरोध एक नौकरी लौटाता है, यहां तक कि एक छोटी क्लिप भी। पहली प्रतिक्रिया में एक
नौकरी id, प्रतिलेख नहीं। पढ़नाresult.textसे/v1/jobs/ प्राप्त <job_id>करेंएक बारस्थितिहैपूरा।. - चित्र आदि
टेक्स्टशामिल होने के बजाय प्रत्येक आंशिक घटना सेडेल्टामान। एएसआर स्ट्रीम पर,टेक्स्टहमेशा अब तक का पूरा वाक्य होता है, इसलिए हर घटना पर प्रदर्शित लाइन को इसके साथ बदलने से लाइव कैप्शन सही रहता है। - ASR संदेश तब तक चुप रहता है जब तक स्पीकर रुक नहीं जाता। यह कोई आंशिक परिणाम नहीं भेजता है, इसलिए जब कोई बात कर रहा होता है तो कोई भी ईवेंट नहीं आता है। लाइव कैप्शन के लिए ASR स्ट्रीम का उपयोग करें।
- अंतिम शब्दों के बाद एक पल का मौन स्ट्रीम करें। एक वाक्य तब तय हो जाता है जब मॉडल स्पीकर को रुकते हुए सुनता है। अंतिम शब्दों के बाद संक्षेप में ऑडियो भेजते रहें और प्रतीक्षा करें
पूरासॉकेट बंद करने से पहले की घटना, या अंतिम वाक्य खो जाता है।
मूल्य निर्धारण
सभी तीन मॉडल आपके जाने के साथ भुगतान करते हैं, बिना किसी सदस्यता की आवश्यकता के साथ। प्रत्येक की कीमत प्रति टोकन है, ऑडियो इनपुट के लिए एक दर और ट्रांसक्रिप्ट आउटपुट के लिए एक दर के साथ, और कोई कैश्ड इनपुट टियर नहीं है। एएसआर प्रत्येक अनुरोध को बिल करता है; एएसआर स्ट्रीम और एएसआर संदेश बिल प्रत्येक पूर्ण वाक्य या उच्चारण करते हैं। लाइव मॉडल में एएसआर की तुलना में अधिक दरें हैं, इसलिए रिकॉर्डिंग के लिए एएसआर का उपयोग करें जिन्हें स्पीकर के बात करते समय परिणामों की आवश्यकता नहीं होती है। वर्तमान दरें मॉडल पृष्ठों पर हैं क्वेन ऑडियो 3.1 एएसआर, एएसआर स्ट्रीम तथा एएसआर संदेश, और पर मूल्य निर्धारण पृष्ठ।.
निर्माण शुरू करें
कोशिश क्वेन ऑडियो 3.1 एएसआर Playground में रिकॉर्डिंग अपलोड करके, या एएसआर स्ट्रीम तथा एएसआर संदेश सत्र शुरू करें और बोलने पर क्लिक करके। प्रत्येक मॉडल के लिए एपीआई संदर्भ यहां है एएसआर, एएसआर स्ट्रीम तथा एएसआर संदेश, और पूरी ईवेंट टेबल रीयलटाइम वॉयस एपीआई मार्गदर्शक।
एक ही परिवार की आवाज़ वार्तालापों के लिए, देखें Qwen3.8 Omni Flash रीयलटाइम र Qwen अडियो 3.1 का उपयोग कसरी गर्ने।.
प्रकटीकरण: यह लेख एआई सहायता के साथ लिखा गया था और EmpirioLabs AI द्वारा समीक्षा की गई थी।.



