घर ब्लॉग

Qwen ऑडियो 3.1 ASR, ASR स्ट्रीम और ASR संदेश का उपयोग कैसे करें

Qwen ऑडियो 3.1 ASR, ASR स्ट्रीम और ASR संदेश API के माध्यम से

Sep 24, 2026

EmpirioLabs AI

Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream और Qwen Audio 3.1 ASR संदेश EmpirioLabs पर उपलब्ध हैं। ASR रिकॉर्ड किए गए ऑडियो को ट्रांसक्रिप्ट करता है पोस्ट /v1/audio/transcriptions. ASR स्ट्रीम और ASR संदेश लाइव ऑडियो को ट्रांसक्राइब करते हैं wss://api.empiriolabs.ai/v1/realtime. तीनों एपीआई और Playground में काम करते हैं।

तीन मॉडल

  • qwen-audio-3-1-asr छोटी क्लिप और लंबी रिकॉर्डिंग को ट्रांसक्रिप्ट करता है, और वाक्य खंडों और शब्द टाइमस्टैम्प के साथ प्रतिलेख लौटाता है। चीनी बोलियों सहित भाषा का स्वचालित रूप से पता लगाया जाता है।
  • qwen-audio-3-1-asr-stream लाइव कैप्शन के लिए बनाया गया है। यह वक्ता के बात करते समय अब तक वाक्य भेजता है, फिर प्रत्येक विराम पर तय वाक्य।
  • qwen-audio-3-1-asr-message ध्वनि संदेशों और ध्वनि इनपुट के लिए बनाया गया है। यह प्रत्येक उच्चारण को एक पूर्ण प्रतिलेख के रूप में लौटाता है जब स्पीकर रुक जाता है, जिसका कोई आंशिक परिणाम नहीं होता है।

एक रिकॉर्डिंग का प्रतिलेखन

कर्ल https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -F मॉडल =qwen-audio-3-1-asr \ -F file=@meeting.mp3

एक JSON बॉडी के साथ audio_url या audio_base64 फ़ाइल अपलोड के स्थान पर काम करता है। प्रतिक्रिया एक काम है:

{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "स्थिति": "प्रसंस्करण", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }

काम को तब तक पोल करें जब तक स्थिति है पूरा:

कर्ल https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY"

प्रतिलेख में है result.text, वाक्य खंडों के साथ परिणाम.खंड और शब्द टाइमस्टैम्प में परिणाम.शब्द. छोटी क्लिप सेकंड में समाप्त हो जाती है; लंबी रिकॉर्डिंग में अधिक समय लगता है।

WebSocket पर लाइव ट्रांसक्रिप्शन

क्वेरी स्ट्रिंग में मॉडल के साथ रीयलटाइम एंडपॉइंट खोलें और हैंडशेक पर अपनी एपीआई कुंजी खोलें:

wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream प्राधिकरण: वाहक YOUR_EMPIRIOLABS_API_KEY

16 kHz स्ट्रीम करें, 16-बिट मोनो PCM ऑडियो बेस 64 के रूप में input_audio_buffer.append घटनाओं। भेजने के लिए कोई प्रतिबद्धता नहीं है: मॉडल यह पता लगाता है कि प्रत्येक वाक्य उसके बाद आने वाले विराम से कहाँ समाप्त होता है।

{"प्रकार": "input_audio_buffer.append", "ऑडियो": "<base64 पीसीएम>"}

प्रतिलेख घटनाओं के रूप में आते हैं:

  • आंशिक परिणाम। conversation.item.input_audio_transcription.delta अब तक की सजा को वहन करता है टेक्स्ट जबकि स्पीकर अभी भी बात कर रहा है। केवल एएसआर स्ट्रीम।
  • व्यवस्थित परिणाम। conversation.item.input_audio_transcription.completed समाप्त वाक्य या उच्चारण को वहन करता है प्रतिलेख. दोनों मॉडल।

परिचालन नोट्स

  1. प्रत्येक ट्रांसक्रिप्शन अनुरोध एक नौकरी लौटाता है, यहां तक कि एक छोटी क्लिप भी। पहली प्रतिक्रिया में एक नौकरी id, प्रतिलेख नहीं। पढ़ना result.text से /v1/jobs/ प्राप्त <job_id>करें एक बार स्थिति है पूरा।.
  2. चित्र आदि टेक्स्ट शामिल होने के बजाय प्रत्येक आंशिक घटना से डेल्टा मान। एएसआर स्ट्रीम पर, टेक्स्ट हमेशा अब तक का पूरा वाक्य होता है, इसलिए हर घटना पर प्रदर्शित लाइन को इसके साथ बदलने से लाइव कैप्शन सही रहता है।
  3. ASR संदेश तब तक चुप रहता है जब तक स्पीकर रुक नहीं जाता। यह कोई आंशिक परिणाम नहीं भेजता है, इसलिए जब कोई बात कर रहा होता है तो कोई भी ईवेंट नहीं आता है। लाइव कैप्शन के लिए ASR स्ट्रीम का उपयोग करें।
  4. अंतिम शब्दों के बाद एक पल का मौन स्ट्रीम करें। एक वाक्य तब तय हो जाता है जब मॉडल स्पीकर को रुकते हुए सुनता है। अंतिम शब्दों के बाद संक्षेप में ऑडियो भेजते रहें और प्रतीक्षा करें पूरा सॉकेट बंद करने से पहले की घटना, या अंतिम वाक्य खो जाता है।

मूल्य निर्धारण

सभी तीन मॉडल आपके जाने के साथ भुगतान करते हैं, बिना किसी सदस्यता की आवश्यकता के साथ। प्रत्येक की कीमत प्रति टोकन है, ऑडियो इनपुट के लिए एक दर और ट्रांसक्रिप्ट आउटपुट के लिए एक दर के साथ, और कोई कैश्ड इनपुट टियर नहीं है। एएसआर प्रत्येक अनुरोध को बिल करता है; एएसआर स्ट्रीम और एएसआर संदेश बिल प्रत्येक पूर्ण वाक्य या उच्चारण करते हैं। लाइव मॉडल में एएसआर की तुलना में अधिक दरें हैं, इसलिए रिकॉर्डिंग के लिए एएसआर का उपयोग करें जिन्हें स्पीकर के बात करते समय परिणामों की आवश्यकता नहीं होती है। वर्तमान दरें मॉडल पृष्ठों पर हैं क्वेन ऑडियो 3.1 एएसआर, एएसआर स्ट्रीम तथा एएसआर संदेश, और पर मूल्य निर्धारण पृष्ठ।.

निर्माण शुरू करें

कोशिश क्वेन ऑडियो 3.1 एएसआर Playground में रिकॉर्डिंग अपलोड करके, या एएसआर स्ट्रीम तथा एएसआर संदेश सत्र शुरू करें और बोलने पर क्लिक करके। प्रत्येक मॉडल के लिए एपीआई संदर्भ यहां है एएसआर, एएसआर स्ट्रीम तथा एएसआर संदेश, और पूरी ईवेंट टेबल रीयलटाइम वॉयस एपीआई मार्गदर्शक।

एक ही परिवार की आवाज़ वार्तालापों के लिए, देखें Qwen3.8 Omni Flash रीयलटाइम र Qwen अडियो 3.1 का उपयोग कसरी गर्ने।.

प्रकटीकरण: यह लेख एआई सहायता के साथ लिखा गया था और EmpirioLabs AI द्वारा समीक्षा की गई थी।.

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।