Qwen Audio 3.1 ASR Stream एपीआई

एक सॉकेट पर लाइव ट्रांसक्रिप्शन, वक्ता के बात करते समय आंशिक शब्दों को स्ट्रीम करना और प्रत्येक विराम पर एक तय वाक्य, प्रति टोकन की कीमत।

Alibaba Cloudप्रतिलेखनSingaporeस्वामित्व वाला एंडपॉइंटनया

Qwen Audio 3.1 ASR Stream के बारे में

एक सॉकेट पर लाइव ट्रांसक्रिप्शन, वक्ता के बात करते समय आंशिक शब्दों को स्ट्रीम करना और प्रत्येक विराम पर एक तय वाक्य, प्रति टोकन की कीमत।

सॉकेट पर 16 kHz pcm16 ऑडियो स्ट्रीम करें। स्पीकर के बात करते समय आंशिक परिणाम आते हैं।

इस नाम से भी जाना जाता है Qwen Audio ASR Stream, Alibaba Cloud Qwen Audio 3.1 ASR Stream

transcriptionspeech to textrealtimestreaming asrmultilingual

Qwen Audio 3.1 ASR Stream की विशेषताएं

मॉडल ID
qwen-audio-3-1-asr-stream
निर्माता
Alibaba Cloud
श्रेणी
प्रतिलेखन
रिलीज
-
इनपुट
ऑडियो
आउटपुट
टेक्स्ट
रीजन
Singapore
एंडपॉइंट
WEBSOCKET/v1/realtime
वैकल्पिक मॉडल ID
qwen-audio-3.1-asr-streamalibaba/qwen-audio-3-1-asr-stream

Qwen Audio 3.1 ASR Stream API की कीमतें

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
इनपुट
प्रति 1M ऑडियो इनपुट टोकन
$1.86
उत्पादन
प्रति 1M जेनरेट किए गए टोकन
$1.40
पूरे कीमत पेज पर तुलना करें

Qwen Audio 3.1 ASR Stream API को कैसे कॉल करें

Qwen Audio 3.1 ASR Stream HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream पर एक WebSocket के ज़रिए लाइव ऑडियो स्ट्रीम को ट्रांसक्राइब करता है। मॉडल id qwen-audio-3-1-asr-stream के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। base64 16-bit PCM ऑडियो जोड़ें और बोलते रहने के दौरान ही ट्रांसक्रिप्ट इवेंट पढ़ें। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Qwen Audio 3.1 ASR Stream API का पूरा संदर्भ

Qwen Audio 3.1 ASR Stream API के पैरामीटर

EmpirioLabs पर Qwen Audio 3.1 ASR Stream API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
input_audio_formatenumpcm16pcm16ऑडियो आप इनपुट बफर के लिए जोड़ने के लिए एन्कोडिंग: base64 16 16 बिट पीसीएम, मोनो, 16 kHz पर.

जानने योग्य

कनेक्टिंग wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream पर एक वेबसॉकेट पर लाइव ट्रांसक्रिप्शन, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। ऑडियो भेजना input_audio_buffer.append के साथ 16 kHz मोनो pcm16 ऑडियो स्ट्रीम करें। वॉयस एक्टिविटी डिटेक्शन यह तय करता है कि प्रत्येक वाक्य कहाँ समाप्त होता है, इसलिए भेजने के लिए कोई प्रतिबद्धता नहीं है। क्या वापस आता है conversation.item.input_audio_transcription.delta घटनाओं में वाक्य को अब तक ले जाया जाता है, जबकि वक्ता अभी भी बात कर रहा होता है, और conversation.item.input_audio_transcription.completed प्रत्येक विराम पर तय वाक्य को वहन करता है। बिलिंग इनपुट और आउटपुट टोकन की कीमत प्रति 1M है, और प्रत्येक पूर्ण वाक्य को मॉडल रिपोर्ट के उपयोग से अपने आप बिल किया जाता है।

Qwen Audio 3.1 ASR Stream API: आम सवाल

Qwen Audio 3.1 ASR Stream API की कीमत कितनी है?

EmpirioLabs पर Qwen Audio 3.1 ASR Stream का बिल उपयोग के अनुसार बनता है: इनपुट $1.86 प्रति 1M ऑडियो इनपुट टोकन; उत्पादन $1.40 प्रति 1M जेनरेट किए गए टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

Qwen Audio 3.1 ASR Stream कौन सा endpoint उपयोग करता है?

Qwen Audio 3.1 ASR Stream api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में Qwen Audio 3.1 ASR Stream आज़मा सकता हूं?

EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। Qwen Audio 3.1 ASR Stream अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id qwen-audio-3-1-asr-stream के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।

Qwen Audio 3.1 ASR Stream की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।