
एक सॉकेट पर लाइव ट्रांसक्रिप्शन, अंतरिम परिणाम लौटाता है, जबकि स्पीकर अभी भी बात कर रहा है और प्रत्येक वाक्यांश समाप्त होने के बाद एक व्यवस्थित प्रतिलेख।
एक सॉकेट पर लाइव ट्रांसक्रिप्शन, अंतरिम परिणाम लौटाता है, जबकि स्पीकर अभी भी बात कर रहा है और प्रत्येक वाक्यांश समाप्त होने के बाद एक व्यवस्थित प्रतिलेख।
ऑडियो 16 kHz मोनो 16-बिट पीसीएम के कच्चे बाइनरी फ्रेम के रूप में ऊपर जाता है। अंतरिम और बसे हुए टेप परिणाम घटनाओं के रूप में वापस आते हैं।
इस नाम से भी जाना जाता है Deepgram-Nova-3-Stream
deepgram-nova-3-stream/v1/realtimenova-3-streamdeepgram/deepgram-nova-3-streamEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Deepgram Nova-3 Stream HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream पर एक WebSocket के ज़रिए लाइव ऑडियो स्ट्रीम को ट्रांसक्राइब करता है। मॉडल id deepgram-nova-3-stream के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। base64 16-bit PCM ऑडियो जोड़ें और बोलते रहने के दौरान ही ट्रांसक्रिप्ट इवेंट पढ़ें। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())EmpirioLabs पर Deepgram Nova-3 Stream API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input_audio_format | enum | linear16 | linear16 | Encoding of the audio you send up: 16 kHz mono 16-bit PCM, as raw binary frames rather than base64. |
| language | string | - | - | Optional language hint. Omit to let the model detect it. |
wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream पर एक WebSocket पर लाइव ट्रांसक्रिप्शन, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। 16 kHz मोनो 16-बिट PCM को बाइनरी फ्रेम के रूप में भेजें और ट्रांसक्रिप्ट ईवेंट वापस पढ़ें; अंतरिम परिणाम तब आते हैं जब वक्ता अभी भी बात कर रहा होता है, और प्रत्येक वाक्यांश is_final के साथ व्यवस्थित होता है। किसी विशिष्ट भाषा को ट्रांसक्राइब करने के लिए कनेक्शन URL में language= जोड़ें। बिलिंग आपके द्वारा भेजे गए ऑडियो का प्रति मिनट है।
EmpirioLabs पर Deepgram Nova-3 Stream का बिल उपयोग के अनुसार बनता है: प्रतिलेखन $0.025 प्रति मिनट ऑडियो। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Deepgram Nova-3 Stream api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
Deepgram Nova-3 Stream अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id deepgram-nova-3-stream के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।