
एक सॉकेट पर लाइव ट्रांसक्रिप्शन, वक्ता के बात करते समय आंशिक परिणाम लौटाता है, प्रत्येक वाक्य को चिह्नित करने वाली आवाज गतिविधि का पता लगाने के साथ।
एक सॉकेट पर लाइव ट्रांसक्रिप्शन, वक्ता के बात करते समय आंशिक परिणाम लौटाता है, प्रत्येक वाक्य को चिह्नित करने वाली आवाज गतिविधि का पता लगाने के साथ।
EmpirioLabs मानक /v1/audio/transcriptions समापन बिंदु को उजागर करता है और सामान्य ट्रांसक्रिप्शन प्रतिक्रिया प्रारूप में अंतिम प्रतिलेख लौटाता है।
इस नाम से भी जाना जाता है StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream
stepaudio-2-5-asr-stream/v1/realtimestepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-streamEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
StepAudio 2.5 ASR Stream HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream पर एक WebSocket के ज़रिए लाइव ऑडियो स्ट्रीम को ट्रांसक्राइब करता है। मॉडल id stepaudio-2-5-asr-stream के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। base64 16-bit PCM ऑडियो जोड़ें और बोलते रहने के दौरान ही ट्रांसक्रिप्ट इवेंट पढ़ें। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())EmpirioLabs पर StepAudio 2.5 ASR Stream API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Encoding of the audio you append to the input buffer: base64 16-bit PCM. |
| language | string | - | - | Optional language hint. Omit to let the model detect it. |
wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream पर एक WebSocket पर लाइव ट्रांसक्रिप्शन, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। 16 kHz pcm16 ऑडियो को input_audio_buffer.append के साथ स्ट्रीम करें और आंशिक परिणामों को वापस पढ़ें क्योंकि स्पीकर अभी भी बात कर रहा है, सर्वर-साइड वॉयस गतिविधि डिटेक्शन के साथ जहां प्रत्येक वाक्य समाप्त होता है। लाइव कैप्शन और वॉयस इनपुट के लिए इसका उपयोग करें; एक पूर्ण रिकॉर्डिंग के लिए, POST /v1/audio/transcriptions एक कॉल में संपूर्ण ट्रांसक्रिप्ट लौटाता है। बिलिंग आपके द्वारा स्ट्रीम किए गए ऑडियो की अवधि का अनुसरण करती है, सत्र बंद होने पर तय होती है।
EmpirioLabs पर StepAudio 2.5 ASR Stream का बिल उपयोग के अनुसार बनता है: प्रतिलेखन $0.18 प्रति घंटे का ऑडियो। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
StepAudio 2.5 ASR Stream api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
StepAudio 2.5 ASR Stream अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id stepaudio-2-5-asr-stream के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।