
उचित संज्ञाओं, तकनीकी शब्दों, बोलियों और फुसफुसाहट, तेज भाषण और गायन सहित कठिन ऑडियो के लिए संदर्भ-जागरूक प्रतिलेखन।
उचित संज्ञाओं, तकनीकी शब्दों, बोलियों और फुसफुसाहट, तेज भाषण और गायन सहित कठिन ऑडियो के लिए संदर्भ-जागरूक प्रतिलेखन।
EmpirioLabs मानक /v1/audio/transcriptions समापन बिंदु को उजागर करता है और सामान्य ट्रांसक्रिप्शन प्रतिक्रिया प्रारूप में अंतिम प्रतिलेख लौटाता है।
इस नाम से भी जाना जाता है StepFun StepAudio 3 ASR Max
stepaudio-3-asr-max/v1/audio/transcriptionsstepfun/stepaudio-3-asr-maxEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
StepAudio 3 ASR Max POST /v1/audio/transcriptions से चलता है। request तुरंत job_id देती है; job पूरा होने तक GET /v1/jobs/{job_id} को poll करें और परिणाम से आउटपुट URLs पढ़ें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs पर StepAudio 3 ASR Max API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| file | string | - | - | ट्रांसक्रिप्शन के लिए ऑडियो फ़ाइल अपलोड। |
| file_url | string | - | - | किसी ऑडियो फ़ाइल का सार्वजनिक URL. |
| audio_base64 | string | - | - | JSON अनुरोधों के लिए Base64 ऑडियो पेलोड। |
| enable_itn | boolean | true | - | व्युत्क्रम पाठ सामान्यीकरण सक्षम करें, जो संख्याओं, दिनांकों और मुद्रा को उनके लिखित रूप में लिखता है. |
| format | enum | wav | wav, mp3, ogg, m4a, pcm | ऑडियो कंटेनर प्रारूप। |
| codec | string | - | - | पीसीएम कोडेक जैसे pcm_s16le। |
| rate | number | - | - | हर्ट्ज में पीसीएम नमूना दर। |
| bits | number | - | - | पीसीएम बिट गहराई। |
| channel | number | - | - | पीसीएम चैनल गिनती। |
wav, mp3, ogg, m4a और pcm इनपुट का समर्थन करता है. PCM अनुरोधों में कोडेक, नमूना दर, बिट गहराई और चैनल गणना शामिल होनी चाहिए. भाषा का स्वचालित रूप से पता लगाया जाता है और इसे सेट नहीं किया जा सकता है; चीनी, अंग्रेजी, जापानी, कोरियाई, फ्रेंच और स्पैनिश को पहचाना जाता है, पूर्वावलोकन में चीनी और अंग्रेजी के अलावा अन्य भाषाओं के साथ. व्युत्क्रम पाठ सामान्यीकरण डिफ़ॉल्ट रूप से चालू होता है और इसे enable_itn के साथ बंद किया जा सकता है. इस मॉडल पर हॉटवर्ड और शब्द टाइमस्टैम्प उपलब्ध नहीं हैं. ऑडियो को उसकी मापी गई अवधि के आधार पर बिल किया जाता है, जिसमें न्यूनतम एक सेकंड होता है.
EmpirioLabs पर StepAudio 3 ASR Max का बिल उपयोग के अनुसार बनता है: प्रतिलेखन $0.24 प्रति घंटे का ऑडियो। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
StepAudio 3 ASR Max api.empiriolabs.ai पर POST /v1/audio/transcriptions के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में StepAudio 3 ASR Max को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।