संक्षिप्त उत्तर: स्टेपऑडियो 3 एएसआर मैक्स StepFun का सबसे बड़ा वाक् पहचान मॉडल है, जो मानक ट्रांसक्रिप्शन समापन बिंदु के माध्यम से EmpirioLabs पर उपलब्ध है। एक ऑडियो फ़ाइल पोस्ट करें पोस्ट /v1/audio/transcriptions साथ मॉडल: "stepaudio-3-asr-max" और आपको प्रतिलेख वापस मिल जाता है। यह बोली जाने वाली भाषा का अपने आप पता लगाता है, इसलिए चुनने के लिए कोई भाषा नहीं है।
आपका पहला अनुरोध
कर्ल https://api.empiriolabs.ai/v1/audio/transcriptions \ -एच "प्राधिकरण: वाहक $EMPIRIOLABS_एपीआई_की" \ -एफ "मॉडल = stepaudio-3-asr-max" \ -एफ "file=@meeting.mp3"
आप JSON को एक के साथ भी भेज सकते हैं file_url सार्वजनिक रूप से पहुंच योग्य फ़ाइल, या Base64 ऑडियो को इंगित करना audio_base64।.
यह किस लिए बनाया गया है
यह StepFun पहचान परिवार का सटीकता स्तर है। यह एक बड़े भाषा मॉडल पर बनाया गया है, इसलिए यह उन हिस्सों को हल करने के लिए अकेले ध्वनि के बजाय संदर्भ का उपयोग करता है जो सामान्य प्रतिलेखन गलत हो जाते हैं:
- व्यक्ति और स्थान के नाम, दवा के नाम, तकनीकी शब्द और होमोफ़ोन
- कानूनी, वित्त, चिकित्सा, मोटर वाहन और सॉफ्टवेयर जैसे डोमेन में विशेषज्ञ शब्दावली
- उच्चारण भाषण, फुसफुसाहट, बहुत तेज भाषण, और मिश्रित भाषा के वाक्य
- पृष्ठभूमि संगीत पर गायन और भाषण
यदि आप मात्रा में साधारण स्वच्छ भाषण का प्रतिलेखन कर रहे हैं, स्टेपऑडियो 2.5 एएसआर एक ही परिवार में सस्ता विकल्प है और इस समापन बिंदु को साझा करता है।
इनपुट प्रारूप
भेजें लहर, एमपी3, ogg, एम4ए, या पीसीएम. कच्चे पीसीएम की जरूरत है कोडेक, दर, बिट्स, और चैनल इसके साथ; कंटेनर प्रारूप उस जानकारी को स्वयं ले जाते हैं।
संख्या स्वरूपण
व्युत्क्रम पाठ सामान्यीकरण डिफ़ॉल्ट रूप से चालू होता है, इसलिए बोली जाने वाली संख्याएँ, दिनांक और मुद्रा वापस आती हैं जिस तरह से कोई व्यक्ति उन्हें टाइप करेगा. इसे बंद करें enable_itn: असत्य इसके बजाय शाब्दिक शब्द प्राप्त करने के लिए।
enable_itn | प्रतिलेख |
|---|---|
सच (डिफ़ॉल्ट) | पिछले साल सभी क्षेत्रों में राजस्व में 12% की वृद्धि हुई। |
गलत | पिछले साल सभी क्षेत्रों में राजस्व में बारह प्रतिशत की वृद्धि हुई। |
तीन चीजें जो लोगों को पकड़ती हैं
- कोई भाषा सेटिंग नहीं है। एएसआर मैक्स स्वयं भाषा की पहचान करता है और उसमें प्रतिलेखन करता है। आप जो भी पास करते हैं जापानी ऑडियो जापानी में वापस आता है, इसलिए इस मॉडल के शीर्ष पर भाषा चयनकर्ता का निर्माण न करें। चीनी, अंग्रेजी, जापानी, कोरियाई, फ्रेंच और स्पेनिश को पहचाना जाता है, पूर्वावलोकन में चीनी और अंग्रेजी के बाहर सब कुछ के साथ।
- हॉटवर्ड्स और वर्ड टाइमस्टैम्प यहां उपलब्ध नहीं हैं। दोनों StepAudio 2.5 ASR पर मौजूद हैं। यदि आपको कस्टम शब्दावली सूची या प्रति-शब्द समय की आवश्यकता है, तो इसके बजाय उस मॉडल का उपयोग करें।
- लंबी फाइलों को स्वीकार किया जाता है, और उनकी वास्तविक लंबाई के आधार पर बिल किया जाता है। चार्जिंग आपके द्वारा भेजे गए ऑडियो की मापी गई अवधि का अनुसरण करती है, जिसमें न्यूनतम एक सेकंड होता है, इसलिए रिकॉर्डिंग के आगे और पीछे की चुप्पी को ट्रिम करना उचित है।
मूल्य निर्धारण
बिलिंग प्रति घंटे ऑडियो है, जैसे ही आप जाते हैं, बिना किसी सदस्यता और बिना किसी न्यूनतम प्रतिबद्धता के भुगतान करें। लाइव दर पर है मॉडल पेज और मूल्य निर्धारण पृष्ठ।.
कोड लिखे बिना इसे आज़माएं
किसी फ़ाइल को इसमें छोड़ें playground में स्टेपऑडियो 3 एएसआर मैक्स और प्रतिलेख को सीधे वापस पढ़ें। पूर्ण पैरामीटर संदर्भ: docs.empiriolabs.ai/models/stepaudio-3-asr-max।.



