घर ब्लॉग

StepAudio 3 ASR Max API का उपयोग कैसे करें

एपीआई कवर के माध्यम से स्टेपऑडियो 3 एएसआर मैक्स

Sep 15, 2026

EmpirioLabs AI

संक्षिप्त उत्तर: स्टेपऑडियो 3 एएसआर मैक्स StepFun का सबसे बड़ा वाक् पहचान मॉडल है, जो मानक ट्रांसक्रिप्शन समापन बिंदु के माध्यम से EmpirioLabs पर उपलब्ध है। एक ऑडियो फ़ाइल पोस्ट करें पोस्ट /v1/audio/transcriptions साथ मॉडल: "stepaudio-3-asr-max" और आपको प्रतिलेख वापस मिल जाता है। यह बोली जाने वाली भाषा का अपने आप पता लगाता है, इसलिए चुनने के लिए कोई भाषा नहीं है।

आपका पहला अनुरोध

कर्ल https://api.empiriolabs.ai/v1/audio/transcriptions \ -एच "प्राधिकरण: वाहक $EMPIRIOLABS_एपीआई_की" \ -एफ "मॉडल = stepaudio-3-asr-max" \ -एफ "file=@meeting.mp3"

आप JSON को एक के साथ भी भेज सकते हैं file_url सार्वजनिक रूप से पहुंच योग्य फ़ाइल, या Base64 ऑडियो को इंगित करना audio_base64।.

यह किस लिए बनाया गया है

यह StepFun पहचान परिवार का सटीकता स्तर है। यह एक बड़े भाषा मॉडल पर बनाया गया है, इसलिए यह उन हिस्सों को हल करने के लिए अकेले ध्वनि के बजाय संदर्भ का उपयोग करता है जो सामान्य प्रतिलेखन गलत हो जाते हैं:

  • व्यक्ति और स्थान के नाम, दवा के नाम, तकनीकी शब्द और होमोफ़ोन
  • कानूनी, वित्त, चिकित्सा, मोटर वाहन और सॉफ्टवेयर जैसे डोमेन में विशेषज्ञ शब्दावली
  • उच्चारण भाषण, फुसफुसाहट, बहुत तेज भाषण, और मिश्रित भाषा के वाक्य
  • पृष्ठभूमि संगीत पर गायन और भाषण

यदि आप मात्रा में साधारण स्वच्छ भाषण का प्रतिलेखन कर रहे हैं, स्टेपऑडियो 2.5 एएसआर एक ही परिवार में सस्ता विकल्प है और इस समापन बिंदु को साझा करता है।

इनपुट प्रारूप

भेजें लहर, एमपी3, ogg, एम4ए, या पीसीएम. कच्चे पीसीएम की जरूरत है कोडेक, दर, बिट्स, और चैनल इसके साथ; कंटेनर प्रारूप उस जानकारी को स्वयं ले जाते हैं।

संख्या स्वरूपण

व्युत्क्रम पाठ सामान्यीकरण डिफ़ॉल्ट रूप से चालू होता है, इसलिए बोली जाने वाली संख्याएँ, दिनांक और मुद्रा वापस आती हैं जिस तरह से कोई व्यक्ति उन्हें टाइप करेगा. इसे बंद करें enable_itn: असत्य इसके बजाय शाब्दिक शब्द प्राप्त करने के लिए।

enable_itnप्रतिलेख
सच (डिफ़ॉल्ट)पिछले साल सभी क्षेत्रों में राजस्व में 12% की वृद्धि हुई।
गलतपिछले साल सभी क्षेत्रों में राजस्व में बारह प्रतिशत की वृद्धि हुई।

तीन चीजें जो लोगों को पकड़ती हैं

  1. कोई भाषा सेटिंग नहीं है। एएसआर मैक्स स्वयं भाषा की पहचान करता है और उसमें प्रतिलेखन करता है। आप जो भी पास करते हैं जापानी ऑडियो जापानी में वापस आता है, इसलिए इस मॉडल के शीर्ष पर भाषा चयनकर्ता का निर्माण न करें। चीनी, अंग्रेजी, जापानी, कोरियाई, फ्रेंच और स्पेनिश को पहचाना जाता है, पूर्वावलोकन में चीनी और अंग्रेजी के बाहर सब कुछ के साथ।
  2. हॉटवर्ड्स और वर्ड टाइमस्टैम्प यहां उपलब्ध नहीं हैं। दोनों StepAudio 2.5 ASR पर मौजूद हैं। यदि आपको कस्टम शब्दावली सूची या प्रति-शब्द समय की आवश्यकता है, तो इसके बजाय उस मॉडल का उपयोग करें।
  3. लंबी फाइलों को स्वीकार किया जाता है, और उनकी वास्तविक लंबाई के आधार पर बिल किया जाता है। चार्जिंग आपके द्वारा भेजे गए ऑडियो की मापी गई अवधि का अनुसरण करती है, जिसमें न्यूनतम एक सेकंड होता है, इसलिए रिकॉर्डिंग के आगे और पीछे की चुप्पी को ट्रिम करना उचित है।

मूल्य निर्धारण

बिलिंग प्रति घंटे ऑडियो है, जैसे ही आप जाते हैं, बिना किसी सदस्यता और बिना किसी न्यूनतम प्रतिबद्धता के भुगतान करें। लाइव दर पर है मॉडल पेज और मूल्य निर्धारण पृष्ठ।.

कोड लिखे बिना इसे आज़माएं

किसी फ़ाइल को इसमें छोड़ें playground में स्टेपऑडियो 3 एएसआर मैक्स और प्रतिलेख को सीधे वापस पढ़ें। पूर्ण पैरामीटर संदर्भ: docs.empiriolabs.ai/models/stepaudio-3-asr-max।.

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।