المنزل المدونة

كيفية استخدام واجهة برمجة تطبيقات StepAudio 3 ASR Max

StepAudio 3 ASR Max عبر غطاء API

Sep 15, 2026

EmpirioLabs AI

الإجابة المختصرة: ستيب أوديو 3 ASR ماكس هو أكبر نموذج للتعرف على الكلام في StepFun، متوفر على EmpirioLabs من خلال نقطة النهاية القياسية للنسخ. نشر ملف صوتي إلى ما بعد /v1/audio/transcriptions مع العارض: "stepaudio-3-asr-max" وتحصل على النص المكتوب. يكتشف اللغة المنطوقة بنفسه، لذا لا توجد لغة للاختيار.

طلبك الأول

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -F "model=stepaudio-3-asr-max" \ -F "file=@meeting.mp3"

يمكنك أيضا إرسال JSON مع file_url يشير إلى ملف متاح للجمهور، أو صوت base64 في audio_base64.

ما الذي صمم من أجله

هذه هي طبقة الدقة في عائلة التعرف على StepFun. تم بناؤها على نموذج لغوي كبير، لذا فهي تستخدم السياق بدلا من الصوت وحده لحل الأجزاء التي يخطئ فيها النسخ العادي:

  • أسماء الأشخاص والأماكن، أسماء الأدوية، المصطلحات التقنية، ومتجانسة النوتات
  • مفردات متخصصة في مجالات مثل القانون، المالية، الطب، السيارات، والبرمجيات
  • الكلام المحدد بلكنة، الهمس، الكلام السريع جدا، والجمل المختلطة اللغة
  • الغناء والخطابة فوق الموسيقى الخلفية

إذا كنت تنسخ الكلام النظيف العادي بصوت عال، ستيب أوديو 2.5 ASR هو الخيار الأرخص في نفس العائلة ويشارك هذا الهدف النهائي.

صيغ الإدخال

أرسلني wav, mp3, ogg, m4a، أو PCM. احتياجات PCM الخام ترميز, المعدل, القطع، و القناة إلى جانب ذلك؛ وتحمل صيغ الحاويات تلك المعلومات بنفسها.

تنسيق الأرقام

تطبيع النص العكسي مفعل افتراضيا، لذا الأرقام المنطوقة والتواريخ والعملة تعود مكتوبة بالطريقة التي يكتبها الشخص. أطفئها ب enable_itn: خطأ للحصول على الكلمات الحرفية بدلا من ذلك.

enable_itnالنص الكامل
صحيح (افتراضي)ارتفعت الإيرادات بنسبة 12٪ في جميع المناطق العام الماضي.
خطأزادت الإيرادات بنسبة اثني عشر بالمئة عبر جميع المناطق العام الماضي.

ثلاثة أشياء تثير مشاكل الناس

  1. لا يوجد إعداد لغوي. ASR Max يحدد اللغة نفسها وينسخ فيها. الصوت الياباني يعود باليابانية مهما مررت به، لذا لا تبني محدد لغة فوق هذا النموذج. يتم التعرف على الصينية، الإنجليزية، اليابانية، الكورية، الفرنسية، والإسبانية، مع وجود كل ما هو خارج الصينية والإنجليزية في المعاينة.
  2. الكلمات الساخنة وطوابع الكلمات غير متوفرة هنا. كلاهما موجود على StepAudio 2.5 ASR. إذا كنت بحاجة إلى قائمة مفردات مخصصة أو توقيت لكل كلمة، استخدم هذا النموذج بدلا من ذلك.
  3. الملفات الطويلة مقبولة، ويتم تحصيلها حسب طولها الحقيقي. الشحن يتبع مدة الصوت المحسوبة التي ترسلها، مع حد أدنى لثانية واحدة، لذا فإن تقليل الصمت من الأمام والخلف في التسجيل يستحق العناء.

التسعير

الفوترة هي لكل ساعة صوتية، ادفع حسب الاستخدام، بدون اشتراك وبدون حد أدنى للالتزام. السعر المباشر على صفحة النماذج و صفحة الأسعار.

جربها بدون كتابة كود

ضع ملفا في ستيب أوديو 3 ASR ماكس في playground واقرأ النص مباشرة إلى الخلف. المرجع الكامل للمعلمة: docs.empiriolabs.ai/models/stepaudio-3-asr-max.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.