تتوفر Qwen Audio 3.1 ASR، Qwen Audio 3.1 ASR Stream، وQwen Audio 3.1 ASR Message على EmpirioLabs. يقوم ASR بنسخ الصوت المسجل من خلال ما بعد /v1/audio/transcriptions. يتم نسخ الصوت المباشر عبر بث ASR وASR Message wss://api.empiriolabs.ai/v1/realtime. جميعهم يعملون في واجهة برمجة التطبيقات وفي Playground.
النماذج الثلاثة
qwen-audio-3-1-asrيقوم بنسخ مقاطع قصيرة وتسجيلات طويلة، ويعيد النص مع مقاطع جمل وطوابع زمنية للكلمات. يتم اكتشاف اللغة تلقائيا، بما في ذلك اللهجات الصينية.qwen-audio-3-1-asr-streamمصمم للترجمة الحية. يرسل الجملة بعيدا أثناء حديث المتحدث، ثم الجملة المحسوسة في كل توقف.qwen-audio-3-1-asr-messageمبني للرسائل الصوتية ومدخلات الصوت. يعيد كل نطق كنص كامل واحد بمجرد توقف المتحدث، دون نتائج جزئية.
نسخ تسجيل
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3
جسم JSON مع audio_url أو audio_base64 يعمل بدلا من رفع الملف. الرد هو وظيفة:
{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "status": "processing", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }
استطلاع الوظيفة حتى الحالة هي اكتمل:
curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY"
النص موجود في result.text، مع مقاطع جمل في النتائج.مقاطع وطوابع زمنية للكلمات في result.words. تنتهي المقاطع القصيرة في ثوان؛ التسجيلات الطويلة تستغرق وقتا أطول.
النسخ المباشر عبر WebSocket
افتح نقطة النهاية الفورية مع النموذج في سلسلة الاستعلام ومفتاح واجهة برمجة التطبيقات الخاص بك على المصافحة:
wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream التفويض: حامل YOUR_EMPIRIOLABS_API_KEY
بث صوت PCM أحادي 16 كيلوهرتز 16 بت كقاعدة 64 بوصة input_audio_buffer.append الأحداث. لا يوجد التزام للإرسال: النموذج يكتشف أين تنتهي كل جملة من التوقف الذي يليها.
{"type": "input_audio_buffer.append", "audio": "<base64 PCM>"}
تصل النصوص على شكل أحداث:
- نتائج جزئية.
conversation.item.input_audio_transcription.deltaيحمل الحكم حتى الآنالنصبينما لا يزال المتحدث يتحدث. فقط عبر ASR Stream. - النتائج محسومة.
conversation.item.input_audio_transcription.completedيحمل الجملة أو العبارة النهائية فيالنص الكامل. كلا الطرازين.
ملاحظات تشغيلية
- كل طلب نسخ يعيد مهمة، حتى لو كان مقطعا قصيرا. الرد الأول يحمل
job_id، ليس النص. اقرأresult.textمناذهب /v1/jobs/<job_id>مرة واحدةالحالةهياكتمل. - العرض
النصمن كل حدث جزئي بدلا من الانضمامدلتاالقيم. على ASR Stream,النصدائما ما تكون الجملة كاملة حتى الآن، لذا استبدال السطر المعروض به في كل حدث يحافظ على صحة الترجمة الحية. - رسالة ASR صامتة حتى يتوقف السماعة مؤقتا. لا يرسل أي نتائج جزئية، لذا لا تصل الأحداث أثناء حديث شخص ما. استخدم ASR Stream للترجمة الحية.
- استمر لحظة صمت بعد الكلمات الأخيرة. تستقر الجملة عندما يسمع النموذج توقف المكبر. استمر في إرسال الصوت لفترة وجيزة بعد الكلمات الأخيرة وانتظر
اكتملحدث قبل إغلاق المقبس، أو فقدان الجملة الأخيرة.
التسعير
جميع النماذج الثلاثة تعتمد على الدفع حسب الاستخدام، دون الحاجة إلى اشتراك. كل نموذج محدد لكل رمز، مع معدل واحد لإدخال الصوت وآخر لإخراج النص، ولا يوجد مستوى إدخال مخزن. ASR يحسب كل طلب؛ ASR Stream وASR Message يتحكم في كل جملة مكتملة أو نطق. النماذج الحية لديها معدلات أعلى من ASR، لذا استخدم ASR للتسجيلات التي لا تحتاج إلى نتائج أثناء حديث المتحدث. المعدلات الحالية موجودة في صفحات النموذج ل كوين أوديو 3.1 ASR, تيار ASR و رسالة ASR، وعلى صفحة الأسعار.
ابدأ البناء
حاول كوين أوديو 3.1 ASR في Playground برفع تسجيل، أو تيار ASR و رسالة ASR عن طريق النقر على بدء الجلسة والتحدث. مرجع واجهة برمجة التطبيقات لكل نموذج هو عند ASR, تيار ASR و رسالة ASR، وجداول الأحداث الكاملة موجودة في واجهة برمجة التطبيقات للصوت في الوقت الحقيقي دليل.
للمحادثات الصوتية من نفس العائلة، انظر كيفية استخدام Qwen3.8 Omni Flash Realtime و Qwen Audio 3.1.
إفصاح: كتب هذا المقال بمساعدة الذكاء الاصطناعي وتمت مراجعته من قبل EmpirioLabs AI.



