المنزل المدونة

كيفية استخدام Qwen Audio 3.1 ASR، ASR Stream، وASR Message

Qwen Audio 3.1 ASR، ASR Stream، وASR Message عبر API

Sep 24, 2026

EmpirioLabs AI

تتوفر Qwen Audio 3.1 ASR، Qwen Audio 3.1 ASR Stream، وQwen Audio 3.1 ASR Message على EmpirioLabs. يقوم ASR بنسخ الصوت المسجل من خلال ما بعد /v1/audio/transcriptions. يتم نسخ الصوت المباشر عبر بث ASR وASR Message wss://api.empiriolabs.ai/v1/realtime. جميعهم يعملون في واجهة برمجة التطبيقات وفي Playground.

النماذج الثلاثة

  • qwen-audio-3-1-asr يقوم بنسخ مقاطع قصيرة وتسجيلات طويلة، ويعيد النص مع مقاطع جمل وطوابع زمنية للكلمات. يتم اكتشاف اللغة تلقائيا، بما في ذلك اللهجات الصينية.
  • qwen-audio-3-1-asr-stream مصمم للترجمة الحية. يرسل الجملة بعيدا أثناء حديث المتحدث، ثم الجملة المحسوسة في كل توقف.
  • qwen-audio-3-1-asr-message مبني للرسائل الصوتية ومدخلات الصوت. يعيد كل نطق كنص كامل واحد بمجرد توقف المتحدث، دون نتائج جزئية.

نسخ تسجيل

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3

جسم JSON مع audio_url أو audio_base64 يعمل بدلا من رفع الملف. الرد هو وظيفة:

{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "status": "processing", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }

استطلاع الوظيفة حتى الحالة هي اكتمل:

curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY"

النص موجود في result.text، مع مقاطع جمل في النتائج.مقاطع وطوابع زمنية للكلمات في result.words. تنتهي المقاطع القصيرة في ثوان؛ التسجيلات الطويلة تستغرق وقتا أطول.

النسخ المباشر عبر WebSocket

افتح نقطة النهاية الفورية مع النموذج في سلسلة الاستعلام ومفتاح واجهة برمجة التطبيقات الخاص بك على المصافحة:

wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream التفويض: حامل YOUR_EMPIRIOLABS_API_KEY

بث صوت PCM أحادي 16 كيلوهرتز 16 بت كقاعدة 64 بوصة input_audio_buffer.append الأحداث. لا يوجد التزام للإرسال: النموذج يكتشف أين تنتهي كل جملة من التوقف الذي يليها.

{"type": "input_audio_buffer.append", "audio": "<base64 PCM>"}

تصل النصوص على شكل أحداث:

  • نتائج جزئية. conversation.item.input_audio_transcription.delta يحمل الحكم حتى الآن النص بينما لا يزال المتحدث يتحدث. فقط عبر ASR Stream.
  • النتائج محسومة. conversation.item.input_audio_transcription.completed يحمل الجملة أو العبارة النهائية في النص الكامل. كلا الطرازين.

ملاحظات تشغيلية

  1. كل طلب نسخ يعيد مهمة، حتى لو كان مقطعا قصيرا. الرد الأول يحمل job_id، ليس النص. اقرأ result.text من اذهب /v1/jobs/<job_id> مرة واحدة الحالة هي اكتمل.
  2. العرض النص من كل حدث جزئي بدلا من الانضمام دلتا القيم. على ASR Stream, النص دائما ما تكون الجملة كاملة حتى الآن، لذا استبدال السطر المعروض به في كل حدث يحافظ على صحة الترجمة الحية.
  3. رسالة ASR صامتة حتى يتوقف السماعة مؤقتا. لا يرسل أي نتائج جزئية، لذا لا تصل الأحداث أثناء حديث شخص ما. استخدم ASR Stream للترجمة الحية.
  4. استمر لحظة صمت بعد الكلمات الأخيرة. تستقر الجملة عندما يسمع النموذج توقف المكبر. استمر في إرسال الصوت لفترة وجيزة بعد الكلمات الأخيرة وانتظر اكتمل حدث قبل إغلاق المقبس، أو فقدان الجملة الأخيرة.

التسعير

جميع النماذج الثلاثة تعتمد على الدفع حسب الاستخدام، دون الحاجة إلى اشتراك. كل نموذج محدد لكل رمز، مع معدل واحد لإدخال الصوت وآخر لإخراج النص، ولا يوجد مستوى إدخال مخزن. ASR يحسب كل طلب؛ ASR Stream وASR Message يتحكم في كل جملة مكتملة أو نطق. النماذج الحية لديها معدلات أعلى من ASR، لذا استخدم ASR للتسجيلات التي لا تحتاج إلى نتائج أثناء حديث المتحدث. المعدلات الحالية موجودة في صفحات النموذج ل كوين أوديو 3.1 ASR, تيار ASR و رسالة ASR، وعلى صفحة الأسعار.

ابدأ البناء

حاول كوين أوديو 3.1 ASR في Playground برفع تسجيل، أو تيار ASR و رسالة ASR عن طريق النقر على بدء الجلسة والتحدث. مرجع واجهة برمجة التطبيقات لكل نموذج هو عند ASR, تيار ASR و رسالة ASR، وجداول الأحداث الكاملة موجودة في واجهة برمجة التطبيقات للصوت في الوقت الحقيقي دليل.

للمحادثات الصوتية من نفس العائلة، انظر كيفية استخدام Qwen3.8 Omni Flash Realtime و Qwen Audio 3.1.

إفصاح: كتب هذا المقال بمساعدة الذكاء الاصطناعي وتمت مراجعته من قبل EmpirioLabs AI.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.