المنزل المدونة

كيفية استخدام واجهة برمجة تطبيقات الفلاش TTS 2

كيفية استخدام واجهة برمجة تطبيقات الفلاش TTS 2

Sep 4, 2026

EmpirioLabs AI

TTS 2 Flash متوفر على EmpirioLabs. أطلقت Inworld عائلة Realtime TTS-2 إلى التوفر العام، وFlash هو العضو الأول في زمن التأخير فيها. يحمل هوية صوت واحدة عبر 200+ لغة وموقع، ويبث الصوت أثناء التوليف، ويمكنه إرجاع طوابع زمنية لكل كلمة أو لكل حرف. Realtime TTS-2، الطراز الأول الجودة من نفس العائلة، متاح على المنصة إلى جانبه.

ما يدعمه TTS 2 Flash

يأخذ الفلاش النص ويعيد الصوت. يغطي 200+ لغة ومنطقة بهوية صوتية واحدة، لذا نفس معرف الصوت يحتفظ بحرف التعريف عند تغيير اللغة، بما في ذلك التبديل في منتصف الجيل. الإخراج يعود كMP3، WAV، OGG، FLAC، PCM، A-law، أو mu-law بمعدلات عينة من 8 كيلوهرتز إلى 48 كيلوهرتز.

قائمة الصوت المنسدلة تعرض 20 إعدادا مسبقا مختارة بعناية. هذه قائمة راحة، وليست الكتالوج: مرر أي معرف صوتي آخر، بما في ذلك الأصوات الإقليمية والمستنسخة، voice_id، واستدعاء نقطة نهاية الأصوات لتعداد ما هو متاح.

كيفية استدعاء TTS 2 Flash

استخدم نقطة النهاية والضبط المتوافق مع OpenAI للكلام النموذج إلى tts-2-flash:

curl https://api.empiriolabs.ai/v1/audio/speech \ -H 'التفويض: حامل $EMPIRIOLABS_API_KEY' \ -H 'CONTENT-TYPE: application/json' \ -d '{ "model": "tts-2-flash", "input": "مرحبا، وشكرا على اتصالك. كيف يمكنني مساعدتك اليوم؟", "صوت": "آشلي", "اللغة": "en-US", "output_format": "MP3" }'

تحمل الاستجابة عنوان URL الموقع للصوت المولد بالإضافة إلى كتلة استخدام مع عدد الأحرف الذي تم تحصيله. الفوترة تتم لكل حرف من الإدخال، لذا التكلفة تتبع النص الذي ترسله بدلا من طول الصوت الذي يعود.

البث المباشر

بالنسبة لوكلاء الصوت وأي شيء يشغل الصوت أثناء إنتاجه، قم بالنشر في نسخة البث لنفس نقطة النهاية. يرجع الأحداث المرسلة من الخادم: audio.chunk الأحداث التي تحمل صوت base64 أثناء توليجه، اختيارية audio.timestamps الأحداث التي طلبت فيها توقيت الكلمة أو الشخصية، والنهاية audio.done حدث مع رابط إعادة التشغيل وكتلة الاستخدام. تعيين timestamp_type إلى كلمة أو الشخصية عندما تقود الترجمة أو واجهة الإضاءة (البرامج).

الاختيار بين TTS 2 و TTS 2 Flash

كلا الطرازين يشتركان في نفس شكل الطلب، ونفس الأصوات، ونفس تغطية اللغة، لذا فإن التبديل هو تغيير كلمة واحدة إلى النموذج. الفرق المهم عند الاختيار هو التحكم في الإلقاء (التوصيل).

يقبل TTS-2 في الوقت الحقيقي توجيه الصوت باللغة الإنجليزية البسيطة: افتح النص بتعليمات بين قوسين ويقوم النموذج بأداء السطر بهذه الطريقة بدلا من قراءة التعليمات بصوت عال. يفهم كل من التوجيهات القصيرة والتعليمات الحرة.

{ "model": "tts-2", "input": "[تحدث بحرارة، كأنك تحية صديقا قديما] صباح الخير، سعيد برؤيتك مجددا.", "صوت": "آشلي" }

فلاش TTS 2 لا يطبق هذا الاتجاه. أرسل نفس النص المكتوب بين قواس إلى فلاش ويتم تجاهله، لذا ابحث عن TTS 2 عندما يكون الأداء مهما وإلى فلاش عندما يكون التأخير ومستوى الصوت مهمين. على الفلاش، توصيل الشكل مع السرعة و درجة الحرارة بدلا من ذلك.

ملاحظات تستحق الاطلاع قبل مكالمتك الأولى

  • توجيه الصوت مخصص فقط للعبة TTS 2. فلاش يتجاهل بصمت توجيها محددا بدلا من رفضه، لذا فإن التوجيه المكتوب ل TTS 2 سيعمل على فلاش ويعود ببساطة بدون توجيه.
  • يتم احتساب رسالة التوجيه. التعليمات المرتبة بين قوسين تحتسب ضمن مجموع الحروف للطلب حتى وإن لم تنطق أبدا، لذا اجعل الملخصات قصيرة.
  • الحد الأقصى لكل طلب هو 2000 حرف. قم بتقسيم نص أطول عند حدود الجمل على العميل وربط الصوت، بدلا من إرسال كتلة طويلة واحدة.
  • تطبيع النص مفعل بشكل افتراضي. يتم توسيع الأرقام والتواريخ والاختصارات إلى شكل منطوق، مما يعني أيضا أن عدد الأحرف المدعومة يمكن أن يتجاوز طول السلسلة التي أرسلتها. قم بإيقافه إذا كنت قد قمت بالفعل بتطبيع النص بنفسك.

ابدأ

جرب TTS 2 Flash في الملعب، اقرأ مرجع API، أو انظر إلى الأسعار الحالية على صفحة النماذج.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.