StepAudio 2.5 Realtime واجهة برمجة التطبيقات

الكلام يدخل، الكلام خارج، على محجر واحد، مع فهم ما بعد اللغة للنغمة والإيقاع.

StepFunتوليد الصوت256K السياقتاريخ الإصدار 16 يوليو 2026Internationalنقطة نهاية مملوكةجديد

حول StepAudio 2.5 Realtime

الكلام يدخل، الكلام خارج، على محجر واحد، مع فهم ما بعد اللغة للنغمة والإيقاع.

يتم تكوين الجلسة باستخدام أحداث session.update عبر المنفذ بدلا من معلمات الطلب.

يعرف أيضا باسم StepAudio Realtime, StepFun StepAudio 2.5 Realtime

realtimespeech to speechaudio inaudio outvoice control

مواصفات StepAudio 2.5 Realtime

معرّف النموذج
stepaudio-2-5-realtime
المطور
StepFun
الفئة
توليد الصوت
تاريخ الإصدار
16 يوليو 2026
نافذة السياق
256K رمز
أقصى إخراج
131,072 رمز
الإدخال
صوتنص
الإخراج
صوتنص
المنطقة
International
نقاط النهاية
WEBSOCKET/v1/realtime
معرّفات نموذج بديلة
stepaudio-2.5-realtimestepfun/stepaudio-2-5-realtime

أسعار واجهة StepAudio 2.5 Realtime API

أسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.

النوع
المواصفة
السعر
المدخلات
لكل 1M رموز مطالبة
$1.50
الإنتاج
لكل مليون رمز مولد
$10.00
قراءة الذاكرة المؤقتة الضمنية
لكل مليون رمز إدخال مخبأ
$0.30
قارن في صفحة الأسعار الكاملة

كيفية استدعاء واجهة StepAudio 2.5 Realtime API

يجري StepAudio 2.5 Realtime محادثة مباشرة عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime، وليس عبر نقاط نهاية HTTP. اتصل باستخدام معرف النموذج stepaudio-2-5-realtime وأرسل مفتاح EmpirioLabs API في ترويسة Authorization: Bearer أثناء المصافحة. ينتقل الصوت في الاتجاهين بصيغة PCM 16-بت مرمّزة بـ base64. لا يستطيع المتصفح ضبط الترويسات على WebSocket، لذا افتح هذا الاتصال من خادمك ومرّر الصوت إلى المتصفح عبر مقبسك الخاص. احصل على مفتاح API من لوحة تحكم EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
المرجع الكامل لواجهة StepAudio 2.5 Realtime API

معلمات واجهة StepAudio 2.5 Realtime API

معلمات الطلب التي تدعمها واجهة StepAudio 2.5 Realtime API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.

المعاملالنوعالافتراضيالنطاق / القيمالوصف
voiceenumsoft-spoken-gentlemansoft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l...صوت الجلسة، يتم ضبطه مع session.update قبل أن ينتج النموذج الصوت. لا يمكن تغييره بمجرد أن ينطق النموذج، ويتم رفض أي قيمة أخرى.
instructionsstring--تعليمات النظام للجلسة: الشخصية، أسلوب الكلام، والحدود.
modalitiesstring["text","audio"]-طرق الاستجابة للجلسة.
volume_rationumber10.1 إلى 2شدة الصوت في الرد المنطوق مقارنة بالافتراضي. النطاق المقبول هو من 0.1 إلى 2.0.
input_audio_formatenumpcm16pcm16ترميز الصوت الذي ترسله. PCM 16-بت.
output_audio_formatenumpcm16pcm16ترميز الصوت الذي يعيده النموذج. PCM 16-بت.
turn_detectionstring{"type":"server_vad"}-اكتشاف نشاط الصوت على جانب الخادم. يقرر متى توقفت عن الكلام ويجب على النموذج الرد. بدونه يستمع النموذج لكنه لا يجيب أبدا، لذا اتركه مفعلا إلا إذا كنت تقود السيارة...

معلومات مفيدة

الصوت المزدوج الكامل عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime، ويتم التحقق منه باستخدام رأس حامل التفويض العادي. الصوت هو pcm16 داخل وخارج. يستمع النموذج أثناء الكلام، لذا يمكن مقاطعته أثناء الرد، ويحدد اكتشاف نشاط الصوت على جانب الخادم متى يجب الرد. ضبط الصوت مع session.update قبل الصوت الأول؛ لا يمكن تغييره بمجرد نطق النموذج، ويتم قبول الأصوات السبعة المدرجة فقط. المحادثة صينية وإنجليزية فقط. يتم احتساب كل دور مكتمل بمفرده بناء على الاستخدام الذي يبلغ عنه النموذج.

واجهة StepAudio 2.5 Realtime API: أسئلة شائعة

كم تكلف واجهة StepAudio 2.5 Realtime API؟

على EmpirioLabs، تتم فوترة StepAudio 2.5 Realtime حسب الاستخدام: المدخلات $1.50 لكل 1M رموز مطالبة; الإنتاج $10.00 لكل مليون رمز مولد; قراءة الذاكرة المؤقتة الضمنية $0.30 لكل مليون رمز إدخال مخبأ. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.

ما حجم نافذة السياق في StepAudio 2.5 Realtime؟

يدعم StepAudio 2.5 Realtime نافذة سياق من 256K رمز، مع ما يصل إلى 131,072 رمز إخراج لكل استجابة.

أي نقطة نهاية يستخدم StepAudio 2.5 Realtime؟

يُقدَّم StepAudio 2.5 Realtime عبر WEBSOCKET /v1/realtime على api.empiriolabs.ai مع مصادقة Bearer القياسية.

هل يمكنني تجربة StepAudio 2.5 Realtime في المتصفح قبل الدمج؟

افتح ملعب EmpirioLabs واضغط Start session لتجربته في المتصفح. يعمل StepAudio 2.5 Realtime عبر WebSocket بدلاً من طلب واستجابة، لذا ابدأ من دليل البدء السريع للصوت الفوري عند الدمج. اتصل من خادمك باستخدام مفتاح EmpirioLabs API ومعرف النموذج stepaudio-2-5-realtime، ثم مرّر الصوت في الاتجاهين.

كيف أحصل على مفتاح API لنموذج StepAudio 2.5 Realtime؟

أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.