StepAudio 2.5 Realtime API

Parole entrée, parole sortie, sur une seule cavité, avec une compréhension paralinguistique du ton et du rythme.

StepFunProduction audio256K contextePublié 16 juil. 2026InternationalEndpoint propriétaireNouveau

À propos de StepAudio 2.5 Realtime

Parole entrée, parole sortie, sur une seule cavité, avec une compréhension paralinguistique du ton et du rythme.

La session est configurée avec des événements session.update sur le socket plutôt que des paramètres de requête.

Aussi connu sous le nom StepAudio Realtime, StepFun StepAudio 2.5 Realtime

realtimespeech to speechaudio inaudio outvoice control

Caractéristiques de StepAudio 2.5 Realtime

ID du modèle
stepaudio-2-5-realtime
Auteur
StepFun
Catégorie
Production audio
Publié
16 juil. 2026
Fenêtre de contexte
256K tokens
Sortie max
131 072 tokens
Entrée
AudioTexte
Sortie
AudioTexte
Région
International
Endpoints
WEBSOCKET/v1/realtime
Identifiants de modèle alternatifs
stepaudio-2.5-realtimestepfun/stepaudio-2-5-realtime

Tarifs de l'API StepAudio 2.5 Realtime

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Entrée
par 1M de jetons d’invite
$1.50
Produit
par 1M de jetons générés
$10.00
Lecture implicite du cache
par 1M de jetons d’entrée mis en cache
$0.30
Comparer sur la page complète des tarifs

Comment appeler l'API StepAudio 2.5 Realtime

StepAudio 2.5 Realtime tient une conversation en direct via un WebSocket sur wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime, et non via les endpoints HTTP. Connectez-vous avec l'id de modèle stepaudio-2-5-realtime et envoyez votre clé API EmpirioLabs dans un en-tête Authorization: Bearer lors du handshake. L'audio circule dans les deux sens en PCM 16 bits encodé en base64. Un navigateur ne peut pas définir d'en-têtes sur un WebSocket : ouvrez donc cette connexion depuis votre serveur et relayez l'audio vers le navigateur via votre propre socket. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Référence complète de l'API StepAudio 2.5 Realtime

Paramètres de l'API StepAudio 2.5 Realtime

Paramètres de requête pris en charge par l'API StepAudio 2.5 Realtime sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
voiceenumsoft-spoken-gentlemansoft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l...Session voice, configuré avec session.update avant que le modèle ne produise de l’audio. Elle ne peut pas être modifiée une fois que le modèle a parlé, et toute...
instructionsstring--Instructions système pour la session: persona, style de parole et limites.
modalitiesstring["text","audio"]-Modalités de réponse pour la session.
volume_rationumber10.1 à 2Le volume de la réponse prononcée, par rapport au niveau par défaut. La plage acceptée est de 0,1 à 2,0.
input_audio_formatenumpcm16pcm16Encodage de l’audio que vous envoyez. PCM 16 bits.
output_audio_formatenumpcm16pcm16Encodage de l’audio que le modèle retourne. PCM 16 bits.
turn_detectionstring{"type":"server_vad"}-Détection d’activité vocale côté serveur. Il décide quand vous avez arrêté de parler et le modèle doit répondre. Sans cela, le modèle écoute mais ne répond jamais,...

Bon à savoir

Voix full-duplex via WebSocket à wss://api.empiriolabs.ai/v1/realtime ?model=stepaudio-2-5-realtime, authentifiée avec l’en-tête Authorization Bearer ordinaire. L’audio est pcm16 en entrée et sortie. Le modèle écoute pendant qu’il parle, ce qui peut être interrompu en plein milieu de la réponse, et la détection d’activité vocale côté serveur décide quand répondre. Définir la voix avec session.update avant le premier audio; elle ne peut pas être modifiée une fois que le modèle a parlé, et seules les sept voix listées sont acceptées. La conversation est uniquement en chinois et en anglais. Chaque tour complet est facturé séparément selon l’utilisation rapportée par le modèle.

API StepAudio 2.5 Realtime : questions fréquentes

Combien coûte l'API StepAudio 2.5 Realtime ?

Sur EmpirioLabs, StepAudio 2.5 Realtime est facturé à l'usage : Entrée $1.50 par 1M de jetons d’invite; Produit $10.00 par 1M de jetons générés; Lecture implicite du cache $0.30 par 1M de jetons d’entrée mis en cache. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quelle est la fenêtre de contexte de StepAudio 2.5 Realtime ?

StepAudio 2.5 Realtime prend en charge une fenêtre de contexte de 256K tokens avec jusqu'à 131 072 tokens de sortie par réponse.

Quel endpoint StepAudio 2.5 Realtime utilise-t-il ?

StepAudio 2.5 Realtime est servi via WEBSOCKET /v1/realtime sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer StepAudio 2.5 Realtime dans le navigateur avant d'intégrer ?

Ouvrez le playground EmpirioLabs et appuyez sur Start session pour l'essayer dans votre navigateur. StepAudio 2.5 Realtime fonctionne sur un WebSocket plutôt qu'en requête et réponse, donc pour l'intégrer commencez par le guide de démarrage voix en temps réel. Connectez-vous depuis votre serveur avec votre clé API EmpirioLabs et l'id de modèle stepaudio-2-5-realtime, puis diffusez l'audio dans les deux sens.

Comment obtenir une clé API StepAudio 2.5 Realtime ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.