StepAudio 2.5 ASR Stream API

Transcription en direct sur un socket, qui restitue des résultats partiels au fur et à mesure que le locuteur parle, la détection d’activité vocale marquant chaque phrase.

StepFunTranscriptionPublié 16 juil. 2026InternationalEndpoint propriétaireNouveau

À propos de StepAudio 2.5 ASR Stream

Transcription en direct sur un socket, qui restitue des résultats partiels au fur et à mesure que le locuteur parle, la détection d’activité vocale marquant chaque phrase.

EmpirioLabs expose le point de /v1/audio/transcriptions standard et retourne la transcription finale dans le format de réponse de transcription normal.

Aussi connu sous le nom StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream

transcriptionspeech to textrealtimestreaming asr

Caractéristiques de StepAudio 2.5 ASR Stream

ID du modèle
stepaudio-2-5-asr-stream
Auteur
StepFun
Catégorie
Transcription
Publié
16 juil. 2026
Entrée
Audio
Sortie
Texte
Région
International
Endpoints
WEBSOCKET/v1/realtime
Identifiants de modèle alternatifs
stepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-stream

Tarifs de l'API StepAudio 2.5 ASR Stream

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Transcription
par heure d’audio
$0.18
Comparer sur la page complète des tarifs

Comment appeler l'API StepAudio 2.5 ASR Stream

StepAudio 2.5 ASR Stream transcrit un flux audio en direct via un WebSocket sur wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, et non via les endpoints HTTP. Connectez-vous avec l'id de modèle stepaudio-2-5-asr-stream et envoyez votre clé API EmpirioLabs dans un en-tête Authorization: Bearer lors du handshake. Ajoutez de l'audio PCM 16 bits encodé en base64 et lisez les événements de transcription pendant que la personne parle encore. Un navigateur ne peut pas définir d'en-têtes sur un WebSocket : ouvrez donc cette connexion depuis votre serveur et relayez l'audio vers le navigateur via votre propre socket. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Référence complète de l'API StepAudio 2.5 ASR Stream

Paramètres de l'API StepAudio 2.5 ASR Stream

Paramètres de requête pris en charge par l'API StepAudio 2.5 ASR Stream sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
input_audio_formatenumpcm16pcm16Encoding of the audio you append to the input buffer: base64 16-bit PCM.
languagestring--Optional language hint. Omit to let the model detect it.

Bon à savoir

Transcription en direct via un WebSocket à wss://api.empiriolabs.ai/v1/realtime ?model=stepaudio-2-5-asr-stream, authentifiée avec l’en-tête Authorization Bearer ordinaire. Diffusez en upload audio pcm16 à 16 kHz avec input_audio_buffer.append et lisez les résultats partiels pendant que le locuteur parle encore, avec la détection d’activité vocale côté serveur marquant la fin de chaque phrase. Utilisez cela pour les sous-titres en direct et l’entrée vocale; pour un enregistrement terminé, le /v1/audio/transcriptions POST retourne la transcription complète en un seul appel. La facturation suit la durée de l’audio que vous diffusez, fixée à la fin de la session.

API StepAudio 2.5 ASR Stream : questions fréquentes

Combien coûte l'API StepAudio 2.5 ASR Stream ?

Sur EmpirioLabs, StepAudio 2.5 ASR Stream est facturé à l'usage : Transcription $0.18 par heure d’audio. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint StepAudio 2.5 ASR Stream utilise-t-il ?

StepAudio 2.5 ASR Stream est servi via WEBSOCKET /v1/realtime sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer StepAudio 2.5 ASR Stream dans le navigateur avant d'intégrer ?

StepAudio 2.5 ASR Stream fonctionne sur un WebSocket plutôt qu'en requête et réponse, commencez donc par le guide de démarrage voix en temps réel. Connectez-vous depuis votre serveur avec votre clé API EmpirioLabs et l'id de modèle stepaudio-2-5-asr-stream, puis diffusez l'audio dans les deux sens.

Comment obtenir une clé API StepAudio 2.5 ASR Stream ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.