StepAudio 2.5 ASR Stream API

Live-Transkription über einen Socket, wobei teilweise Ergebnisse zurückgegeben werden, während der Sprecher spricht, wobei die Sprachaktivitätserkennung jeden Satz markiert.

StepFunTranskriptionVeröffentlicht 16. Juli 2026InternationalProprietärer EndpointNeu

Über StepAudio 2.5 ASR Stream

Live-Transkription über einen Socket, wobei teilweise Ergebnisse zurückgegeben werden, während der Sprecher spricht, wobei die Sprachaktivitätserkennung jeden Satz markiert.

EmpirioLabs gibt das Standard-/v1/audio/transcriptions-Endpunkt frei und liefert das endgültige Transkript im normalen Transkriptionsantwortformat.

Auch bekannt als StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream

transcriptionspeech to textrealtimestreaming asr

StepAudio 2.5 ASR Stream Spezifikationen

Modell-ID
stepaudio-2-5-asr-stream
Autor
StepFun
Kategorie
Transkription
Veröffentlicht
16. Juli 2026
Eingabe
Audio
Ausgabe
Text
Region
International
Endpoints
WEBSOCKET/v1/realtime
Alternative Modell-IDs
stepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-stream

StepAudio 2.5 ASR Stream API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Transkription
pro Stunde Audio
$0.18
Auf der vollständigen Preisseite vergleichen

So rufst du die StepAudio 2.5 ASR Stream API auf

StepAudio 2.5 ASR Stream transkribiert einen Live-Audiostream über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID stepaudio-2-5-asr-stream und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Hängen Sie base64-kodiertes 16-Bit-PCM-Audio an und lesen Sie die Transkript-Events, während noch gesprochen wird. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Vollständige StepAudio 2.5 ASR Stream API-Referenz

StepAudio 2.5 ASR Stream API-Parameter

Request-Parameter, die die StepAudio 2.5 ASR Stream API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
input_audio_formatenumpcm16pcm16Encoding of the audio you append to the input buffer: base64 16-bit PCM.
languagestring--Optional language hint. Omit to let the model detect it.

Gut zu wissen

Live-Transkription über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, authentifiziert mit dem normalen Authorization Bearer-Header. Streamen Sie 16 kHz pcm16-Audio mit input_audio_buffer.append und lesen Sie teilweise Ergebnisse zurück, während der Sprecher noch spricht, wobei serverseitige Sprachaktivitätserkennung markiert, wo jeder Satz endet. Verwenden Sie dies für Live-Untertitel und Spracheingaben; für eine fertige Aufnahme gibt POST /v1/audio/transcriptions das gesamte Transkript in einem Anruf zurück. Die Abrechnung folgt der Dauer des gestreamten Audios, die beim Ende der Sitzung festgelegt wird.

StepAudio 2.5 ASR Stream API: häufige Fragen

Wie viel kostet die StepAudio 2.5 ASR Stream API?

Auf EmpirioLabs wird StepAudio 2.5 ASR Stream nach Verbrauch abgerechnet: Transkription $0.18 pro Stunde Audio. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet StepAudio 2.5 ASR Stream?

StepAudio 2.5 ASR Stream wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich StepAudio 2.5 ASR Stream im Browser testen, bevor ich integriere?

StepAudio 2.5 ASR Stream läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID stepaudio-2-5-asr-stream und streamen Sie dann Audio in beide Richtungen.

Wie bekomme ich einen StepAudio 2.5 ASR Stream API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.