StepAudio 2.5 Realtime API

Sprache rein, gesprochen raus, über eine Fassung, mit paralinguistischem Verständnis von Ton und Tempo.

StepFunAudiogeneration256K KontextVeröffentlicht 16. Juli 2026InternationalProprietärer EndpointNeu

Über StepAudio 2.5 Realtime

Sprache rein, gesprochen raus, über eine Fassung, mit paralinguistischem Verständnis von Ton und Tempo.

Die Sitzung wird mit session.update-Ereignissen über den Socket konfiguriert, anstatt mit Anfrageparametern.

Auch bekannt als StepAudio Realtime, StepFun StepAudio 2.5 Realtime

realtimespeech to speechaudio inaudio outvoice control

StepAudio 2.5 Realtime Spezifikationen

Modell-ID
stepaudio-2-5-realtime
Autor
StepFun
Kategorie
Audiogeneration
Veröffentlicht
16. Juli 2026
Kontextfenster
256K Token
Max. Ausgabe
131.072 Token
Eingabe
AudioText
Ausgabe
AudioText
Region
International
Endpoints
WEBSOCKET/v1/realtime
Alternative Modell-IDs
stepaudio-2.5-realtimestepfun/stepaudio-2-5-realtime

StepAudio 2.5 Realtime API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M Prompt-Token
$1.50
Ausgabe
pro 1 Million generierter Token
$10.00
Implizite Cache-Leseart
pro 1M zwischengespeicherten Eingabetoken
$0.30
Auf der vollständigen Preisseite vergleichen

So rufst du die StepAudio 2.5 Realtime API auf

StepAudio 2.5 Realtime führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID stepaudio-2-5-realtime und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Vollständige StepAudio 2.5 Realtime API-Referenz

StepAudio 2.5 Realtime API-Parameter

Request-Parameter, die die StepAudio 2.5 Realtime API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
voiceenumsoft-spoken-gentlemansoft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l...Session Voice, mit session.update eingestellt, bevor das Modell Audio erzeugt. Sie kann nicht geändert werden, sobald das Modell gesprochen hat, und alle anderen...
instructionsstring--Systemanweisungen für die Sitzung: Persona, Sprechstil und Grenzen.
modalitiesstring["text","audio"]-Reaktionsmodalitäten für die Sitzung.
volume_rationumber10.1 bis 2Lautstärke der gesprochenen Antwort im Vergleich zum Standard. Akzeptierter Bereich liegt bei 0,1 bis 2,0.
input_audio_formatenumpcm16pcm16Codierung des gesendeten Audios. 16-Bit-PCM.
output_audio_formatenumpcm16pcm16Codierung des Audios, das das Modell zurückgibt. 16-Bit-PCM.
turn_detectionstring{"type":"server_vad"}-Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell soll antworten. Ohne sie hört das Modell zu, antwortet aber...

Gut zu wissen

Vollduplex-Stimme über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime, authentifiziert mit dem normalen Authorization Bearer-Header. Audio ist pcm16 in und out. Das Modell hört zu, während es spricht, sodass es mitten in der Antwort unterbrochen werden kann, und die serverseitige Sprachaktivitätserkennung entscheidet, wann es antwortet. Setze die Stimme mit session.update vor dem ersten Audio; sie kann nicht geändert werden, sobald das Modell gesprochen hat, und nur die sieben aufgeführten Stimmen werden akzeptiert. Die Konversation ist nur auf Chinesisch und Englisch. Jede abgeschlossene Runde wird eigenständig anhand der vom Modell gemeldeten Nutzung abgerechnet.

StepAudio 2.5 Realtime API: häufige Fragen

Wie viel kostet die StepAudio 2.5 Realtime API?

Auf EmpirioLabs wird StepAudio 2.5 Realtime nach Verbrauch abgerechnet: Eingabe $1.50 pro 1M Prompt-Token; Output $10.00 pro 1 Million generierter Token; Implizite Cache-Leseart $0.30 pro 1M zwischengespeicherten Eingabetoken. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von StepAudio 2.5 Realtime?

StepAudio 2.5 Realtime unterstützt ein Kontextfenster von 256K Token mit bis zu 131.072 Ausgabe-Token pro Antwort.

Welchen Endpoint verwendet StepAudio 2.5 Realtime?

StepAudio 2.5 Realtime wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich StepAudio 2.5 Realtime im Browser testen, bevor ich integriere?

Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. StepAudio 2.5 Realtime läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID stepaudio-2-5-realtime und streamen Sie dann Audio in beide Richtungen.

Wie bekomme ich einen StepAudio 2.5 Realtime API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.