
Sprache rein, gesprochen raus, über eine Fassung, mit paralinguistischem Verständnis von Ton und Tempo.
Sprache rein, gesprochen raus, über eine Fassung, mit paralinguistischem Verständnis von Ton und Tempo.
Die Sitzung wird mit session.update-Ereignissen über den Socket konfiguriert, anstatt mit Anfrageparametern.
Auch bekannt als StepAudio Realtime, StepFun StepAudio 2.5 Realtime
stepaudio-2-5-realtime/v1/realtimestepaudio-2.5-realtimestepfun/stepaudio-2-5-realtimeLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
StepAudio 2.5 Realtime führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID stepaudio-2-5-realtime und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())Request-Parameter, die die StepAudio 2.5 Realtime API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| voice | enum | soft-spoken-gentleman | soft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l... | Session Voice, mit session.update eingestellt, bevor das Modell Audio erzeugt. Sie kann nicht geändert werden, sobald das Modell gesprochen hat, und alle anderen... |
| instructions | string | - | - | Systemanweisungen für die Sitzung: Persona, Sprechstil und Grenzen. |
| modalities | string | ["text","audio"] | - | Reaktionsmodalitäten für die Sitzung. |
| volume_ratio | number | 1 | 0.1 bis 2 | Lautstärke der gesprochenen Antwort im Vergleich zum Standard. Akzeptierter Bereich liegt bei 0,1 bis 2,0. |
| input_audio_format | enum | pcm16 | pcm16 | Codierung des gesendeten Audios. 16-Bit-PCM. |
| output_audio_format | enum | pcm16 | pcm16 | Codierung des Audios, das das Modell zurückgibt. 16-Bit-PCM. |
| turn_detection | string | {"type":"server_vad"} | - | Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell soll antworten. Ohne sie hört das Modell zu, antwortet aber... |
Vollduplex-Stimme über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime, authentifiziert mit dem normalen Authorization Bearer-Header. Audio ist pcm16 in und out. Das Modell hört zu, während es spricht, sodass es mitten in der Antwort unterbrochen werden kann, und die serverseitige Sprachaktivitätserkennung entscheidet, wann es antwortet. Setze die Stimme mit session.update vor dem ersten Audio; sie kann nicht geändert werden, sobald das Modell gesprochen hat, und nur die sieben aufgeführten Stimmen werden akzeptiert. Die Konversation ist nur auf Chinesisch und Englisch. Jede abgeschlossene Runde wird eigenständig anhand der vom Modell gemeldeten Nutzung abgerechnet.
Auf EmpirioLabs wird StepAudio 2.5 Realtime nach Verbrauch abgerechnet: Eingabe $1.50 pro 1M Prompt-Token; Output $10.00 pro 1 Million generierter Token; Implizite Cache-Leseart $0.30 pro 1M zwischengespeicherten Eingabetoken. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
StepAudio 2.5 Realtime unterstützt ein Kontextfenster von 256K Token mit bis zu 131.072 Ausgabe-Token pro Antwort.
StepAudio 2.5 Realtime wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. StepAudio 2.5 Realtime läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID stepaudio-2-5-realtime und streamen Sie dann Audio in beide Richtungen.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.