
Transcription en direct sur un socket, qui restitue des résultats partiels au fur et à mesure que le locuteur parle, la détection d’activité vocale marquant chaque phrase.
Transcription en direct sur un socket, qui restitue des résultats partiels au fur et à mesure que le locuteur parle, la détection d’activité vocale marquant chaque phrase.
EmpirioLabs expose le point de /v1/audio/transcriptions standard et retourne la transcription finale dans le format de réponse de transcription normal.
Aussi connu sous le nom StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream
stepaudio-2-5-asr-stream/v1/realtimestepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-streamTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
StepAudio 2.5 ASR Stream transcrit un flux audio en direct via un WebSocket sur wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, et non via les endpoints HTTP. Connectez-vous avec l'id de modèle stepaudio-2-5-asr-stream et envoyez votre clé API EmpirioLabs dans un en-tête Authorization: Bearer lors du handshake. Ajoutez de l'audio PCM 16 bits encodé en base64 et lisez les événements de transcription pendant que la personne parle encore. Un navigateur ne peut pas définir d'en-têtes sur un WebSocket : ouvrez donc cette connexion depuis votre serveur et relayez l'audio vers le navigateur via votre propre socket. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())Paramètres de requête pris en charge par l'API StepAudio 2.5 ASR Stream sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Encoding of the audio you append to the input buffer: base64 16-bit PCM. |
| language | string | - | - | Optional language hint. Omit to let the model detect it. |
Transcription en direct via un WebSocket à wss://api.empiriolabs.ai/v1/realtime ?model=stepaudio-2-5-asr-stream, authentifiée avec l’en-tête Authorization Bearer ordinaire. Diffusez en upload audio pcm16 à 16 kHz avec input_audio_buffer.append et lisez les résultats partiels pendant que le locuteur parle encore, avec la détection d’activité vocale côté serveur marquant la fin de chaque phrase. Utilisez cela pour les sous-titres en direct et l’entrée vocale; pour un enregistrement terminé, le /v1/audio/transcriptions POST retourne la transcription complète en un seul appel. La facturation suit la durée de l’audio que vous diffusez, fixée à la fin de la session.
Sur EmpirioLabs, StepAudio 2.5 ASR Stream est facturé à l'usage : Transcription $0.18 par heure d’audio. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
StepAudio 2.5 ASR Stream est servi via WEBSOCKET /v1/realtime sur api.empiriolabs.ai avec une authentification standard par token Bearer.
StepAudio 2.5 ASR Stream fonctionne sur un WebSocket plutôt qu'en requête et réponse, commencez donc par le guide de démarrage voix en temps réel. Connectez-vous depuis votre serveur avec votre clé API EmpirioLabs et l'id de modèle stepaudio-2-5-asr-stream, puis diffusez l'audio dans les deux sens.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.