
Transcripción en directo por un socket, devolviendo resultados parciales mientras el hablante habla, con la detección de actividad vocal marcando cada frase.
Transcripción en directo por un socket, devolviendo resultados parciales mientras el hablante habla, con la detección de actividad vocal marcando cada frase.
EmpirioLabs expone el punto final estándar de /v1/audio/transcriptions y devuelve la transcripción final en el formato normal de respuesta de transcripción.
También conocido como StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream
stepaudio-2-5-asr-stream/v1/realtimestepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-streamTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
StepAudio 2.5 ASR Stream transcribe un flujo de audio en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, no a través de los endpoints HTTP. Conéctate con el id de modelo stepaudio-2-5-asr-stream y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. Añade audio PCM de 16 bits en base64 y lee los eventos de transcripción mientras la persona sigue hablando. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())Parámetros de solicitud compatibles con la API de StepAudio 2.5 ASR Stream en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Encoding of the audio you append to the input buffer: base64 16-bit PCM. |
| language | string | - | - | Optional language hint. Omit to let the model detect it. |
Transcripción en directo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, autenticada con el encabezado ordinario de Portador de Autorización. Transmite audio pcm16 a 16 kHz con input_audio_buffer.append y lee resultados parciales mientras el altavoz sigue hablando, marcando la detección de actividad de voz en el lado del servidor donde termina cada frase. Úsalo para subtítulos en directo y entrada de voz; para una grabación terminada, POST /v1/audio/transcriptions devuelve la transcripción completa en una sola llamada. La facturación sigue la duración del audio que transmites, establecida cuando termina la sesión.
En EmpirioLabs, StepAudio 2.5 ASR Stream se factura por uso: Transcripción $0.18 por hora de audio. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
StepAudio 2.5 ASR Stream se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.
StepAudio 2.5 ASR Stream funciona sobre un WebSocket en lugar de una petición y una respuesta, así que empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo stepaudio-2-5-asr-stream, y luego transmite audio en ambos sentidos.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.