StepAudio 2.5 ASR Stream API

Transcripción en directo por un socket, devolviendo resultados parciales mientras el hablante habla, con la detección de actividad vocal marcando cada frase.

StepFunTranscripciónLanzado 16 jul 2026InternationalEndpoint propietarioNuevo

Acerca de StepAudio 2.5 ASR Stream

Transcripción en directo por un socket, devolviendo resultados parciales mientras el hablante habla, con la detección de actividad vocal marcando cada frase.

EmpirioLabs expone el punto final estándar de /v1/audio/transcriptions y devuelve la transcripción final en el formato normal de respuesta de transcripción.

También conocido como StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream

transcriptionspeech to textrealtimestreaming asr

Especificaciones de StepAudio 2.5 ASR Stream

ID del modelo
stepaudio-2-5-asr-stream
Autor
StepFun
Categoría
Transcripción
Lanzado
16 jul 2026
Entrada
Audio
Salida
Texto
Región
International
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
stepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-stream

Precios de la API de StepAudio 2.5 ASR Stream

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Transcripción
por hora de audio
$0.18
Comparar en la página completa de precios

Cómo llamar a la API de StepAudio 2.5 ASR Stream

StepAudio 2.5 ASR Stream transcribe un flujo de audio en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, no a través de los endpoints HTTP. Conéctate con el id de modelo stepaudio-2-5-asr-stream y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. Añade audio PCM de 16 bits en base64 y lee los eventos de transcripción mientras la persona sigue hablando. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Referencia completa de la API de StepAudio 2.5 ASR Stream

Parámetros de la API de StepAudio 2.5 ASR Stream

Parámetros de solicitud compatibles con la API de StepAudio 2.5 ASR Stream en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
input_audio_formatenumpcm16pcm16Encoding of the audio you append to the input buffer: base64 16-bit PCM.
languagestring--Optional language hint. Omit to let the model detect it.

Información útil

Transcripción en directo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream, autenticada con el encabezado ordinario de Portador de Autorización. Transmite audio pcm16 a 16 kHz con input_audio_buffer.append y lee resultados parciales mientras el altavoz sigue hablando, marcando la detección de actividad de voz en el lado del servidor donde termina cada frase. Úsalo para subtítulos en directo y entrada de voz; para una grabación terminada, POST /v1/audio/transcriptions devuelve la transcripción completa en una sola llamada. La facturación sigue la duración del audio que transmites, establecida cuando termina la sesión.

API de StepAudio 2.5 ASR Stream: preguntas frecuentes

¿Cuánto cuesta la API de StepAudio 2.5 ASR Stream?

En EmpirioLabs, StepAudio 2.5 ASR Stream se factura por uso: Transcripción $0.18 por hora de audio. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa StepAudio 2.5 ASR Stream?

StepAudio 2.5 ASR Stream se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar StepAudio 2.5 ASR Stream en el navegador antes de integrar?

StepAudio 2.5 ASR Stream funciona sobre un WebSocket en lugar de una petición y una respuesta, así que empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo stepaudio-2-5-asr-stream, y luego transmite audio en ambos sentidos.

¿Cómo consigo una clave de API de StepAudio 2.5 ASR Stream?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.