Deepgram Nova-3 Stream API

Transcripción en directo a través de un socket, devolviendo resultados intermedios mientras el hablante sigue hablando y una transcripción establecida una vez que termina cada frase.

DeepgramTranscripciónEndpoint propietarioNuevo

Acerca de Deepgram Nova-3 Stream

Transcripción en directo a través de un socket, devolviendo resultados intermedios mientras el hablante sigue hablando y una transcripción establecida una vez que termina cada frase.

El audio sube como tramas binarias en bruto de PCM mono de 16 bits a 16 kHz. Las transcripciones intermedias y asentadas vuelven como eventos de Resultados.

También conocido como Deepgram-Nova-3-Stream

transcriptionspeech to textrealtimestreaming asrmultilingual

Especificaciones de Deepgram Nova-3 Stream

ID del modelo
deepgram-nova-3-stream
Autor
Deepgram
Categoría
Transcripción
Lanzado
-
Entrada
Audio
Salida
Texto
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
nova-3-streamdeepgram/deepgram-nova-3-stream

Precios de la API de Deepgram Nova-3 Stream

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Transcripción
por minuto de audio
$0.025
Comparar en la página completa de precios

Cómo llamar a la API de Deepgram Nova-3 Stream

Deepgram Nova-3 Stream transcribe un flujo de audio en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream, no a través de los endpoints HTTP. Conéctate con el id de modelo deepgram-nova-3-stream y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. Añade audio PCM de 16 bits en base64 y lee los eventos de transcripción mientras la persona sigue hablando. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Referencia completa de la API de Deepgram Nova-3 Stream

Parámetros de la API de Deepgram Nova-3 Stream

Parámetros de solicitud compatibles con la API de Deepgram Nova-3 Stream en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
input_audio_formatenumlinear16linear16Encoding of the audio you send up: 16 kHz mono 16-bit PCM, as raw binary frames rather than base64.
languagestring--Optional language hint. Omit to let the model detect it.

Información útil

Transcripción en directo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream, autenticada con el encabezado ordinario de Portador de Autorización. Envía PCM mono de 16 bits de 16 kHz como tramas binarias y lee los eventos de transcripción de vuelta; los resultados intermedios llegan mientras el hablante sigue hablando, y cada frase se asienta con is_final. Añadir language= a la URL de conexión para transcribir un idioma específico. La facturación es por minuto del audio que envíes.

API de Deepgram Nova-3 Stream: preguntas frecuentes

¿Cuánto cuesta la API de Deepgram Nova-3 Stream?

En EmpirioLabs, Deepgram Nova-3 Stream se factura por uso: Transcripción $0.025 por minuto de audio. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa Deepgram Nova-3 Stream?

Deepgram Nova-3 Stream se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar Deepgram Nova-3 Stream en el navegador antes de integrar?

Deepgram Nova-3 Stream funciona sobre un WebSocket en lugar de una petición y una respuesta, así que empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo deepgram-nova-3-stream, y luego transmite audio en ambos sentidos.

¿Cómo consigo una clave de API de Deepgram Nova-3 Stream?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.