
Transcription en direct sur un socket, flux de mots partiels pendant que le locuteur parle et une phrase fixe à chaque pause, tarifée par jeton.
Transcription en direct sur un socket, flux de mots partiels pendant que le locuteur parle et une phrase fixe à chaque pause, tarifée par jeton.
Flux audio pcm16 16 kHz sur la prise de file. Des résultats partiels arrivent pendant que le haut-parleur parle.
Aussi connu sous le nom Qwen Audio ASR Stream, Alibaba Cloud Qwen Audio 3.1 ASR Stream
qwen-audio-3-1-asr-stream/v1/realtimeqwen-audio-3.1-asr-streamalibaba/qwen-audio-3-1-asr-streamTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
Qwen Audio 3.1 ASR Stream transcrit un flux audio en direct via un WebSocket sur wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, et non via les endpoints HTTP. Connectez-vous avec l'id de modèle qwen-audio-3-1-asr-stream et envoyez votre clé API EmpirioLabs dans un en-tête Authorization: Bearer lors du handshake. Ajoutez de l'audio PCM 16 bits encodé en base64 et lisez les événements de transcription pendant que la personne parle encore. Un navigateur ne peut pas définir d'en-têtes sur un WebSocket : ouvrez donc cette connexion depuis votre serveur et relayez l'audio vers le navigateur via votre propre socket. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())Paramètres de requête pris en charge par l'API Qwen Audio 3.1 ASR Stream sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Encodage de l’audio que vous ajoutez au tampon d’entrée: PCM 16 bits base64, mono, à 16 kHz. |
Connexion Transcription en direct via un WebSocket à wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, authentifiée avec l’en-tête Authorization Bearer ordinaire. Envoi d’audio Flux audio mono pcm16 16 kHz avec input_audio_buffer.append. La détection d’activité vocale décide où chaque phrase se termine, il n’y a donc pas de commit à envoyer. Ce qui revient conversation.item.input_audio_transcription.delta événements transportent la phrase jusqu’à ce moment pendant que le locuteur est encore en train de parler, et conversation.item.input_audio_transcription.completed porte la phrase établie à chaque pause. Facturation Les jetons d’entrée et de sortie sont tarifés par 1M, et chaque phrase complète est facturée elle-même à partir de l’utilisation rapportée par le modèle.
Sur EmpirioLabs, Qwen Audio 3.1 ASR Stream est facturé à l'usage : Entrée $1.86 par 1M de jetons d’entrée audio; Produit $1.40 par 1M de jetons générés. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
Qwen Audio 3.1 ASR Stream est servi via WEBSOCKET /v1/realtime sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Ouvrez le playground EmpirioLabs et appuyez sur Start session pour l'essayer dans votre navigateur. Qwen Audio 3.1 ASR Stream fonctionne sur un WebSocket plutôt qu'en requête et réponse, donc pour l'intégrer commencez par le guide de démarrage voix en temps réel. Connectez-vous depuis votre serveur avec votre clé API EmpirioLabs et l'id de modèle qwen-audio-3-1-asr-stream, puis diffusez l'audio dans les deux sens.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.