Accueil Blog

Comment utiliser Qwen Audio 3.1 ASR, flux ASR et message ASR

Qwen Audio 3.1 ASR, flux ASR et message ASR via API

Sep 24, 2026

EmpirioLabs AI

Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream et Qwen Audio 3.1 ASR Message sont disponibles sur EmpirioLabs. ASR transcrit l’audio enregistré via APRÈS /v1/audio/transcriptions. Flux ASR et message ASR Transcrivez l’audio en direct via WSS://api.empiriolabs.ai/v1/Realtime. Les trois fonctionnent dans l’API et dans le Playground.

Les trois modèles

  • qwen-audio-3-1-asr transcrit de courts extraits et de longs enregistrements, et renvoie la transcription avec des segments de phrases et des horodatages de mots. La langue est détectée automatiquement, y compris les dialectes chinois.
  • qwen-audio-3-1-asr-stream est conçu pour des légendes en direct. Il envoie la phrase jusqu’à une certaine distance pendant que le locuteur parle, puis la phrase fixe à chaque pause.
  • qwen-audio-3-1-asr-message est conçu pour les messages vocaux et l’entrée vocale. Il retourne chaque énoncé comme une transcription complète une fois que le locuteur fait une pause, sans résultats partiels.

Transcription d’un enregistrement

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -F modèl=qwen-audio-3-1-asr \ -F file=@meeting.mp3

Un corps JSON avec audio_url ou audio_base64 fonctionne à la place du téléchargement du fichier. La réponse est un travail:

{ « job_id »: « 3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 », « status »: « processing », « poll_url »: « /v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 » }

Faites un sondage pour le poste jusqu’à ce que Statut est achevé:

curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H « Autorisation: porteur $EMPIRIOLABS_API_KEY »

La transcription est dans résult.text, avec des segments de phrase dans result.segments et les horodatages des mots dans résultats.mots. Les courts extraits se terminent en quelques secondes; les enregistrements longs prennent plus de temps.

Transcription en direct via un WebSocket

Ouvrez le point de terminaison temps réel avec le modèle dans la chaîne de requête et votre clé API sur la poignée de main:

wss://api.empiriolabs.ai/v1/realtime ?model=qwen-audio-3-1-asr-stream Autorisation: Porteur YOUR_EMPIRIOLABS_API_KEY

Flux audio PCM mono 16 bits 16 bits en base64 in input_audio_buffer.append événements. Il n’y a pas de commit à envoyer: le modèle détecte la fin de chaque phrase à partir de la pause qui la suit.

{"type »: « input_audio_buffer.append », « audio »: « <base64 PCM>"}

Les transcriptions arrivent sous forme d’événements:

  • Résultats partiels. conversation.item.input_audio_transcription.delta porte la phrase jusqu’ici dans Texte pendant que le locuteur parle encore. Flux ASR uniquement.
  • Résultats réglés. conversation.item.input_audio_transcription.completed porte la phrase ou l’énoncé fini dans Transcription. Les deux modèles.

Notes opérationnelles

  1. Chaque demande de transcription renvoie un travail, même un court extrait. La première réponse porte un aide-emploi, pas la transcription. Lisez résult.text de ALLEZ-/v1/jobs/<job_id> Une fois Statut est achevé.
  2. Affichage Texte à partir de chaque événement partiel au lieu de rejoindre Delta valeurs. Sur ASR Stream, Texte c’est toujours la phrase complète jusqu’à présent, donc remplacer la ligne affichée par elle à chaque événement permet de garder les légendes en direct correctes.
  3. Le message ASR est silencieux jusqu’à ce que le haut-parleur fasse une pause. Il n’envoie aucun résultat partiel, donc aucun événement n’arrive pendant que quelqu’un parle. Utilisez ASR Stream pour les sous-titres en direct.
  4. Diffusez un moment de silence après les derniers mots. Une phrase s’installe lorsque le modèle entend le haut-parleur s’arrêter. Continuez à envoyer de l’audio brièvement après les derniers mots et attendez le achevé avant la fermeture de la cavité, ou la dernière phrase est perdue.

Prix

Les trois modèles sont payants au fur et à mesure, sans abonnement requis. Chacun est tarifé par jeton, avec un tarif pour l’entrée audio et un pour la sortie transcription, et il n’y a pas de niveau d’entrée en cache. ASR facture chaque requête; ASR Stream et ASR Message facturent chaque phrase ou énoncé complété. Les modèles live ont des débits plus élevés que ASR, donc utilisez ASR pour les enregistrements qui n’ont pas besoin de résultats pendant que le locuteur parle. Les tarifs actuels sont sur les pages des modèles pour Qwen Audio 3.1 ASR, Flux ASR et ASR Message, et sur le page de prix.

Commencez à construire

Essaie Qwen Audio 3.1 ASR dans le Playground en téléversant un enregistrement, ou Flux ASR et ASR Message en cliquant sur Démarrer la session et en parlant. La référence API pour chaque modèle est à ASR, Flux ASR et ASR Message, et les tableaux complets des événements se trouvent dans le API vocale en temps réel guide.

Pour les conversations vocales de la même famille, voir Comment utiliser Qwen3.8 Omni Flash Realtime et Qwen Audio 3.1.

Divulgation: Cet article a été rédigé avec l'aide d'AI et examiné par EmpirioLabs AI.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.