
Reconocimiento de voz para clips cortos y grabaciones largas, con segmentos de oraciones, marcas de tiempo de palabras y reconocimiento multilingüe y dialectal chino.
Reconocimiento de voz para clips cortos y grabaciones largas, con segmentos de oraciones, marcas de tiempo de palabras y reconocimiento multilingüe y dialectal chino.
Sube un archivo o pasa una URL de audio. El idioma se detecta automáticamente.
También conocido como Qwen Audio ASR, Alibaba Cloud Qwen Audio 3.1 ASR
qwen-audio-3-1-asr/v1/audio/transcriptionsqwen-audio-3.1-asralibaba/qwen-audio-3-1-asrTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Qwen Audio 3.1 ASR funciona a través de POST /v1/audio/transcriptions. La solicitud devuelve un job_id de inmediato; consulta GET /v1/jobs/{job_id} hasta que el trabajo termine y lee las URLs de salida del resultado. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-1-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "qwen-audio-3-1-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Envío de audio Envía un archivo como file multiparte, o JSON con audio_url o audio_base64, en formatos de audio comunes. Se aceptan tanto clips cortos como grabaciones largas. Obtención del resultado La solicitud devuelve un job_id y un poll_url de inmediato. Consulta GET /v1/jobs/<job-id> hasta que status esté completed. Los clips cortos terminan en segundos; las grabaciones largas tardan más. Lo que regresa El result del trabajo completado contiene la transcripción completa como text, segmentos de frases con horas de inicio y final, y marcas de tiempo de palabras. El idioma se detecta automáticamente, incluyendo los dialectos chinos. Facturación Los tokens de entrada y salida se valoran por 1M, y cada solicitud se factura según el uso que reporte el modelo.
En EmpirioLabs, Qwen Audio 3.1 ASR se factura por uso: Entrada $0.30 por 1M de tokens de entrada de audio; Producto $0.94 por 1M de tokens generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Qwen Audio 3.1 ASR se sirve a través de POST /v1/audio/transcriptions en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta Qwen Audio 3.1 ASR en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.