Qwen3.8 Omni Flash Realtime API

La voix et la vidéo en direct s’entrent, la voix sort sur un seul socket, avec 56 voix, l’appel des outils pendant la conversation, et des débits séparés des jetons texte et audio.

Alibaba CloudProduction audio192K contextePublié 21 sept. 2026SingaporeEndpoint propriétaireNouveau

À propos de Qwen3.8 Omni Flash Realtime

La voix et la vidéo en direct s’entrent, la voix sort sur un seul socket, avec 56 voix, l’appel des outils pendant la conversation, et des débits séparés des jetons texte et audio.

La session est configurée avec les événements session.update via le socket plutôt que les paramètres de requête. Les jetons texte et audio facturent à des débits séparés.

Aussi connu sous le nom Alibaba Cloud Qwen3.8 Omni Flash Realtime

realtimespeech to speechaudio inaudio outvideofunction callingmultilingual

Caractéristiques de Qwen3.8 Omni Flash Realtime

ID du modèle
qwen3-8-omni-flash-realtime
Auteur
Alibaba Cloud
Catégorie
Production audio
Publié
21 sept. 2026
Fenêtre de contexte
192K tokens
Sortie max
65 536 tokens
Entrée
AudioTexteVidéo
Sortie
AudioTexte
Région
Singapore
Endpoints
WEBSOCKET/v1/realtime
Identifiants de modèle alternatifs
qwen3.8-omni-flash-realtimealibaba/qwen3-8-omni-flash-realtime

Tarifs de l'API Qwen3.8 Omni Flash Realtime

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Entrée: audio
par 1M de jetons d’entrée audio
$1.86
Entrée
par 1M de jetons d’invite
$0.46
Produit
par 1M de jetons générés
$1.40
Sortie: audio
par 1M de jetons audio générés
$3.74
Comparer sur la page complète des tarifs

Comment appeler l'API Qwen3.8 Omni Flash Realtime

Qwen3.8 Omni Flash Realtime tient une conversation en direct via un WebSocket sur wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime, et non via les endpoints HTTP. Connectez-vous avec l'id de modèle qwen3-8-omni-flash-realtime et envoyez votre clé API EmpirioLabs dans un en-tête Authorization: Bearer lors du handshake. L'audio circule dans les deux sens en PCM 16 bits encodé en base64. Un navigateur ne peut pas définir d'en-têtes sur un WebSocket : ouvrez donc cette connexion depuis votre serveur et relayez l'audio vers le navigateur via votre propre socket. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Référence complète de l'API Qwen3.8 Omni Flash Realtime

Paramètres de l'API Qwen3.8 Omni Flash Realtime

Paramètres de requête pris en charge par l'API Qwen3.8 Omni Flash Realtime sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
voiceenumTinaTina, Cindy, Liora Mira, Raymond, Zane, Katerina, Ryan, Mia, ...Voix parlée pour la session. Configurez-la avec session.update avant que le modèle ne produise un quelconque audio. Ces voix sont spécifiques à ce modèle.
instructionsstring--Des conseils système sur la façon dont le modèle doit se comporter et parler pendant la conversation.
modalitiesstring["text","audio"]-Quels types de sortie le modèle retourne pour un tour. Coupez l’audio pour une réponse textuelle uniquement.
input_audio_formatenumpcm16pcm16Encodage de l’audio que vous ajoutez au tampon d’entrée: PCM base64 16 bits à 16 kHz.
output_audio_formatenumpcm24pcm24Encodage de l’audio que le modèle diffuse en retour: PCM 16 bits à 24 kHz.
turn_detectionstring{"type":"server_vad"}-Détection d’activité vocale côté serveur. Décide quand vous avez arrêté de parler et le modèle doit répondre. C’est activé par défaut sur ce modèle.

Bon à savoir

Connexion Voix full-duplex via un WebSocket à wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime, authentifiée avec l’en-tête Authorization Bearer ordinaire. Configurez la session avec session.update sur le socket: voix, instructions, modalités et détection de rotation. Envoi d’audio et de vidéo - Ajoutez l’audio du micro en tant qu’événements input_audio_buffer.append. - Ajoutez les images vidéo en direct comme input_image_buffer.append événements. Les images ne sont pas du contenu de message, donc une image à l’intérieur d’un élément de conversation est rejetée. - La détection d’activité vocale détermine quand vous avez arrêté de parler, donc continuez à diffuser environ une seconde après la fin de la parole. Voix Les voix de ce modèle ne sont pas du même ensemble que les modèles Qwen3.5 Omni en temps réel. Choisissez une voix dans la liste vocale plutôt que de transporter une voix à l’horizontale, ou laissez-la non réglée et la configuration par défaut vous sera fournie. Facturation Les jetons audio et texte sont tarifés séparément dans les deux sens, et chaque tour effectué est facturé séparément selon l’utilisation rapportée par le modèle.

API Qwen3.8 Omni Flash Realtime : questions fréquentes

Combien coûte l'API Qwen3.8 Omni Flash Realtime ?

Sur EmpirioLabs, Qwen3.8 Omni Flash Realtime est facturé à l'usage : Entrée: audio $1.86 par 1M de jetons d’entrée audio; Entrée $0.46 par 1M de jetons d’invite; Produit $1.40 par 1M de jetons générés; Sortie: audio $3.74 par 1M de jetons audio générés. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quelle est la fenêtre de contexte de Qwen3.8 Omni Flash Realtime ?

Qwen3.8 Omni Flash Realtime prend en charge une fenêtre de contexte de 192K tokens avec jusqu'à 65 536 tokens de sortie par réponse.

Quel endpoint Qwen3.8 Omni Flash Realtime utilise-t-il ?

Qwen3.8 Omni Flash Realtime est servi via WEBSOCKET /v1/realtime sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer Qwen3.8 Omni Flash Realtime dans le navigateur avant d'intégrer ?

Ouvrez le playground EmpirioLabs et appuyez sur Start session pour l'essayer dans votre navigateur. Qwen3.8 Omni Flash Realtime fonctionne sur un WebSocket plutôt qu'en requête et réponse, donc pour l'intégrer commencez par le guide de démarrage voix en temps réel. Connectez-vous depuis votre serveur avec votre clé API EmpirioLabs et l'id de modèle qwen3-8-omni-flash-realtime, puis diffusez l'audio dans les deux sens.

Comment obtenir une clé API Qwen3.8 Omni Flash Realtime ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.