Accueil Blog

Comment utiliser Qwen3.8 Omni Flash et LiveTranslate

Qwen3.8 Omni Flash et LiveTranslate via API

Sep 18, 2026

EmpirioLabs AI

Qwen3.8 Omni Flash est le modèle omni-input Flash d’Alibaba: il lit le texte, les images, l’audio et la vidéo, et répond en texte. Il est livré avec un contexte de jeton 1M, pensant qu’il est activé par défaut, appel de fonction, sortie structurée strictement JSON Schema, et un outil intégré, la recherche web.

Qwen3.8 Omni Flash est disponible aujourd’hui sur EmpirioLabs via une API compatible OpenAI, avec du streaming et jusqu’à 128K jetons de sortie. Essayez-le dans le aire de jeux ou appelez-le d'un client compatible OpenAI. L'ensemble de la spec et les taux actuels vivent sur le Page du modèle Qwen3.8 Omni Flash et les Docs API.

L’expédition dans le même lancement est Qwen3.8 LiveTranslate Flash Temps Réel: traduction orale via un WebSocket. Définir la langue cible, parler, et le modèle répond dans cette langue avec du texte et de l’audio. Ouvre-le dans le aire de jeux ou se connecter à WSS://api.empiriolabs.ai/v1/realtime ?model=qwen3-8-livetranslate-flash-realtime. Détails en direct sur le API vocale en temps réel page.

Prix

La facturation Omni Flash est basée sur l’utilisation avec un taux d’entrée fixe et un taux de sortie fixe à chaque taille de prompt. Les jetons audio et vidéo utilisent le même débit d’entrée que le texte; la bande-son d’une vidéo est comptée comme des jetons audio aux côtés de ses jetons vidéo. La recherche web ajoute un petit frais par appel qui ne s’applique que lorsqu’un appel est effectivement en cours. Les jetons pensants facturent comme des jetons de sortie.

Les factures LiveTranslate sont toutes effectuées par rapport à l’utilisation rapportée par le modèle, avec des tarifs distincts pour les jetons audio et les jetons texte. Les tarifs actuels des deux modèles sont toujours en vigueur sur leur Pages de modèles et les page de prix, qui restent en phase avec ce qui vous est facturé.

Démarrer rapidement

Pointez n'importe quel SDK OpenAI à l'URL de base d'EmpirioLabs et passez qwen3-8-omni-flash comme modèle:

depuis openai import OpenAI client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY »,) resp = client.chat.completions.create(model="qwen3-8-omni-flash », messages=[ {"role »: « user », « content »: [ {"type »: « text », « text »: « Que se dit, et qu’est-ce qu’il y a à l’écran ?"}, {"type »: « input_audio », « input_audio »: { « format »: « mp3 », « data »: « https://example.com/clip.mp3", }}, ]}, ], extra_body={"enable_thinking »: True, « thinking_budget »: 8192},) print(resp.choices[0].message.content)

Le même modèle d’ID fonctionne /v1/responses, la forme anthropique /v1/messages, et le modèle compatible Google /v1beta/models/qwen3-8-omni-flash:générer du contenu Route. L’id alternatif qwen3.8-omni-flash se résout selon le même modèle.

LiveTranslate sur WebSocket

LiveTranslate n’est pas HTTP. Connectez-vous au socket temps réel avec la même clé API que vous utilisez partout ailleurs, puis envoyez un session.update qui définit la langue cible avant tout son:

{"type »: « session.update », « session »: { « voice »: « Tina », « traduction »: {"language »: « en"}, « modalities »: ["text », « audio"] }}

Ajoutez ensuite l’audio du microphone comme input_audio_buffer.append événements. Le modèle traduit au fur et à mesure que vous parlez et transmet l’audio en retour. Les voix sur ce modèle sont Tina, Serena, Ethan et Cindy. L’id alternatif qwen3.8-livetranslate-flash-realtime se résout au même modèle. Un appel de chat-complétions sur ce slug est rejeté; le seul point final annoncé est le socket.

Réflexion

Sur Omni Flash, la réflexion profonde est activée par défaut et elle est diffusée comme raisonnement contenu Avec la réponse. Contrôlez-le avec considérer et thinking_budget (jusqu’à 262 144 jetons), ou envoyer raisonnement effort et la plateforme l’associe à un budget adapté au modèle. Les jetons pensants facturent comme des jetons de sortie, donc désactivez la pensée ou fixez un petit budget pour des tours courts et sensibles à la latence.

Outils intégrés

Recherche sur le web sur les Omni Flash rides derrière tool_web_search et est désactivé par défaut. Ce modèle n’expose pas l’extracteur web, l’interpréteur de code ou les outils de recherche d’images. Lorsque la recherche s’exécute, la réponse usage.tool_usage MAP indique exactement combien d’appels ont été effectués, afin que vous puissiez auditer la facturation par outil. Une seule requête peut déclencher la recherche plus d’une fois, et chaque appel invoqué est facturé. LiveTranslate n’a pas de recherche web.

Sortie structurée

Pour une forme de réponse exacte sur Omni Flash, passez response_format avec {"type »: « json_schema »,...} et « strict »: vrai: le modèle retourne exactement les clés du schéma sans supplémentaires. Mode JSON simple avec {"type »: « json_object"} est également pris en charge.

Des choses qui valent la peine d’être connues avant votre premier appel

  • Omni Flash lit l’audio et la vidéo, et il répond par texte. Ne demandez pas de sortie audio. Il n’y a pas de contrôle vocal sur ce modèle.
  • Envoyez l’audio Omni Flash en URL ou en URI de données base64. Imbriqués input_audio.data doit être une URL ou un Données: URI, pas base 64 brute. Un playground l’envoi MP3 utilise Format: « MPEG »; qui est alias de mp3.
  • tool_choice: « obligatoire » ne fonctionne pas tant que la réflexion est activée. La demande est rejetée avec une erreur évidente. Garde tool_choice: « auto » avec pensée activée, ou définie enable_thinking: faux Quand il faut forcer un appel de fonction.
  • LiveTranslate a besoin d’une langue cible lors de la première session.update. Sans cela, le socket se ferme avant que tout son ne soit produit. Laissez la langue source non configurée pour détecter automatiquement.

Les deux modèles sont disponibles dès maintenant dans le playground et via le EmpirioLabs API.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.