Accueil Blog

Présentation de l’Aplomb 1

Voici Aplomb 1, un modèle de décision pour le texte, le JSON, les images, la vidéo et l’audio

Oct 5, 2026

EmpirioLabs AI

Aplomb 1 est notre premier modèle. Il prend du texte, du JSON, des images, de l’audio et de la vidéo en une seule requête, lit jusqu’à 1 million de jetons, et prend une décision sur un document à 1 million de jetons en environ 3 secondes. Une question courte prend environ 15 ms de temps de modèle.

Il fonctionne sur un runtime d’inférence que nous avons construit pour les modèles décisionnels. Sur notre API et dans le Playground, les documents longs passent en mode rapide à long contexte: un document à 1M de jeton prend environ 3 secondes au lieu de 111, et le mode rapide a répondu correctement à toutes les 525 décisions de nos tests à long contexte.

Pour les agents, Aplomb 1 retourne une probabilité pour chaque outil et pour chaque argument enum et booléen dans une requête, donc un agent agit lorsque le modèle est sûr et escalade quand il ne l’est pas. Chaque réponse est calibrée, et elle peut indiquer quand l’entrée ne contient pas la réponse au lieu de deviner. Elle est conçue pour les décisions prises par logiciel des milliers de fois par jour, du routage d’un ticket au choix du prochain outil d’un agent.

Au 6 octobre 2026, il est #1 parmi les modèles 4B sur le tableau Decision Index publié, avec 44,86 sur notre édition officielle, et #1 parmi les modèles jusqu’à 5,3B sur 8 des 38 benchmarks. Il est disponible aujourd’hui dans l’API EmpirioLabs et Playground, et ses poids sont sur Hugging Face sous licence EmpirioLabs Modèle.

Aplomb 1 en un coup d’œil
EntréesTexte, JSON, images, vidéo et audio, dans tous les mélanges
Fenêtre1 000 000 de jetons d’État plus question
QuestionsOui ou non, choix (2 à 255 options), score (2 à 10 niveaux), sélection d’outils
Pas dans l’ÉtatUne probabilité que l’entrée ne détient pas la réponse
Sélection d’outilsL’outil suivant à appeler, avec les probabilités pour ses arguments énum et booléens
VitesseEnviron 15 ms de temps de modélisation pour une question courte; environ 3 secondes pour un document de 1 M de jeton en mode rapide à long contexte
Formats APIL’API Decisions, ainsi que les formats OpenAI, Anthropic et Gemini
FacturationUniquement les jetons d’entrée; les jetons de sortie sont toujours à zéro
Conservation des donnéesAucune conservation des données par défaut
Taille5,3 milliards de paramètres, construits sur Qwen3.5-4B; poids ouverts sur Hugging Face
Indice de décision 0.2.144,86 sur notre édition officielle, #1 parmi les modèles 4B sur le tableau publié au 6 octobre 2026

Ce qu’il répond

Quatre types de questions. Noul Répond par oui ou non avec la probabilité de oui. Choix Il choisit l’une des 2 à 255 options et retourne la distribution complète. Partition place l’État sur une échelle ordonnée de 2 à 10 niveaux. outil choisit quels outils de fonction appeler et retourne des distributions au lieu de ses arguments enum et booléen.

Pas dans l’État. Ajouter « abstenir »: vrai à une question et la réponse comporte aussi la probabilité que l’état ne contienne pas ce dont la question a besoin. Un enregistrement sans champ porteuse obtient une forte probabilité d’abstinence au lieu d’une supposition confiante.

Réponses indépendantes. Jusqu’à 128 questions partagent un même état, et chacune est répondue seule, donc ajouter une question ne change jamais une autre réponse.

Sélection d’outils pour les agents

Donnez à Aplomb 1 les outils de fonction de votre agent et l’état actuel (un ticket, une conversation, un enregistrement), et il renvoie l’outil à appeler ensuite avec une probabilité pour chaque outil et une distribution pour chaque argument enum et booléen, dans une seule requête. Un LLM général écrit un outil qui appelle jeton par jeton sans préciser à quel point il est certain de l’outil ou d’un argument. L’agent agit lorsque la probabilité est élevée et transmet l’étape à un modèle plus large quand ce n’est pas le cas, donc les étapes de routine sautent une réponse générée. Nous n’avons trouvé aucun autre modèle décisionnel qui renvoie les probabilités d’arguments.

Un ticket qui dit « Commande B-44120 arrivée avec un écran fissuré. Je veux récupérer mon argent. » avec trois outils, issue_refund (a Raison enum et a full_refund booléen), track_package et escalate_to_human, revient comme (abrégé, arrondi):

{"outil »: « issue_refund », « probabilités »: {"issue_refund »: 0,969, « aucune »: 0,025, « escalate_to_human »: 0,005, « track_package »: 0,002}, « arguments »: {"issue_refund »: { « raison »: {"valeur »: « endommagée », « probabilités »: {"endommagée »: 0,993, « not_as_described »: 0,007, « tardive »: 0,001}, « full_refund »: {"valeur »: vraie, « probability_true »: 0,761}}, « open_arguments »: {"track_package »: ["order_id"]}}

Les arguments en texte libre, tels qu’un identifiant d’ordre, sont listés sous open_arguments pour que l’agent le remplisse.

Entrées mixtes, jusqu’à 1 million de jetons

Le texte, les objets JSON et les tableaux, les images, la vidéo et l’audio entrent dans le même état, dans n’importe quelle combinaison: un enregistrement d’appel support à côté de l’enregistrement du compte, un clip de dashcam à côté du formulaire de réclamation, une photo de produit à côté de l’annonce. L’État plus la question la plus longue peut atteindre 1 000 000 de jetons, ce qui suffit pour un long contrat, une année de tickets ou des heures de transcriptions en une seule demande.

Comment il marque

Nous avons exécuté Aplomb 1 et trois modèles de décision ouverts 4B sur les mêmes éléments, et fixé les chiffres publiés par Intern-Decision pour Jev, JevK5 et Semif à côté. Sur les rapports Intern-Decision en set suites, Aplomb 1 affiche en moyenne 88,7 %. Face à la ligne publiée par Jev, il est en tête sur JevBench Hard et les décisions typées, au niveau sur JevBench Easy, et en retard sur JevBench Original, ToolACE, AG News et WildJailbreak. Sa plus grande avance est sur JevBench Hard, +5,4 points.

Accuracy of Aplomb 1 and other decision models on eleven benchmarks
Figure 1. Précision sur les benchmarks décisionnels. Les marqueurs solides sont nos courses sur les mêmes items avec des intervalles bootstrap à 95 %; les marqueurs creux sont des chiffres publiés par Intern-Decision.
RéférenceAplomb 1Jev (p)JevK5 (p)Semif (p)Décision de stage 4BKev 4BOmniJev 4B
JevBench Easy100.0100.0100.0100.0100.0100.087.5
JevBench Original95.898.697.298.6100.093.172.2
JevBench Difficile77.572.173.961.371.254.152.3
Décisions dactylographiées74.073.364.562.880.867.061.3
ToolACE89.491.381.085.296.587.488.1
AG News88.889.689.189.290.889.789.6
WildJailbreak95.696.390.592.590.293.592.3
Moyenne88.788.785.284.289.983.577.6

(p) Comme publié par Intern-Decision pour les mêmes éléments. Intern-Decision rapporte 90,02 pour son modèle 4B sur ce pack; la colonne montre notre parcours.

RéférenceAplomb 1Décision de stage 4BKev 4BOmniJev 4B
Pilote d’étalonnage70.858.369.853.1
ANLI R354.054.250.8n/a
Banking77 (77 options)74.6n/a84.068.4
CLINC150 (150 options)87.0n/a77.866.8

Entrées longues

Nous avons mesuré les recherches dans des registres d’ordre allant de 16K à 1M de jetons, avec les questions sur un ordre placées à une profondeur aléatoire.

Aplomb 1 accuracy from 16K to 1M tokens
Figure 2. Précision à mesure que l’entrée augmente, mesurée sur des registres d’ordre de la longueur indiquée.
Longueur d’entrée (jetons)16K128K240K512K1M
Aplomb 1100.0100.0100.0100.096.8

Documents longs en quelques secondes

Sur l’API EmpirioLabs et dans le Playground, un état supérieur à 131 072 jetons est lu par défaut en mode rapide à long contexte. Un document à 1 million de jetons prend environ 3 secondes au lieu d’environ 111 secondes en entier, et sur nos ensembles de test à long contexte, le mode rapide a répondu correctement à toutes les 525 décisions, contre 95,2 % pour une lecture complète.

Decisions correct by document length for fast mode and a full read
Figure 8. Décisions corrigées par longueur de document sur nos ensembles de tests à long contexte (164 documents de 131K à 1M de tokens, 525 décisions), en mode rapide et une lecture complète.
Seconds per decision by document length for fast mode and a full read
Figure 9. Temps médian du serveur par requête via l’API selon la longueur du document, le mode rapide et une lecture complète.
Longueur du document (jetons)228K513K797K979K
Mode rapide1,9 s2,4 s2,8 s3.0 s
Lecture complète8,8 s34 s76 s111 s

Envoyer « long_context »: « plein » pour lire chaque jeton. Une lecture complète est le meilleur choix lorsqu’une réponse dépend de l’ensemble du document, comme un décompte, le ton global, ou la confirmation que quelque chose n’apparaît jamais: sur 24 documents conçus pour tester ces questions, le mode rapide était correct sur 50 % des décisions et une lecture complète sur 61 %. Les réponses long_context le champ indique quel mode a été utilisé, et l’utilisation compte l’état complet dans les deux modes. Le mode rapide à long contexte n’est disponible que sur l’API EmpirioLabs et dans le Playground; les poids ouverts lisent chaque jeton.

Étalonnage

Une probabilité n’est utile que si elle signifie ce qu’elle dit. Sur neuf suites de textes, la confiance déclarée d’Aplomb 1 suit la fréquence à laquelle elle a raison: son erreur d’étalonnage regroupée est de 3,6, contre 5,0 pour Intern-Decision 4B et 4,0 pour Kev 4B (plus c’est faible, mieux c’est).

Reliability diagrams for Aplomb 1 and two open decision models
Figure 3. Confiance déclarée par rapport à l’exactitude observée, regroupée sur neuf suites de textes.

Images, vidéo et audio

Benchmark (premiers 500 éléments)Aplomb 1Décision de stage 4BOmniJev 4B
POPE89.089.288.4
MMStar68.665.264.4
AI2D87.081.083.4
MMMU57.257.056.0
HallusionBench79.879.471.2
Aplomb 1 and OmniJev accuracy on three video benchmarks
Figure 4. Décisions concernant la vidéo. Décision de stagiaire, Kev et Jev n’acceptent pas la vidéo.
RéférenceAplomb 1OmniJev 4B
TempCompass79.373.6
Vidéo-MME (court)80.772.2
NExT-QA82.679.8

Nous avons nous-mêmes ajouté l’audio à Aplomb 1; aucun des autres modèles de décision ci-dessus ne l’accepte. Il est le plus fort sur la parole et les sons vocaux; les sons environnementaux et les questions ouvertes sur l’audio sont plus difficiles à lui faire:

RéférenceAplomb 1
VocalSound (sons vocaux)90.0
CREMA-D (émotion dans la parole)65.0
ESC-50 (bruits environnementaux)8.4
MMAU (questions audio)49.1
MMSU (langue parlée)43.3

51 langues

Aplomb 1 décide du texte dans de nombreuses langues, pas seulement en anglais. Sur MASSIVE, chaque requête à un assistant vocal est écrite dans l’une des 51 langues tandis que la question et les 59 lettres d’intention restent en anglais. Sans aucune formation sur MASSIVE, Aplomb 1 obtient en moyenne 75,0 % dans les 51 langues lorsqu’il choisit parmi les 59 intentions, 91,0 % en anglais, et 70 % ou plus dans 39 d’entre elles.

Aplomb 1 intent accuracy in each of 51 languages
Figure 5. Précision de l’intention MASSIVE à zéro coup, 100 requêtes de test par langue, un choix parmi 59 intentions.

Pour référence, le projet Laya rapporte 40,1 % pour son modèle multilingue dans les mêmes 51 langues lorsqu’il choisit parmi 20 intentions, et le projet JevK5 rapporte 73,8 % en anglais avec les 60 intentions.

Indice de décision

L’indice de décision 0.2.1 comprend en moyenne 38 références publiques dans cinq domaines: connaissances et raisonnement, compréhension du langage, récupération et classification, outils et automatisation, arts et goûts humains. Chaque référence est corrigée par hasard, donc 0 signifie devinettes aléatoires et 100 signifie parfait.

Nous avons lancé le kit officiel sur Aplomb 1 le 5 octobre 2026, et il a répondu à toutes les 150 317 demandes notables. Aplomb 1 marque 44,86. Ceci est notre propre édition du kit, pas une entrée sur le tableau publié.

Bar chart of Decision Index 0.2.1 scores: Aplomb 1 44.86 on our run of the official kit, ahead of every 4B model on the published board; next are JPT-4B at 43.04 and Jet v6.2 at 42.60.
Figure 6. Indice de décision 0.2.1 scores d’Aplomb 1 et des modèles 4B sur le tableau publié. La barre cyan est Aplomb 1, notre série du kit officiel. Les barres grises sont des entrées sur le tableau publié, données du 28 septembre 2026.

Au 6 octobre 2026, Aplomb 1 est #1 parmi les modèles 4B du tableau publié, et #1 parmi les modèles jusqu’à 5,3B de paramètres sur 8 des 38 benchmarks, dont MMLU-Pro, GPQA Diamond et BBH. Sur le tableau publié (données du 28 septembre 2026), le score le plus élevé pour un modèle 4B est JPT-4B de 43,04, soit 1,82 de moins que Aplomb 1.

The 8 Decision Index benchmarks where Aplomb 1 has the top score among models up to 5.3B on the published board: BBH, MMLU-Pro, GPQA Diamond, NLI4CT, PhishNChips, HoVer, Humicroedit and POP909
Les 8 benchmarks où Aplomb 1 détient le meilleur score parmi les modèles jusqu’à 5,3 milliards sur le tableau publié, allant de la science et du raisonnement aux essais cliniques, en passant par la vérification des faits, le phishing, la musique et l’humour.
Area scores for Aplomb 1 and JPT-4B across knowledge and reasoning, language understanding, retrieval and classification, tools and automation, and arts and human taste.
Figure 7. Scores de zone, corrigés par hasard de 0 à 100, pour Aplomb 1 et JPT-4B, le meilleur modèle 4B sur le tableau publié.

Par domaine, Aplomb 1 obtient les meilleurs scores en outils et automatisation (62,4) ainsi qu’en recherche et classification (49,5). Comparé au JPT-4B, il est en tête dans quatre des cinq domaines et en retard dans la compréhension des langues (48,3 contre 52,5).

Divulgation. Les données d’entraînement d’Aplomb 1 incluaient les divisions publiques de WinoGrande et ContractNLI, deux des 38 références de l’indice. Nous n’avons pas pu vérifier entièrement que les éléments de l’indice étaient exclus des premières données d’entraînement.

Comment cela se compare

Ce que chaque modèle de décision ou API accepte et répond, à partir de sa propre documentation publiée au 29 septembre 2026, avec les prix au 6 octobre 2026:

Aplomb 1 compared with Jev 1.13, the OpenAI Decisions API preview, Intern-Decision 4B and Laya on question types, tool calls with argument probabilities, the not-in-the-input answer, inputs, context window, 1M-token speed, API formats, price per 1M input tokens and open weights
Comment Aplomb 1 se compare, selon la documentation publiée de chaque modèle au 29 septembre 2026, avec les prix au 6 octobre 2026.
Aplomb 1Jev 1.13API OpenAI Decisions (aperçu)Décision de stage 4BLaya
Types de questionsOui ou non, choix, score, outilOui ou non, choix, scoreChoix parmi les réponses listéesOui ou non, choix, scoreOui ou non, choix, score
Sélection d’outils avec probabilités d’argumentOuiNonNon documentéNonNon
Pas dans la réponse de l’ÉtatOuiNonNon documentéNonNon
EntréesTexte, JSON, images, vidéo, audioTexteTexte, imagesTexte, imagesTexte
Fenêtre1 000 000 de jetons64K jetonsNon publié8 192 jetons512 à 8 192 jetons
Prix par 1M de jetons d’entrée$0.02$0.042Non annoncéAuto-hébergé$0.02 sur Runware
Poids ouvertsOuiNonNonOuiOui

Vitesse et facturation

Aplomb 1 fonctionne sur le propre temps d’exécution d’inférence de EmpirioLabs pour les modèles décisionnels. Une question courte prend environ 15 ms de temps de modèle, une question avec une image d’environ 35 ms, un document de 15 000 jetons environ 0,3 seconde, et un état de 1 million de jetons environ 3 secondes en mode rapide à long contexte, le défaut au-dessus de 131 072 jetons, soit environ 111 secondes lues en entier.

Vous payez uniquement pour les jetons d’entrée: l’état une fois par requête et le texte propre à chaque question, jamais un modèle d’invite. Les jetons de sortie sont toujours zéro. Le taux actuel est sur le page modèle et les page de prix.

Aucune conservation de données est activée par défaut: nous ne conservons pas le contenu de vos demandes ou réponses.

Poids ouverts

Aplomb 1 est construit sur Qwen3.5-4B. Nous avons étendu sa fenêtre de 262K à 1 million de tokens, ajouté une entrée audio avec l’encodeur audio de Qwen3-Omni, ajouté notre propre tête de décision, qui renvoie chaque réponse comme des probabilités calibrées au lieu de texte généré, et entraîné le modèle pour les décisions, y compris la sélection de l’outil et la réponse not-in-the-input. Pour l’API et le Playground, nous avons construit et optimisé notre propre runtime d’inférence.

Les poids et un script de référence pour les faire soi-même sont à huggingface.co/empiriolabsai/aplomb-1. Les réponses du script peuvent différer légèrement de celles de l’API.

La recherche, l’évaluation, l’usage personnel et l’usage interne par des organisations ayant un chiffre d’affaires annuel inférieur à US$1 millions sont gratuites sous la licence modèle EmpirioLabs; héberger Aplomb 1 en tant que service ou le livrer dans un produit vendu à d’autres nécessite une licence commerciale.

Commencez

curl https://api.empiriolabs.ai/v1/decisions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « aplomb-1 », « state »: {"commande »: {"id »: « B-44120 », « status »: « expédié », « paiement »: « non payé"}}, « questions »: { « payé »: {"type »: « noul », « instructions »: « L’ordre B-44120 a-t-il été payé ? », « abstenez-vous »: vrai}, « transporteur »: {"type »: « choix », « instructions »: « Quel transporteur livre l’ordre B-44120 ? », « critères »: {"UPS »: null, « FedEx »: null, « dhl »: null}, « abstention »-le-t-il vrai} } }

Payé Il me répond par un non assuré. Porte-avions revient avec un effet de haut Abstenez-vous probabilité, car l’enregistrement ne nomme pas de porteuse. Le schéma complet, l’entrée média et les limites se trouvent dans le Guide API des décisions. Aplomb 1 accepte également les requêtes aux formats OpenAI, Anthropic et Gemini, donc vous pouvez l’appeler depuis leurs SDK; les Formats de discussion La section montre comment une demande de chat correspond à une décision. Essayez sans code dans le Terrain de jeu.

Remerciements

Nous avons développé Aplomb 1 avec l’aide de notre maîtrise d’agents IA à travers les données, la formation, l’évaluation et le déploiement. Merci à l’équipe Qwen pour Qwen3.5 et Qwen3-Omni, sur lesquels Aplomb 1 s’appuie, à Lambda pour les GPU que nous avons entraînés et sur lesquels nous l’avons fourni, ainsi qu’au programme NVIDIA Inception, au programme Z.ai startup et au programme StepFun pour leur soutien.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.