Zuhause Blog

Einführung von Aplomb 1

Einführung von Aplomb 1, einem Entscheidungsmodell für Text, JSON, Bilder, Video und Audio

Oct 5, 2026

EmpirioLabs AI

Aplomb 1 ist unser erstes Modell. Es nimmt Text, JSON, Bilder, Audio und Video in einer einzigen Anfrage, liest bis zu 1 Millionen Tokens und trifft in etwa 3 Sekunden eine Entscheidung über ein 1M-Token-Dokument. Eine kurze Frage benötigt etwa 15 ms Modellzeit.

Es läuft auf einer Inferenzlaufzeit, die wir für Entscheidungsmodelle entwickelt haben. Auf unserer API und im Playground durchlaufen lange Dokumente den schnellen Langkontextmodus: Ein 1M-Token-Dokument benötigt etwa 3 Sekunden statt 111, und im Schnellmodus wurden alle 525 Entscheidungen in unseren Langkontexttests korrekt beantwortet.

Für Agenten liefert Aplomb 1 eine Wahrscheinlichkeit für jedes Werkzeug sowie für jedes Enum- und Boolean-Argument in einer Anfrage, sodass ein Agent handelt, wenn das Modell sicher ist, und eskaliert, wenn es es nicht ist. Jede Antwort ist kalibriert, und es kann anzeigen, wann die Eingabe die Antwort nicht enthält, anstatt zu raten. Es ist für die Entscheidungen entwickelt, die Software tausende Male täglich trifft, vom Routing eines Tickets bis zur Auswahl des nächsten Tools eines Agenten.

Stand 6. Oktober 2026 ist es #1 unter 4B-Modellen auf dem veröffentlichten Decision Index-Board, mit 44,86 auf unserem offiziellen Kit und #1 unter Modellen bis zu 5,3B-Parametern in 8 der 38 Benchmarks. Es ist heute im EmpirioLabs API und Playground verfügbar, und seine Gewichtungen sind auf Hugging Face unter der EmpirioLabs Model License verfügbar.

Aplomb 1 auf den ersten Blick
EingängeText, JSON, Bilder, Video und Audio – in jedem Mix
Fenster1.000.000 Staatszeichen plus Frage
FragenJa oder nein, Wahl (2 bis 255 Optionen), Punktzahl (2 bis 10 Stufen), Werkzeugauswahl
Nicht im BundesstaatEine Wahrscheinlichkeit, dass die Eingabe die Antwort nicht enthält
WerkzeugauswahlDas nächste Werkzeug, das aufgerufen werden soll, mit Wahrscheinlichkeiten für sein Enum und boolesche Argumente
GeschwindigkeitEtwa 15 ms Modellzeit für eine kurze Frage; etwa 3 Sekunden für ein 1M-Token-Dokument im schnellen Langkontextmodus
API-FormateDie Decisions-API sowie die Formate OpenAI, Anthropic und Gemini
AbrechnungNur Eingabetoken; Ausgabetoken sind immer null
DatenspeicherungNull Datenspeicherung standardmäßig
Größe5,3 Milliarden Parameter, aufgebaut auf Qwen3.5-4B; offene Gewichte auf Hugging Face
Entscheidungsindex 0.2.144,86 in unserem Lauf des offiziellen Kits, #1 unter den 4B-Modellen auf dem veröffentlichten Board am 6. Oktober 2026

Was es beantwortet

Vier Fragetypen. Noul Antworten mit Ja oder Nein mit der Wahrscheinlichkeit Ja. Wahl Wählt eine von 2 bis 255 Optionen und gibt die volle Verteilung zurück. Punktestand ordnet den Staat auf eine geordnete Skala von 2 bis 10 Stufen. Werkzeug Wählt aus, welche Ihrer Funktionswerkzeuge aufgerufen werden sollen, und gibt Verteilungen über seine Enum- und Booleschen Argumente zurück.

Nicht im Bundesstaat. Hinzufügen "Enthaltung": Wahr zu einer Frage und die Antwort tragen auch die Wahrscheinlichkeit, dass der Bundesstaat nicht das enthält, was die Frage braucht. Ein Datensatz ohne Trägerfeld erhält eine hohe Abstinenzwahrscheinlichkeit anstelle einer sicheren Schätzung.

Unabhängige Antworten. Bis zu 128 Fragen teilen sich einen Zustand, und jede wird einzeln beantwortet, sodass das Hinzufügen einer Frage keine andere Antwort ändert.

Werkzeugauswahl für Agenten

Gib Aplomb 1 die Funktionen deines Agenten und den aktuellen Zustand (ein Ticket, eine Konversation, ein Datensatz), und es gibt das Tool mit einer Wahrscheinlichkeit für jedes Tool und einer Verteilung für jedes Enum und jedes boolesche Argument in einer Anfrage zurück, um als nächstes aufzurufen. Ein allgemeines LLM schreibt ein Tool Token für Token und sagt nicht, wie sicher es über das Tool oder irgendein Argument ist. Der Agent handelt, wenn die Wahrscheinlichkeit hoch ist, und übergibt den Schritt an ein größeres Modell, wenn sie es nicht ist, sodass Routineschritte eine generierte Antwort überspringen. Wir haben kein anderes Entscheidungsmodell gefunden, das Argumentwahrscheinlichkeiten zurückgibt.

Ein Ticket, auf dem steht: "Bestellung B-44120 ist mit einem rissigen Bildschirm angekommen. Ich will mein Geld zurück." mit drei Werkzeugen, issue_refund (a Grund Enum und a full_refund Boolesch), track_package und escalate_to_human, kommt zurück als (gekürzt, gerundet):

{"tool": "issue_refund", "probabilities": {"issue_refund": 0.969, "none": 0.025, "escalate_to_human": 0.005, "track_package": 0.002}, "arguments": {"issue_refund": { "reason": {"value": "damaged", "probabilities": {"damaged": 0.993, "not_as_described": 0.007, "late": 0.001}}, "full_refund": {"value": true, "probability_true": 0.761}}}, "open_arguments": {"track_package": ["order_id"}}}

Freitextargumente, wie eine Order-ID, sind unter open_arguments für den Agenten zu füllen.

Gemischte Eingaben, bis zu 1 Million Token

Text, JSON-Objekte und -Arrays, Bilder, Video und Audio gelangen in denselben Zustand, in beliebiger Kombination: eine Support-Anrufaufnahme neben dem Kontoeintrag, ein Dashcam-Clip neben dem Anspruchsformular, ein Produktfoto neben der Anzeige. Der Bundesstaat plus die längste Frage kann 1.000.000 Token umfassen, genug für ein Langvertragspaket, ein Jahr Tickets oder Stunden Transkripte in einer Anfrage.

Wie er bewertet

Wir haben Aplomb 1 und drei offene 4B-Entscheidungsmodelle auf denselben Punkten durchgeführt und die Zahlen, die Intern-Decision für Jev, JevK5 und SemIf veröffentlicht hat, daneben gesetzt. In den sieben Suiten umfassenden Intern-Decision-Berichten liegt Aplomb 1 im Schnitt bei 88,7 %. Gegenüber Jevs veröffentlichter Argumentation liegt es bei JevBench Hard und getippten Entscheidungen vorne, gleich bei JevBench Easy, und liegt bei JevBench Original, ToolACE, AG News und WildJailbreak zurück. Der größte Vorsprung liegt bei JevBench Hard, +5,4 Punkte.

Accuracy of Aplomb 1 and other decision models on eleven benchmarks
Abbildung 1. Genauigkeit bei Entscheidungsbenchmarks. Solide Marker sind unsere Läufe auf denselben Punkten mit 95 % Bootstrap-Intervallen; Hohlmarker sind Zahlen, die Intern-Decision veröffentlicht haben.
BenchmarkAplomb 1Jev (p)JevK5 (p)SemIf (p)Intern-Entscheidung 4BKev 4BOmniJev 4B
JevBench Easy100.0100.0100.0100.0100.0100.087.5
JevBench Original95.898.697.298.6100.093.172.2
JevBench Hard77.572.173.961.371.254.152.3
Typisierte Entscheidungen74.073.364.562.880.867.061.3
ToolACE89.491.381.085.296.587.488.1
AG News88.889.689.189.290.889.789.6
WildJailbreak95.696.390.592.590.293.592.3
Durchschnitt88.788.785.284.289.983.577.6

(p) Wie veröffentlicht von Intern-Decision für dieselben Items. Intern-Decision berichtet 90,02 für sein 4B-Modell in diesem Bündel; die Spalte zeigt unseren Durchlauf.

BenchmarkAplomb 1Intern-Entscheidung 4BKev 4BOmniJev 4B
Kalibrierungspilot70.858.369.853.1
ANLI R354.054.250.8n/a
Banking77 (77 Optionen)74.6n/a84.068.4
CLINC150 (150 Optionen)87.0n/a77.866.8

Lange Eingänge

Wir haben Nachschlage in Auftragsbüchern von 16K bis 1M Token gemessen, wobei die Fragen zu einer Bestellung in einer zufälligen Tiefe gestellt wurden.

Aplomb 1 accuracy from 16K to 1M tokens
Abbildung 2. Genauigkeit, wenn die Eingabe wächst, gemessen auf Ordnungsbüchern der angegebenen Länge.
Eingabelänge (Tokens)16K128.000240K512K1M
Aplomb 1100.0100.0100.0100.096.8

Lange Dokumente in Sekunden

Auf der EmpirioLabs API und im Playground wird standardmäßig ein Zustand, der länger als 131.072 Token ist, im schnellen Langkontextmodus gelesen. Ein 1M-Token-Dokument benötigt etwa 3 Sekunden statt etwa 111 Sekunden zum vollständigen Lesen, und bei unseren Langkontext-Testsätzen beantwortete der Schnellmodus alle 525 Entscheidungen korrekt, gegenüber 95,2 % bei einer vollständigen Lesung.

Decisions correct by document length for fast mode and a full read
Abbildung 8. Entscheidungen korrigieren nach Dokumentlänge auf unseren Langkontext-Testsätzen (164 Dokumente mit 131K bis 1M Tokens, 525 Entscheidungen), Fast Mode und eine vollständige Lesung.
Seconds per decision by document length for fast mode and a full read
Abbildung 9. Median Serverzeit pro Anfrage über die API nach Dokumentlänge, Schnellmodus und vollständigem Lesen.
Dokumentlänge (Tokens)228K513K797.000979K
Schnellmodus1,9 s2,4 s2,8 s3.0 s
Vollständige Lektüre8,8 s34 s76 s111 s

Senden "long_context": "Voll" um jedes Token zu lesen. Eine vollständige Lektüre ist die bessere Wahl, wenn eine Antwort vom gesamten Dokument abhängt, wie einer Zählung, dem Gesamtton oder der Bestätigung, dass etwas nie erscheint: Bei 24 Dokumenten, die diese Fragen testen sollen, lag der Schnellmodus bei 50 % der Entscheidungen richtig und bei 61 % eine vollständige Lesung. Die Antworten long_context Feld gibt an, welcher Modus verwendet wurde, und die Nutzung zählt den gesamten Zustand in beiden Modi. Der schnelle Langkontextmodus ist nur auf der EmpirioLabs API und im Playground verfügbar; die offenen Gewichte lesen jedes Token.

Kalibrierung

Eine Wahrscheinlichkeit ist nur dann nützlich, wenn sie das meint, was sie sagt. Über neun Textsuiten hinweg verfolgt die angegebene Konfidenz von Aplomb 1, wie oft sie richtig ist: Der gepoolte Kalibrierungsfehler beträgt 3,6, gegenüber 5,0 für Intern-Decision 4B und 4,0 für Kev 4B (niedriger ist besser).

Reliability diagrams for Aplomb 1 and two open decision models
Abbildung 3. Bestätigte Zuversicht gegenüber beobachteter Genauigkeit, über neun Textsuiten zusammengefasst.

Bilder, Video und Audio

Benchmark (erste 500 Artikel)Aplomb 1Intern-Entscheidung 4BOmniJev 4B
POPE89.089.288.4
MMStar68.665.264.4
AI2D87.081.083.4
MMMU57.257.056.0
HallusionsBank79.879.471.2
Aplomb 1 and OmniJev accuracy on three video benchmarks
Abbildung 4. Entscheidungen über Video. Praktikant-Entscheidung: Kev und Jev akzeptieren kein Video.
BenchmarkAplomb 1OmniJev 4B
TempCompass79.373.6
Video-MME (Kurzzeit)80.772.2
NExT-QA82.679.8

Wir haben selbst Audio zu Aplomb 1 hinzugefügt; keines der anderen Entscheidungsmodelle oben akzeptiert es. Am stärksten ist es bei Sprach- und Stimmklängen; Umgebungsgeräusche und offene Fragen zum Audio sind dadurch schwieriger:

BenchmarkAplomb 1
VocalSound (Gesangsklänge)90.0
CREMA-D (Emotion in der Sprache)65.0
ESC-50 (Umgebungsgeräusche)8.4
MMAU (Audiofragen)49.1
MMSU (gesprochene Sprache)43.3

51 Sprachen

Aplomb 1 entscheidet über Text in vielen Sprachen, nicht nur im Englischen. Bei MASSIVE wird jede Anfrage an einen Sprachassistenten in einer von 51 Sprachen verfasst, während die Frage- und die 59 Absichtslabels auf Englisch bleiben. Ohne jegliches Training auf MASSIVE liegt Aplomb 1 im Durchschnitt bei 75,0 % in den 51 Sprachen bei der Auswahl aller 59 Sprachen, 91,0 % auf Englisch und 70 % oder mehr in 39 Sprachen.

Aplomb 1 intent accuracy in each of 51 languages
Abbildung 5. Zero-Shot-MASSIVE Absichtsgenauigkeit, 100 Testanfragen pro Sprache, eine Wahl unter 59 Absichten.

Zum Vergleich: Das Laya-Projekt nennt 40,1 % für sein mehrsprachiges Modell in denselben 51 Sprachen bei der Auswahl aus 20 Absichten, und das JevK5-Projekt 73,8 % auf Englisch mit allen 60 Absichten.

Entscheidungsindex

Decision Index 0.2.1 umfasst im Durchschnitt 38 öffentliche Benchmarks in fünf Bereichen: Wissen und Denken, Sprachverständnis, Abruf und Klassifikation, Werkzeuge und Automatisierung sowie Kunst und menschlichen Geschmack. Jeder Benchmark ist zufallskorrigiert, also steht 0 für zufälliges Raten und 100 für perfekt.

Wir haben das offizielle Kit am 5. Oktober 2026 auf Aplomb 1 laufen lassen, und es hat alle 150.317 wertbaren Anfragen beantwortet. Aplomb 1 erreicht 44,86 Punkte. Dies ist unser eigener Durchlauf des Kits, kein Eintrag auf dem veröffentlichten Board.

Bar chart of Decision Index 0.2.1 scores: Aplomb 1 44.86 on our run of the official kit, ahead of every 4B model on the published board; next are JPT-4B at 43.04 and Jet v6.2 at 42.60.
Abbildung 6. Entscheidungsindex 0.2.1 Werte von Aplomb 1 und den 4B-Modellen auf dem veröffentlichten Board. Der cyanfarbene Balken ist Aplomb 1, unser Lauf des offiziellen Kits. Graue Balken sind Einträge auf dem veröffentlichten Board, Daten vom 28. September 2026.

Stand 6. Oktober 2026 ist Aplomb 1 #1 unter den 4B-Modellen auf dem veröffentlichten Board und #1 unter Modellen bis zu 5,3B-Parametern bei 8 der 38 Benchmarks, darunter MMLU-Pro, GPQA Diamond und BBH. Auf dem veröffentlichten Board (Daten vom 28. September 2026) liegt der höchste Wert für ein 4B-Modell bei JPT-4B bei 43,04, 1,82 unter Aplomb 1.

The 8 Decision Index benchmarks where Aplomb 1 has the top score among models up to 5.3B on the published board: BBH, MMLU-Pro, GPQA Diamond, NLI4CT, PhishNChips, HoVer, Humicroedit and POP909
Die 8 Benchmarks, bei denen Aplomb 1 unter Modellen bis zu 5,3 Milliarden im veröffentlichten Board die höchste Punktzahl hat, von Wissenschaft und Vernunft bis hin zu klinischen Studien, Faktenprüfung, Phishing, Musik und Humor.
Area scores for Aplomb 1 and JPT-4B across knowledge and reasoning, language understanding, retrieval and classification, tools and automation, and arts and human taste.
Abbildung 7. Flächenwerte, chancenkorrigiert von 0 bis 100, für Aplomb 1 und JPT-4B, das beste 4B-Modell auf dem veröffentlichten Board.

Nach Gebiet erzielt Aplomb 1 die höchsten Werte in Tools und Automatisierung (62,4) sowie bei Abruf und Klassifikation (49,5). Im Vergleich zu JPT-4B liegt es in vier der fünf Bereiche voraus und im Sprachverständnis hinter (48,3 gegenüber 52,5).

Offenlegung. Die Trainingsdaten von Aplomb 1 enthielten die öffentlichen Zugaufteilungen von WinoGrande und ContractNLI, zwei der 38 Benchmarks im Index. Wir konnten nicht vollständig verifizieren, dass Indexelemente aus den frühesten Trainingsdaten ausgeschlossen wurden.

Wie es im Vergleich steht

Was jedes Entscheidungsmodell oder jede API akzeptiert und beantwortet, basierend auf seiner eigenen veröffentlichten Dokumentation vom 29. September 2026, mit Preisen vom 6. Oktober 2026:

Aplomb 1 compared with Jev 1.13, the OpenAI Decisions API preview, Intern-Decision 4B and Laya on question types, tool calls with argument probabilities, the not-in-the-input answer, inputs, context window, 1M-token speed, API formats, price per 1M input tokens and open weights
Wie Aplomb 1 im Vergleich abschneidet, basierend auf der veröffentlichten Dokumentation jedes Modells vom 29. September 2026, mit Preisen vom 6. Oktober 2026.
Aplomb 1Jev 1.13OpenAI Decisions API (Vorschau)Intern-Entscheidung 4BLaya
FragetypenJa oder nein, Wahl, Partitur, WerkzeugJa oder nein, Wahl, PunktzahlAuswahl unter den aufgeführten AntwortenJa oder nein, Wahl, PunktzahlJa oder nein, Wahl, Punktzahl
Werkzeugauswahl mit ArgumentwahrscheinlichkeitenJaNeinNicht dokumentiertNeinNein
Nicht in der staatlichen AntwortJaNeinNicht dokumentiertNeinNein
EingängeText, JSON, Bilder, Video, AudioTextText, BilderText, BilderText
Fenster1.000.000 Token64.000 TokenNicht veröffentlicht8.192 Token512 zu 8.192 Marken
Preis pro 1 Million Eingabetoken$0.02$0.042Nicht angekündigtSelbstgehostet$0.02 auf Runware
Offene GewichteJaNeinNeinJaJa

Geschwindigkeit und Abrechnung

Aplomb 1 läuft auf EmpirioLabs eigener Inferenzlaufzeit für Entscheidungsmodelle. Eine kurze Frage benötigt etwa 15 ms Modellzeit, eine Frage mit einem Bild von etwa 35 ms, ein 15.000-Token-Dokument etwa 0,3 Sekunden und einen 1M-Token-Zustand etwa 3 Sekunden im schnellen Long-Context-Modus, der Standard liegt über 131.072 Tokens, also etwa 111 Sekunden vollständig gelesen.

Du zahlst nur für Eingabetoken: den Zustand einmal pro Anfrage und den eigenen Text jeder Frage, niemals eine Eingabevorlage. Ausgabetoken sind immer null. Der aktuelle Satz ist auf dem modellblatt und die preisseite.

Standardmäßig ist keine Datenaufbewahrung aktiviert: Wir speichern den Inhalt Ihrer Anfragen oder Antworten nicht.

Offene Gewichte

Aplomb 1 basiert auf Qwen3.5-4B. Wir haben das Fenster von 262K auf 1M Token erweitert, Audio-Eingänge mit dem Audio-Encoder von Qwen3-Omni hinzugefügt, unseren eigenen Entscheidungskopf hinzugefügt, der jede Antwort als kalibrierte Wahrscheinlichkeiten statt generierten Text zurückgibt, und das Modell für Entscheidungen trainiert, einschließlich Werkzeugauswahl und der not-in-the-input Antwort. Für die API und die Playground haben wir unsere eigene Inferenzlaufzeit gebaut und optimiert.

Die Gewichte und ein Referenzskript, um sie selbst zu laufen, sind bei huggingface.co/empiriolabsai/aplomb-1. Die Antworten des Skripts können sich leicht von denen der API unterscheiden.

Forschung, Bewertung, persönliche Nutzung und interne Nutzung durch Organisationen mit einem Jahresumsatz unter US$1 Millionen sind unter der EmpirioLabs Model License kostenlos; das Hosting von Aplomb 1 als Dienstleistung oder der Versand in einem Produkt, das an andere verkauft wird, erfordert eine kommerzielle Lizenz.

Beginn

curl https://api.empiriolabs.ai/v1/decisions \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -H "Inhalt-Typ: application/json" \ -d '{ "model": "aplomb-1", "state": {"order": {"id": "B-44120", "status": "shipped", "payment": "unpaid"}}, "questions": { "paid": {"type": "noul", "instructions": "Wurde Befehl B-44120 bezahlt?", "abstain": true}, "carrier": {"type": "choice", "instructions": "welcher Carrier liefert Befehl B-44120?", "criteria": {"ups": null, "fedex": null, "dhl": null}, "abstain": true} } }

Bezahlt Es kommt als ein selbstbewusstes Nein zurück. Träger kommt mit einem High zurück Enthaltung Wahrscheinlichkeit, weil der Datensatz keinen Träger nennt. Das vollständige Schema, der Medieneingang und die Grenzwerte sind in der Decisions-API-Leitfaden. Aplomb 1 akzeptiert außerdem Anfragen in den Formaten OpenAI, Anthropic und Gemini, sodass man es aus deren SDKs aufrufen kann; die des Leitfadens Chat-Formate Abschnitt zeigt, wie eine Chat-Anfrage auf eine Entscheidung zugeordnet wird. Versuche es ohne Code in der Spielplatz.

Danksagungen

Wir haben Aplomb 1 mit Hilfe unseres KI-Agenten-Harnesss über Daten, Training, Evaluation und Bereitstellung entwickelt. Danke an das Qwen-Team für Qwen3.5 und Qwen3-Omni, auf denen Aplomb 1 aufbaut, an Lambda für die GPUs, die wir trainiert und auf denen wir es einsetzen, sowie an das NVIDIA Inception-Programm, das Z.ai-Startup-Programm und das StepFun-Startup-Programm für ihre Unterstützung.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.