Inicio Blog

Presentando Aplomb 1

Presentamos Aplomb 1, un modelo de decisión para texto, JSON, imágenes, vídeo y audio

Oct 5, 2026

EmpirioLabs AI

Aplomb 1 es nuestro primer modelo. Toma texto, JSON, imágenes, audio y vídeo en una sola petición, lee hasta 1 millón de tokens y toma una decisión sobre un documento de 1 millón de tokens en unos 3 segundos. Una pregunta corta lleva unos 15 ms de tiempo de modelo.

Funciona en un runtime de inferencia que construimos para modelos de decisión. En nuestra API y en el Playground, los documentos largos pasan por un modo rápido de contexto largo: un documento con 1M de token tarda unos 3 segundos en lugar de 111, y el modo rápido respondió correctamente a las 525 decisiones en nuestras pruebas de contexto largo.

Para los agentes, Aplomb 1 devuelve una probabilidad para cada herramienta y para cada argumento enum y booleano en una sola petición, así que un agente actúa cuando el modelo está seguro y escala cuando no lo está. Cada respuesta está calibrada, y puede indicar cuándo la entrada no contiene la respuesta en lugar de adivinar. Está diseñado para las decisiones que el software toma miles de veces al día, desde enrutar un ticket hasta elegir la siguiente herramienta de un agente.

A fecha de 6 de octubre de 2026, es el #1 entre los modelos 4B en el panel publicado del Decision Index, con 44,86 en nuestra edición oficial del equipamiento y #1 entre los modelos de hasta 5,3B en 8 de los 38 benchmarks. Está disponible hoy en día en la API EmpirioLabs y Playground, y sus pesos están en Hugging Face bajo la EmpirioLabs Model License.

Aplomb 1 de un vistazo
EntradasTexto, JSON, imágenes, vídeo y audio, en cualquier mezcla
Ventana1.000.000 de fichas de estado más pregunta
PreguntasSí o no, elección (2 a 255 opciones), puntuación (2 a 10 niveles), selección de herramientas
No en el estadoUna probabilidad de que la entrada no tenga la respuesta
Selección de herramientasLa siguiente herramienta a llamar, con probabilidades para sus argumentos de enum y booleano
VelocidadUnos 15 ms de tiempo de modelo para una pregunta corta; unos 3 segundos para un documento de 1M de tokens en modo rápido de largo contexto
Formatos APILa API de Decisiones, además de los formatos OpenAI, Anthropic y Gemini
FacturaciónSolo tokens de entrada; los tokens de salida siempre son cero
Retención de datosRetención cero de datos por defecto
Tamaño5.300 millones de parámetros, construidos sobre Qwen3.5-4B; pesos abiertos en Hugging Face
Índice de Decisión 0.2.144,86 en nuestra edición del kit oficial, #1 entre los modelos 4B en la tabla publicada a fecha de 6 de octubre de 2026

Lo que responde

Cuatro tipos de preguntas. Noul Responde sí o no con la probabilidad de que sí. Elección elige una de entre 2 y 255 opciones y devuelve la distribución completa. Partitura sitúa al estado en una escala ordenada de 2 a 10 niveles. Herramienta Elige cuál de tus herramientas de función llamar y devuelve distribuciones sobre sus argumentos enum y booleano.

No en el estado. Añadir "abstenerse": cierto a una pregunta y la respuesta también conlleva la probabilidad de que el estado no contenga lo que la pregunta necesita. Un registro sin campo portador obtiene una alta probabilidad de abstención en lugar de una suposición segura.

Respuestas independientes. Hasta 128 preguntas comparten un estado, y cada una se responde por sí sola, por lo que añadir una pregunta nunca cambia otra respuesta.

Selección de herramientas para agentes

Da a Aplomb 1 las herramientas de función de tu agente y el estado actual (un ticket, una conversación, un registro), y devuelve la llamada a continuación con una probabilidad para cada herramienta y una distribución para cada argumento enum y booleano, en una sola petición. Un LLM general escribe una llamada de herramienta token por token y no dice cuán seguro está sobre la herramienta o cualquier argumento. El agente actúa cuando la probabilidad es alta y pasa el paso a un modelo mayor cuando no lo es, por lo que los pasos rutinarios saltan una respuesta generada. No encontramos otro modelo de decisión que devuelva probabilidades de argumento.

Un ticket que dice "Pedido B-44120 llegó con la pantalla agrietada. Quiero que me devuelvan el dinero." Con tres herramientas, issue_refund (a Razón enum y a full_refund booleano), track_package y escalate_to_human, responde como (abreviado, redondeado):

{"herramienta": "issue_refund", "probabilidades": {"issue_refund": 0,969, "ninguna": 0,025, "escalate_to_human": 0,005, "track_package": 0,002}, "argumentos": {"issue_refund": { "razón": {"valor": "dañado", "probabilidades": {"dañado": 0,993, "not_as_described": 0,007, "tarde": 0,001}, "full_refund": {"valor": verdadero, "probability_true": 0,761}}}, "open_arguments": {"track_package": ["order_id"]}}

Los argumentos en texto libre, como un id de orden, se listan bajo open_arguments para que el agente lo cubra.

Entradas mixtas, hasta 1 millón de tokens

El texto, los objetos JSON y los arrays, imágenes, vídeo y audio entran en el mismo estado, en cualquier combinación: una llamada de soporte grabando junto al registro de la cuenta, un clip de dashcam junto al formulario de reclamación, una foto de producto junto al anuncio. El estado más la pregunta más larga pueden llegar a 1.000.000 de tokens, suficiente para un paquete de contrato largo, un año de tickets o horas de transcripciones en una sola solicitud.

Cómo pone la puntuación

Ejecutamos Aplomb 1 y tres modelos de decisión 4B abiertos en los mismos ítems, y fijamos los números que Intern-Decision publicó para Jev, JevK5 y Semif junto a ellos. En los siete informes de Intern-Decision del paquete de siete suites, Aplomb 1 promedia un 88,7%. Frente a la línea publicada por Jev, está por delante en JevBench Hard y decisiones tipadas, empatado en JevBench Easy, y por detrás en JevBench Original, ToolACE, AG News y WildJailbreak. Su mayor ventaja es en JevBench Hard, +5,4 puntos.

Accuracy of Aplomb 1 and other decision models on eleven benchmarks
Figura 1. Precisión en los benchmarks de decisión. Los marcadores sólidos son nuestras etapas sobre los mismos ítems con intervalos bootstrap del 95%; los marcadores huecos son números publicados por Intern-Decision.
Índice de referenciaAplomb 1Jev (p)JevK5 (p)SemIf (p)Decisión de Becarios 4BKev 4BOmniJev 4B
JevBench Easy100.0100.0100.0100.0100.0100.087.5
JevBench Original95.898.697.298.6100.093.172.2
JevBench Difícil77.572.173.961.371.254.152.3
Decisiones tipificadas74.073.364.562.880.867.061.3
ToolACE89.491.381.085.296.587.488.1
AG News88.889.689.189.290.889.789.6
Fuga de la cárcel salvaje95.696.390.592.590.293.592.3
Promedio88.788.785.284.289.983.577.6

(p) Según lo publicado por Intern-Decision para los mismos elementos. Intern-Decision reporta 90,02 para su modelo 4B en este paquete; la columna muestra nuestra ejecución.

Índice de referenciaAplomb 1Decisión de Becarios 4BKev 4BOmniJev 4B
Piloto de calibración70.858.369.853.1
ANLI R354.054.250.8n/a
Banking77 (77 opciones)74.6n/a84.068.4
CLINC150 (150 opciones)87.0n/a77.866.8

Entradas largas

Medimos las búsquedas en registros de orden desde 16K hasta 1M tokens, con las preguntas sobre un orden colocadas a una profundidad aleatoria.

Aplomb 1 accuracy from 16K to 1M tokens
Figura 2. Precisión a medida que crece la entrada, medida en libros de orden de la longitud indicada.
Longitud de entrada (tokens)16K128K240K512K1M
Aplomb 1100.0100.0100.0100.096.8

Documentos largos en segundos

En la API EmpirioLabs y en la Playground, un estado superior a 131.072 tokens se lee por defecto en modo rápido de contexto largo. Un documento de 1M de tokens tarda unos 3 segundos en lugar de unos 111 segundos en su totalidad, y en nuestros conjuntos de test de contexto largo el modo rápido respondió correctamente a las 525 decisiones, frente al 95,2% para una lectura completa.

Decisions correct by document length for fast mode and a full read
Figura 8. Decisiones corregidas por longitud de documento en nuestros conjuntos de pruebas de contexto largo (164 documentos de 131K a 1M tokens, 525 decisiones), modo rápido y lectura completa.
Seconds per decision by document length for fast mode and a full read
Figura 9. Tiempo medio del servidor por solicitud a través de la API por longitud del documento, modo rápido y lectura completa.
Longitud del documento (tokens)228K513K797K979K
Modo rápido1,9 s2.4 s2,8 s3.0 s
Lectura completa8,8 s34 s76 s111 s

Enviar "long_context": "lleno" leer cada token. Una lectura completa es la mejor opción cuando una respuesta depende de todo el documento, como un recuento, el tono general o confirmar que algo nunca aparece: en 24 documentos construidos para probar esas preguntas, el modo rápido acertó en el 50% de las decisiones y en una lectura completa en el 61%. Las respuestas long_context el campo indica qué modo se utilizó y el uso cuenta el estado completo en ambos modos. El modo rápido de contexto largo solo está disponible en la API EmpirioLabs y en la Playground; los pesos abiertos leen cada token.

Calibración

Una probabilidad solo es útil si significa lo que dice. En nueve suites de texto, la confianza declarada de Aplomb 1 rastrea cuántas veces acierta: su error de calibración agrupado es 3,6, frente a 5,0 para Intern-Decision 4B y 4,0 para Kev 4B (más bajo, mejor).

Reliability diagrams for Aplomb 1 and two open decision models
Figura 3. Confianza declarada frente a la precisión observada, agrupada en nueve suites de texto.

Imágenes, vídeo y audio

Benchmark (primeros 500 artículos)Aplomb 1Decisión de Becarios 4BOmniJev 4B
PAPA89.089.288.4
MMStar68.665.264.4
AI2D87.081.083.4
MMMU57.257.056.0
HallusionBench79.879.471.2
Aplomb 1 and OmniJev accuracy on three video benchmarks
Figura 4. Decisiones sobre vídeo. Decisión de becarios, Kev y Jev no aceptan vídeo.
Índice de referenciaAplomb 1OmniJev 4B
TempCompass79.373.6
Video-MME (corto)80.772.2
NExT-QA82.679.8

Nosotros mismos añadimos audio a Aplomb 1; ninguno de los otros modelos de decisión anteriores lo acepta. Es más fuerte en sonidos de voz y voz; los sonidos ambientales y las preguntas abiertas sobre audio son más difíciles para él:

Índice de referenciaAplomb 1
VocalSound (sonidos vocales)90.0
CREMA-D (emoción en el habla)65.0
ESC-50 (sonidos ambientales)8.4
MMAU (preguntas de audio)49.1
MMSU (lengua hablada)43.3

51 idiomas

Aplomb 1 decide sobre el texto en muchos idiomas, no solo en inglés. En MASSIVE, cada petición a un asistente de voz está escrita en uno de los 51 idiomas mientras que la pregunta y las 59 etiquetas de intención permanecen en inglés. Sin formación en MASSIVE, Aplomb 1 promedia un 75,0% en los 51 idiomas al elegir entre las 59 intenciones, un 91,0% en inglés y un 70% o más en 39 de ellos.

Aplomb 1 intent accuracy in each of 51 languages
Figura 5. Precisión de intención MASSIVE sin disparos, 100 solicitudes de prueba por idioma, una opción entre 59 intentos.

Para referencia, el proyecto Laya informa del 40,1% para su modelo multilingüe en los mismos 51 idiomas al elegir entre 20 intenciones, y el proyecto JevK5 reporta un 73,8% en inglés con las 60 intenciones.

Índice de Decisión

El Índice de Decisión 0.2.1 promedia 38 referencias públicas en cinco áreas: conocimiento y razonamiento, comprensión, recuperación y clasificación del lenguaje, herramientas y automatización, y artes y gusto humano. Cada punto de referencia se corrige por azar, por lo que 0 significa adivinar al azar y 100 significa perfecto.

Ejecutamos el kit oficial en Aplomb 1 el 5 de octubre de 2026 y respondió a las 150.317 solicitudes puntuables. Aplomb 1 obtiene una puntuación de 44,86. Esta es nuestra propia edición del kit, no una entrada en el tablero publicado.

Bar chart of Decision Index 0.2.1 scores: Aplomb 1 44.86 on our run of the official kit, ahead of every 4B model on the published board; next are JPT-4B at 43.04 and Jet v6.2 at 42.60.
Figura 6. Índice de decisión 0.2.1 puntuaciones de los modelos Aplomb 1 y 4B en el tablero publicado. La barra cian es Aplomb 1, nuestra tirada del kit oficial. Las barras grises son entradas en el tablero publicado, datos del 28 de septiembre de 2026.

A fecha de 6 de octubre de 2026, Aplomb 1 es el #1 entre los modelos 4B en la tabla publicada, y #1 entre los modelos hasta 5,3B parámetros en 8 de los 38 benchmarks, incluyendo MMLU-Pro, GPQA Diamond y BBH. En la tabla publicada (datos del 28 de septiembre de 2026), la puntuación más alta para un modelo 4B es la JPT-4B con 43,04, 1,82 por debajo de Aplomb 1.

The 8 Decision Index benchmarks where Aplomb 1 has the top score among models up to 5.3B on the published board: BBH, MMLU-Pro, GPQA Diamond, NLI4CT, PhishNChips, HoVer, Humicroedit and POP909
Los 8 benchmarks donde Aplomb 1 tiene la puntuación más alta entre los modelos hasta 5.300 millones en el panel publicado, desde ciencia y razonamiento hasta ensayos clínicos, verificación de hechos, phishing, música y humor.
Area scores for Aplomb 1 and JPT-4B across knowledge and reasoning, language understanding, retrieval and classification, tools and automation, and arts and human taste.
Figura 7. Puntuaciones de área, corregidas por azar de 0 a 100, para Aplomb 1 y JPT-4B, el mejor modelo 4B del tablero publicado.

Por área, Aplomb 1 obtiene la puntuación más alta en herramientas y automatización (62,4) y recuperación y clasificación (49,5). En comparación con JPT-4B, está por delante en cuatro de las cinco áreas y por detrás en comprensión del lenguaje (48,3 frente a 52,5).

Divulgación. Los datos de entrenamiento de Aplomb 1 incluían las divisiones públicas de WinoGrande y ContractNLI, dos de los 38 puntos de referencia del índice. No pudimos verificar completamente que los ítems del índice fueran excluidos de los primeros datos de entrenamiento.

Cómo se compara

Lo que cada modelo de decisión o API acepta y responde, a partir de su propia documentación publicada a fecha de 29 de septiembre de 2026, con precios a fecha de 6 de octubre de 2026:

Aplomb 1 compared with Jev 1.13, the OpenAI Decisions API preview, Intern-Decision 4B and Laya on question types, tool calls with argument probabilities, the not-in-the-input answer, inputs, context window, 1M-token speed, API formats, price per 1M input tokens and open weights
Cómo se compara Aplomb 1, según la documentación publicada de cada modelo a fecha de 29 de septiembre de 2026, con los precios a fecha de 6 de octubre de 2026.
Aplomb 1Jev 1.13API de OpenAI Decisions (vista previa)Decisión de Becarios 4BLaya
Tipos de preguntasSí o no, elección, puntuación, herramientaSí o no, elección, puntuaciónElección entre las respuestas listadasSí o no, elección, puntuaciónSí o no, elección, puntuación
Selección de herramientas con probabilidades argumentalesSíNoNo documentadoNoNo
No en la respuesta estatalSíNoNo documentadoNoNo
EntradasTexto, JSON, imágenes, vídeo, audioTextoTexto, imágenesTexto, imágenesTexto
Ventana1.000.000 de fichas64K fichasNo publicado8.192 fichas512 a 8.192 fichas
Precio por cada 1M de fichas de entrada$0.02$0.042No anunciadoAutoalojado$0.02 en Runware
Peso abiertoSíNoNoSíSí

Velocidad y facturación

Aplomb 1 se ejecuta con el propio tiempo de ejecución de inferencia de EmpirioLabs para modelos de decisión. Una pregunta corta toma unos 15 ms de tiempo de modelo, una pregunta con una imagen de unos 35 ms, un documento de 15.000 tokens unos 0,3 segundos, y un estado de 1M de tokens unos 3 segundos en modo rápido de contexto largo, con el valor por defecto por encima de 131.072 tokens, o unos 111 segundos leídos completos.

Pagas solo por los tokens de entrada: el estado una vez por solicitud y el texto propio de cada pregunta, nunca una plantilla de prompt. Los tokens de salida siempre son cero. La tasa actual está en el página modelo y el página de precios.

Por defecto, la retención de datos no está activada: no retenemos el contenido de tus solicitudes o respuestas.

Peso abierto

Aplomb 1 está construido sobre Qwen3.5-4B. Ampliamos su ventana de 262K a 1M de tokens, añadimos entrada de audio con el codificador de audio de Qwen3-Omni, añadimos nuestra propia cabeza de decisión, que devuelve cada respuesta como probabilidades calibradas en lugar de texto generado, y entrenamos el modelo para decisiones, incluyendo la selección de herramientas y la respuesta not-in-the-input. Para la API y la Playground, construimos y optimizamos nuestro propio tiempo de ejecución de inferencia.

Los pesos y un guion de referencia para ejecutarlos tú mismo están en huggingface.co/empiriolabsai/aplomb-1. Las respuestas del script pueden diferir ligeramente de las de la API.

La investigación, evaluación, uso personal y uso interno por organizaciones con ingresos anuales inferiores a US$1 millones son gratuitas bajo la Licencia Modelo EmpirioLabs; alojar Aplomb 1 como servicio o enviarlo en un producto vendido a otros requiere una licencia comercial.

Empieza

curl https://api.empiriolabs.ai/v1/decisions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "aplomb-1", "estado": {"pedido": {"id": "B-44120", "estado": "enviado", "pago": "no pagado"}}, "preguntas": { "pagado": {"tipo": "noul", "instrucciones": "¿Se ha pagado la orden B-44120?", "abstención": verdadero}, "transportista": {"tipo": "elección", "instrucciones": "¿Qué transportista entrega la orden B-44120?", "criterios": {"UPS": nulo, "FedEx": nulo, "DHL": nulo}, "abstención": verdadero} } }'

pagado Me responde como un no rotundo. Portador vuelve con un subidón abstenerse probabilidad, porque el registro no nombra una portadora. El esquema completo, la entrada de medios y los límites están en el Guía de la API de decisiones. Aplomb 1 también acepta solicitudes en los formatos OpenAI, Anthropic y Gemini, así que puedes llamarlo desde sus SDK; los de la guía Formatos de chat La sección muestra cómo una solicitud de chat se relaciona con una decisión. Pruébalo sin código en el Playground.

Agradecimientos

Construimos Aplomb 1 con la ayuda de nuestro aprovechamiento de agentes de IA en datos, entrenamiento, evaluación y despliegue. Gracias al equipo de Qwen por Qwen3.5 y Qwen3-Omni, sobre los que se basa Aplomb 1, a Lambda por las GPUs que entrenamos y en las que lo servimos, y al programa NVIDIA Inception, al programa de startups Z.ai y al programa de startups StepFun por su apoyo.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.