Casa Blog

Apresentando o Aplomb 1

Apresentando o Aplomb 1, um modelo de decisão para texto, JSON, imagens, vídeo e áudio

Oct 5, 2026

EmpirioLabs AI

Aplomb 1 é nosso primeiro modelo. Ele pega texto, JSON, imagens, áudio e vídeo em uma única solicitação, lê até 1M de tokens e toma uma decisão sobre um documento de 1M de token em cerca de 3 segundos. Uma pergunta curta leva cerca de 15 ms de tempo de modelo.

Ele roda em um runtime de inferência que construímos para modelos de decisão. Na nossa API e no Playground, documentos longos passam pelo modo rápido de longo contexto: um documento com 1M de token leva cerca de 3 segundos em vez de 111, e o modo rápido respondeu corretamente todas as 525 decisões em nossos testes de longo contexto.

Para agentes, o Aplomb 1 retorna uma probabilidade para cada ferramenta e para cada argumento enum e booleano em uma única solicitação, então um agente age quando o modelo está certo e escala quando não está. Toda resposta é calibrada, e pode indicar quando a entrada não contém a resposta em vez de adivinhar. Ela foi feita para as decisões que o software toma milhares de vezes por dia, desde o roteamento de um ticket até a escolha da próxima ferramenta do agente.

Em 6 de outubro de 2026, está em #1 entre os modelos 4B no quadro publicado do Decision Index, com 44,86 em nossa edição oficial do kit, e #1 entre modelos até 5,3B parâmetros em 8 dos 38 benchmarks. Está disponível hoje na API EmpirioLabs e na Playground, e seus pesos estão no Hugging Face sob a Licença de Modelo EmpirioLabs.

Desenvoltura 1 em um olhar
EntradasTexto, JSON, imagens, vídeo e áudio, em qualquer mistura
Janela1.000.000 de tokens de estado mais pergunta
PerguntasSim ou não, escolha (2 a 255 opções), pontuação (2 a 10 níveis), seleção de ferramentas
Não no estadoUma probabilidade de que a entrada não contenha a resposta
Seleção de ferramentasA próxima ferramenta a chamar, com probabilidades para seus argumentos enum e booleanos
VelocidadeCerca de 15 ms de tempo de modelo para uma pergunta curta; cerca de 3 segundos para um documento de 1M de token em modo rápido de longo contexto
Formatos de APIA API Decisions, além dos formatos OpenAI, Anthropic e Gemini
FaturamentoApenas tokens de entrada; tokens de saída são sempre zero
Retenção de dadosRetenção zero de dados por padrão
Tamanho5,3 bilhões de parâmetros, construídos em Qwen3.5-4B; pesos abertos no Hugging Face
Índice de Decisão 0.2.144,86 na nossa edição do kit oficial, #1 entre os modelos 4B no quadro publicado em 6 de outubro de 2026

O que ela responde

Quatro tipos de perguntas. Noul Responde sim ou não, com a probabilidade de sim. Escolha Escolhe uma entre 2 a 255 opções e retorna a distribuição completa. Pontuação coloca o estado em uma escala ordenada de 2 a 10 níveis. ferramenta escolhe qual das suas ferramentas de função chamar e retorna distribuições sobre seus argumentos enum e booleano.

Não no estado. Adicionar "abstenção": verdade para uma pergunta e a resposta também carrega a probabilidade de que o estado não contenha o que a pergunta precisa. Um registro sem campo portador recebe alta probabilidade de abstenção em vez de um palpite confiante.

Respostas independentes. Até 128 perguntas compartilham um estado, e cada uma é respondida separadamente, então adicionar uma pergunta nunca muda outra resposta.

Seleção de ferramentas para agentes

Dê ao Aplomb 1 as ferramentas de função do seu agente e o estado atual (um ticket, uma conversa, um registro), e ele retorna a ferramenta para chamar em seguida com uma probabilidade para cada ferramenta e uma distribuição para cada argumento enum e booleano, em uma única solicitação. Um LLM geral escreve uma ferramenta que chama token por token e não diz o quão certo está sobre a ferramenta ou qualquer argumento. O agente age quando a probabilidade é alta e passa o passo para um modelo maior quando não está, então passos rotineiros pulam uma resposta gerada. Não encontramos outro modelo de decisão que retorne probabilidades de argumentos.

Um ticket que diz "Pedido B-44120 chegou com a tela rachada. Quero meu dinheiro de volta." com três ferramentas, issue_refund (a Motivo enum e a full_refund booleano), track_package e escalate_to_human, retorna como (abreviado, arredondado):

{"ferramenta": "issue_refund", "probabilidades": {"issue_refund": 0,969, "nenhuma": 0,025, "escalate_to_human": 0,005, "track_package": 0,002}, "argumentos": {"issue_refund": { "razão": {"valor": "danificado", "probabilidades": {"danificado": 0,993, "not_as_described": 0,007, "tardio": 0,001}}, "full_refund": {"valor": verdadeiro, "probability_true": 0,761}}}, "open_arguments": {"track_package": ["order_id"]}}

Argumentos em texto livre, como um id de ordem, são listados sob open_arguments para o agente preencher.

Entradas mistas, até 1M de tokens

Texto, objetos JSON e arrays, imagens, vídeo e áudio entram no mesmo estado, em qualquer combinação: uma gravação de chamada de suporte ao lado do registro da conta, um clipe de dashcam ao lado do formulário de reclamação, uma foto do produto ao lado do anúncio. O estado mais a pergunta mais longa pode chegar a 1.000.000 de tokens, o suficiente para um pacote contratual longo, um ano de tickets ou horas de transcrições em uma única solicitação.

Como ela pontua

Rodamos modelos de decisão abertos 4B Aplomb 1 e três nos mesmos itens, e definimos os números publicados pelo Intern-Decision para Jev, JevK5 e Semif ao lado deles. Nos relatórios de sete suítes Intern-Decision, Aplomb 1 tem média de 88,7%. Contra a linha publicada por Jev, está à frente no JevBench Hard e decisões digitadas, empatado no JevBench Easy, e atrás no JevBench Original, ToolACE, AG News e WildJailbreak. Sua maior vantagem é no JevBench Hard, +5,4 pontos.

Accuracy of Aplomb 1 and other decision models on eleven benchmarks
Figura 1. Precisão em benchmarks de decisão. Marcadores sólidos são nossas execuções nos mesmos itens com intervalos bootstrap de 95%; marcadores ocos são números publicados pela decisão do Interno.
ReferênciaDesenvoltura 1Jev (p)JevK5 (p)Semif (p)Decisão de Estagiário 4BKev 4BOmniJev 4B
JevBench Easy100.0100.0100.0100.0100.0100.087.5
JevBench Original95.898.697.298.6100.093.172.2
JevBench Difícil77.572.173.961.371.254.152.3
Decisões tipadas74.073.364.562.880.867.061.3
ToolACE89.491.381.085.296.587.488.1
AG News88.889.689.189.290.889.789.6
Fuga Selvagem95.696.390.592.590.293.592.3
Média88.788.785.284.289.983.577.6

(p) Conforme publicado pela Intern-Decision para os mesmos itens. A Intern-Decision reporta 90,02 para seu modelo 4B neste pacote; a coluna mostra nossa sequência.

ReferênciaDesenvoltura 1Decisão de Estagiário 4BKev 4BOmniJev 4B
Piloto de calibração70.858.369.853.1
ANLI R354.054.250.8n/a
Banking77 (77 opções)74.6n/a84.068.4
CLINC150 (150 opções)87.0n/a77.866.8

Entradas longas

Medimos as buscas em livros-razão de ordem de 16K a 1M tokens, com as perguntas sobre uma ordem colocadas em profundidade aleatória.

Aplomb 1 accuracy from 16K to 1M tokens
Figura 2. Precisão conforme a entrada cresce, medida em livros-razão de ordem do comprimento declarado.
Comprimento de entrada (tokens)16K128K240K512K1M
Desenvoltura 1100.0100.0100.0100.096.8

Documentos longos em segundos

Na API EmpirioLabs e no Playground, um estado com mais de 131.072 tokens é lido no modo rápido de longo contexto por padrão. Um documento de 1M de token leva cerca de 3 segundos em vez de cerca de 111 segundos de leitura na íntegra, e em nossos conjuntos de teste de longo contexto o modo rápido respondeu corretamente todas as 525 decisões, contra 95,2% para uma leitura completa.

Decisions correct by document length for fast mode and a full read
Figura 8. Decisões corrigidas pelo comprimento do documento em nossos conjuntos de teste de contexto longo (164 documentos de 131K a 1M tokens, 525 decisões), modo rápido e leitura completa.
Seconds per decision by document length for fast mode and a full read
Figura 9. Tempo mediano do servidor por requisição pela API por comprimento do documento, modo rápido e leitura completa.
Comprimento do documento (tokens)228K513K797K979K
Modo rápido1,9 s2.4 s2,8 s3.0 s
Leitura completa8,8 s34 s76 s111 s

Enviar "long_context": "cheio" para ler cada token. Uma leitura completa é a melhor escolha quando uma resposta depende de todo o documento, como uma contagem, o tom geral ou confirmar que algo nunca aparece: em 24 documentos criados para testar essas perguntas, o modo rápido acertou em 50% das decisões e a leitura completa em 61%. As respostas long_context o campo indica qual modo foi usado, e o uso conta todo o estado em ambos os modos. O modo rápido de contexto longo está disponível apenas na API EmpirioLabs e no Playground; os pesos abertos leem todos os tokens.

Calibração

Uma probabilidade só é útil se ela quiser dizer o que diz. Em nove suítes de texto, a confiança declarada do Aplomb 1 acompanha com que frequência está correta: seu erro de calibração agrupado é 3,6, contra 5,0 para o Intern-Decision 4B e 4,0 para Kev 4B (menor melhor).

Reliability diagrams for Aplomb 1 and two open decision models
Figura 3. Confiança declarada em relação à precisão observada, agrupada em nove suítes de texto.

Imagens, vídeo e áudio

Benchmark (primeiros 500 itens)Desenvoltura 1Decisão de Estagiário 4BOmniJev 4B
PAPA89.089.288.4
MMStar68.665.264.4
AI2D87.081.083.4
MMMU57.257.056.0
HallusionBench79.879.471.2
Aplomb 1 and OmniJev accuracy on three video benchmarks
Figura 4. Decisões sobre vídeo. Decisão de estagiário, Kev e Jev não aceitam vídeo.
ReferênciaDesenvoltura 1OmniJev 4B
TempCompass79.373.6
Video-MME (curta)80.772.2
NExT-QA82.679.8

Nós mesmos adicionamos o áudio ao Aplomb 1; nenhum dos outros modelos de decisão acima o aceita. Ele reconhece sons vocais, emoção na fala e sons do dia a dia, e responde perguntas sobre o que é dito:

ReferênciaDesenvoltura 1
VocalSound (sons vocais)91.9
CREMA-D (emoção na fala)78.7
ESC-50 (sons ambientais)77.0
MMAU (perguntas de áudio)68.3
MMSU (língua falada)63.2

Os resultados de áudio foram atualizados em 6 de outubro de 2026, com novos pesos de áudio para o Aplomb 1; os resultados de texto, imagem e vídeo permaneceram inalterados.

51 idiomas

Aplomb 1 decide sobre texto em muitos idiomas, não apenas em inglês. No MASSIVE, cada pedido para um assistente de voz é escrito em um dos 51 idiomas, enquanto a pergunta e os 59 rótulos de intenção permanecem em inglês. Sem qualquer treinamento em MASSIVE, o Aplomb 1 tem uma média de 75,0% nos 51 idiomas ao escolher entre todos os 59 intents, 91,0% em inglês e 70% ou mais em 39 deles.

Aplomb 1 intent accuracy in each of 51 languages
Figura 5. Precisão de intenção MASSIVA zero-shot, 100 solicitações de teste por linguagem, uma escolha entre 59 intenções.

Para referência, o projeto Laya relata 40,1% de seu modelo multilíngue nos mesmos 51 idiomas ao escolher entre 20 intenções, e o projeto JevK5 relata 73,8% em inglês com todas as 60 intenções.

Índice de Decisão

O Índice de Decisão 0.2.1 tem uma média de 38 referências públicas em cinco áreas: conhecimento e raciocínio, entendimento de linguagem, recuperação e classificação, ferramentas e automação, e artes e gosto humano. Cada referência é corrigida por acaso, então 0 significa chute aleatório e 100 significa perfeito.

Rodamos o kit oficial no Aplomb 1 em 5 de outubro de 2026, e ele atendeu a todos os 150.317 pedidos de pontuação. Aplomb 1 pontua 44,86. Esta é nossa própria edição do kit, não uma entrada no quadro publicado.

Bar chart of Decision Index 0.2.1 scores: Aplomb 1 44.86 on our run of the official kit, ahead of every 4B model on the published board; next are JPT-4B at 43.04 and Jet v6.2 at 42.60.
Figura 6. Índice de Decisão 0.2.1 pontuações do Aplomb 1 e dos modelos 4B no quadro publicado. A barra ciano é Aplomb 1, nossa sequência do kit oficial. Barras cinza são entradas no quadro publicado, dados de 28 de setembro de 2026.

Em 6 de outubro de 2026, o Aplomb 1 está em #1 entre os modelos 4B no quadro publicado, e #1 entre os modelos até 5,3 bilhões de parâmetros em 8 dos 38 benchmarks, incluindo MMLU-Pro, GPQA Diamond e BBH. No painel publicado (dados de 28 de setembro de 2026), a maior pontuação para um modelo 4B é 43,04 do JPT-4B, 1,82 abaixo do Aplomb 1.

The 8 Decision Index benchmarks where Aplomb 1 has the top score among models up to 5.3B on the published board: BBH, MMLU-Pro, GPQA Diamond, NLI4CT, PhishNChips, HoVer, Humicroedit and POP909
Os 8 benchmarks onde o Aplomb 1 tem a maior pontuação entre modelos até 5,3 bilhões no quadro publicado, desde ciência e raciocínio até ensaios clínicos, checagem de fatos, phishing, música e humor.
Area scores for Aplomb 1 and JPT-4B across knowledge and reasoning, language understanding, retrieval and classification, tools and automation, and arts and human taste.
Figura 7. Pontuações de área, corrigidas por acaso de 0 a 100, para Aplomb 1 e JPT-4B, o melhor modelo 4B no quadro publicado.

Por área, o Aplomb 1 obtém a maior pontuação em ferramentas e automação (62,4) e recuperação e classificação (49,5). Comparado ao JPT-4B, está à frente em quatro das cinco áreas e atrás na compreensão de idiomas (48,3 contra 52,5).

Divulgação. Os dados de treinamento do Aplomb 1 incluíam as divisões públicas de trem de WinoGrande e ContractNLI, dois dos 38 benchmarks do índice. Não pudemos verificar totalmente que os itens do índice foram excluídos dos dados de treinamento mais antigos.

Como se compara

O que cada modelo de decisão ou API aceita e responde, a partir de sua própria documentação publicada em 29 de setembro de 2026, com preços em 6 de outubro de 2026:

Aplomb 1 compared with Jev 1.13, the OpenAI Decisions API preview, Intern-Decision 4B and Laya on question types, tool calls with argument probabilities, the not-in-the-input answer, inputs, context window, 1M-token speed, API formats, price per 1M input tokens and open weights
Como o Aplomb 1 se compara, a partir da documentação publicada de cada modelo até 29 de setembro de 2026, com os preços de 6 de outubro de 2026.
Desenvoltura 1Jev 1.13API OpenAI Decisions (prévia)Decisão de Estagiário 4BLaya
Tipos de perguntasSim ou não, escolha, pontuação, ferramentaSim ou não, escolha, pontuaçãoEscolha entre as respostas listadasSim ou não, escolha, pontuaçãoSim ou não, escolha, pontuação
Seleção de ferramentas com probabilidades de argumentoSimNãoNão documentadoNãoNão
Não na resposta do estadoSimNãoNão documentadoNãoNão
EntradasTexto, JSON, imagens, vídeo, áudioTextoTexto, imagensTexto, imagensTexto
Janela1.000.000 de fichas64K tokensNão publicado8.192 fichas512 a 8.192 fichas
Preço por 1M de tokens de entrada$0.02$0.042Não anunciadoAutohospedado$0.02 no Runware
Pesos abertosSimNãoNãoSimSim

Velocidade e faturamento

O Aplomb 1 roda com o próprio tempo de execução de inferência da EmpirioLabs para modelos de decisão. Uma pergunta curta leva cerca de 15 ms de tempo de modelo, uma pergunta com uma imagem de cerca de 35 ms, um documento de 15.000 tokens cerca de 0,3 segundos, e um estado de 1M-token cerca de 3 segundos em modo rápido de longo contexto, com o padrão acima de 131.072 tokens, ou cerca de 111 segundos lidos na íntegra.

Você paga apenas pelos tokens de entrada: o estado uma vez por requisição e o texto de cada pergunta, nunca um modelo de prompt. Tokens de saída são sempre zero. A taxa atual está no página do modelo e o página de preços.

Zero retenção de dados está ativada por padrão: não retemos o conteúdo das suas solicitações ou respostas.

Pesos abertos

O Aplomb 1 é construído sobre o Qwen3.5-4B. Estendemos sua janela de 262K para 1M de tokens, adicionamos entrada de áudio com o codificador de áudio do Qwen3-Omni, adicionamos nossa própria cabeça de decisão, que retorna todas as respostas como probabilidades calibradas em vez de texto gerado, e treinamos o modelo para decisões, incluindo seleção de ferramentas e a resposta not-in-the-input. Para a API e o Playground, construímos e otimizamos nosso próprio runtime de inferência.

Os pesos e um script de referência para executá-los você mesmo estão em huggingface.co/empiriolabsai/desenvoltura-1. As respostas do script podem diferir um pouco das da API.

Pesquisa, avaliação, uso pessoal e uso interno por organizações com receita anual inferior a US$1 milhões são gratuitas sob a Licença Modelo EmpirioLabs; hospedar o Aplomb 1 como serviço ou enviá-lo em um produto vendido para terceiros exige uma licença comercial.

Começar

curl https://api.empiriolabs.ai/v1/decisions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -h "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "aplomb-1", "estado": {"pedido": {"id": "B-44120", "status": "enviado", "pagamento": "não pago"}}, "perguntas": { "pago": {"tipo": "noul", "instruções": "A ordem B-44120 foi paga?", "abstenha": verdadeiro}, "transportadora": {"tipo": "escolha", "instruções": "Qual transportadora está entregando a ordem B-44120?", "critérios": {"UPS": nulo, "FedEx": nulo, "FedEx": nulo, "DHL": nulo}, "abstenhamo": verdadeiro} } }'

Pago Retorna como um não confiante. Operadora volta com um efeito alto abstenha-se probabilidade, porque o registro não nomeia uma portadora. O esquema completo, entrada de mídia e limites estão no Guia da API de decisões. O Aplomb 1 também aceita solicitações nos formatos OpenAI, Anthropic e Gemini, então você pode chamá-las a partir dos SDKs deles; os do guia Formatos de chat A seção mostra como um pedido de chat se mapeia para uma decisão. Tente sem código no Área de reprodução.

Agradecimentos

Construímos o Aplomb 1 com a ajuda do nosso harness de agentes de IA em dados, treinamento, avaliação e implantação. Graças à equipe Qwen pelo Qwen3.5 e Qwen3-Omni, sobre os quais o Aplomb 1 se baseia, ao Lambda pelas GPUs que treinamos e nos quais o atendemos, e ao programa NVIDIA Inception, ao programa de startup Z.ai e ao programa de startups StepFun pelo suporte.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.