Casa Blog

Como usar a API de Prévia do Passo 5

Como usar a API de Prévia do Passo 5

Sep 20, 2026

EmpirioLabs AI

O Step 5 Preview é o modelo de raciocínio fronteiriço do StepFun. Aceita entrada de texto, imagem e vídeo, respostas em texto e carrega um contexto de 1.024.000 tokens. Suporta chamadas paralelas de funções, saída estruturada estrita em esquema JSON, cache automático de prompts e controle de esforço de raciocínio com três níveis.

Está disponível no EmpirioLabs hoje por meio de uma API compatível com OpenAI, com streaming e até 131.072 tokens de saída. Experimente no playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página de prévia do modelo do Passo 5 e o Documentos de API.

Encerrando

Aponte qualquer cliente compatível com OpenAI em https://api.empiriolabs.ai/v1 e uso step-5-preview como o ID do modelo.

curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "step-5-preview", "mensagens": [{"função": "usuário", "conteúdo": "Planeje uma migração em três etapas a partir de um monólito."}], "reasoning_effort": "alto", "max_tokens": 2000 }'

O mesmo modelo responde na API Responses, no formato Anthropic Messages e na rota compatível com Gemini, então a maioria dos clientes existentes funciona sem reescrita. O Página de documentos Lista todos os endpoints suportados.

Trabalhando com imagens e vídeo

Anexe uma imagem com um padrão image_url parte de conteúdo, ou um clipe com um video_url parte. Ambos aceitam uma URL ou uma URL de dados. Mantenha o vídeo abaixo de 128 MB e os clipes abaixo de cerca de cinco minutos para os resultados mais confiáveis.

Três coisas que valem a pena saber antes da sua primeira ligação

  1. A justificativa volta raciocinar conteúdo, e ele fatura como saída. Esses tokens estão incluídos em completion_tokens, mas completion_tokens_details.reasoning_tokens Relata zero, então leia completion_tokens Em vez da subcontagem de raciocínio quando você está atribuindo gastos.
  2. Coloque um real max_tokens. O raciocínio é gasto com o mesmo orçamento da resposta, então um orçamento pequeno pode devolver uma mensagem vazia em um prompt difícil. Dê espaço para ela.
  3. O cache é automático, e você pode ver. Envie um prefixo compartilhado longo e a próxima solicitação reporta o acerto prompt_tokens_details.cached_tokens, cobrado na taxa de leitura em cache na página do modelo. Mantenha a parte estável do seu prompt no início para se beneficiar.

Uma observação sobre raciocinação esforço: baixo, Médio, e alto são os níveis suportados. Outros valores são aceitos pela solicitação e depois ignorados, então envie um dos três em vez de depender de uma string personalizada.

O que custa

Passo 5 Pré-visualização é pagar conforme você usa, cobrado por token com uma tarifa separada com desconto para entrada em cache e sem assinatura. As tarifas atuais estão no página do modelo e o página de preços.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.