L’aperçu de l’étape 5 est le modèle de raisonnement frontière de StepFun. Il accepte les entrées de texte, d’images et de vidéos, les réponses en texte, et propose un contexte de 1 024 000 jetons. Il supporte l’appel parallèle de fonctions, une sortie structurée strictement JSON Scheme, la mise en cache automatique des invites et un contrôle de l’effort de raisonnement avec trois niveaux.
Il est disponible sur EmpirioLabs aujourd’hui via une API compatible OpenAI, avec du streaming et jusqu’à 131 072 jetons de sortie. Essayez-le dans le aire de jeux ou appelez-le d'un client compatible OpenAI. L'ensemble de la spec et les taux actuels vivent sur le Page d’aperçu du modèle étape 5 et les Docs API.
Je l’appelle
Pointez tout client compatible OpenAI à https://api.empiriolabs.ai/v1 et utilisation step-5-preview comme l’identifiant du modèle.
curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « step-5-preview », « messages »: [{"rôle »: « utilisateur », « contenu »: « Planifiez une migration en trois étapes depuis un monolithe."}], « reasoning_effort »: « high », « max_tokens »: 2000 }'
Le même modèle répond sur l’API Responses, le format Anthropic Messages et la route compatible Gemini, donc la plupart des clients existants fonctionnent sans réécriture. Le Page docs Liste tous les points de terminaison pris en charge.
Travailler avec des images et des vidéos
Attachez une image à un standard image_url partie de contenu, ou un extrait avec un video_url partie. Les deux acceptent une URL ou une URL de données. Gardez la vidéo sous 128 Mo, et les clips sous environ cinq minutes pour obtenir des résultats les plus fiables.
Trois choses à savoir avant votre premier appel
- Le raisonnement revient
raisonnement contenu, et il facture comme sortie. Ces jetons sont inclus danscompletion_tokens, maiscompletion_tokens_details.reasoning_tokensRapports zéro, donc lisezcompletion_tokensplutôt que de sous-compter le raisonnement quand on attribue les dépenses. - Pose un vrai
max_tokens. Le raisonnement est dépensé avec le même budget que la réponse, donc un petit budget peut renvoyer un message vide sur une consigne difficile. Laissez-lui de l’espace. - La mise en cache est automatique, et on peut le voir. Envoyez un préfixe partagé long et la demande suivante signale le résultat
prompt_tokens_details.cached_tokens, facturé au taux de lecture cache sur la page du modèle. Gardez la partie stable de votre invite en début pour en bénéficier.
Une note sur raisonnement effort: Low, Médium, et haut sont les niveaux supportés. Les autres valeurs sont acceptées par la requête puis ignorées, donc envoyez l’une des trois au lieu de vous fier à une chaîne personnalisée.
Combien cela coûte
L’étape 5 Aperçu consiste à payer à l’usage, facturé par jeton avec un tarif réduit séparé pour l’entrée mise en cache et sans abonnement. Les tarifs actuels sont sur le page modèle et les page de prix.



