StepAudio 2.5 Realtime API

スピーチイン、アウト、一つのソケットで、語調やペースをパラランゲージス的に理解する。

StepFunオーディオ生成256K コンテキストリリース 2026年7月16日International独自エンドポイント新着

StepAudio 2.5 Realtime について

スピーチイン、アウト、一つのソケットで、語調やペースをパラランゲージス的に理解する。

セッションはリクエストパラメータではなく、ソケット上でsession.updateイベントで設定されます。

別名 StepAudio Realtime, StepFun StepAudio 2.5 Realtime

realtimespeech to speechaudio inaudio outvoice control

StepAudio 2.5 Realtime の仕様

モデルID
stepaudio-2-5-realtime
開発元
StepFun
カテゴリ
オーディオ生成
リリース
2026年7月16日
コンテキスト長
256K トークン
最大出力
131,072 トークン
入力
音声テキスト
出力
音声テキスト
リージョン
International
エンドポイント
WEBSOCKET/v1/realtime
代替モデルID
stepaudio-2.5-realtimestepfun/stepaudio-2-5-realtime

StepAudio 2.5 Realtime API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
入力
1Mプロンプトトークンあたり
$1.50
ソリューション
生成された1Mトークンあたり
$10.00
暗黙のキャッシュ読み取り
1Mのキャッシュ入力トークンごとに
$0.30
料金ページ全体で比較

StepAudio 2.5 Realtime API の呼び出し方

StepAudio 2.5 Realtime は HTTP エンドポイントではなく、wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime の WebSocket 上でライブ会話を行います。モデル ID stepaudio-2-5-realtime で接続し、ハンドシェイク時に EmpirioLabs の API キーを Authorization: Bearer ヘッダーとして送信してください。音声は base64 の 16 ビット PCM として双方向に流れます。 ブラウザは WebSocket にヘッダーを設定できないため、この接続はサーバーから開き、音声は自前のソケットでブラウザへ中継してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
StepAudio 2.5 Realtime API の完全リファレンス

StepAudio 2.5 Realtime API のパラメーター

EmpirioLabs 上の StepAudio 2.5 Realtime API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
voiceenumsoft-spoken-gentlemansoft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l...セッションボイスは、モデルが音声を生成する前にsession.updateで設定されます。モデルが話し終えた後は変更できず、他の値は拒否されます。
instructionsstring--セッションのシステム指示:キャラクター、話し方、境界線。
modalitiesstring["text","audio"]-セッションの反応方法。
volume_rationumber10.1 から 2音声返信の音量はデフォルトに対して大きくなります。受け入れ範囲は0.1から2.0です。
input_audio_formatenumpcm16pcm16送信する音声のエンコード。16ビットPCM。
output_audio_formatenumpcm16pcm16モデルが返す音声のエンコーディング。16ビットPCM。
turn_detectionstring{"type":"server_vad"}-サーバー側の音声活動検出。話すのをやめたタイミングを判断し、モデルが返信すべきです。これがなければモデルは聞くだけで返答はしないので、input_audio_buffer.commitとresponse.createで自分でターンしない限りオンにしておくと良いです。

知っておくと便利

wss@api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime のWebSocketを経由した全二重音声で、通常のAuthorization Bearerヘッダーで認証されています。音声はpcm16の入出力です。モデルは話しながら聞くため、返信の途中で中断され、サーバー側の音声活動検出が応答のタイミングを決定します。voiceはsession.updateで最初の音声の前に設定します。モデルが話した後は変更できず、7つの表示された音声のみが受け入れられます。会話は中国語と英語のみです。各ターンはモデルが報告した使用量から個別に請求されます。

StepAudio 2.5 Realtime API: よくある質問

StepAudio 2.5 Realtime API の料金はいくらですか?

EmpirioLabs では StepAudio 2.5 Realtime は従量課金です: 入力 $1.50 1Mプロンプトトークンあたり; ソリューション $10.00 生成された1Mトークンあたり; 暗黙のキャッシュ読み取り $0.30 1Mのキャッシュ入力トークンごとに。このページのライブ料金表は常に API の請求額と一致します。

StepAudio 2.5 Realtime のコンテキストウィンドウはどれくらいですか?

StepAudio 2.5 Realtime は 256K トークンのコンテキストウィンドウに対応しています(1回の応答あたり最大 131,072 出力トークン)。

StepAudio 2.5 Realtime はどのエンドポイントを使いますか?

StepAudio 2.5 Realtime は api.empiriolabs.ai 上の WEBSOCKET /v1/realtime で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで StepAudio 2.5 Realtime を試せますか?

EmpirioLabs プレイグラウンド を開き、Start session を押すとブラウザーで試せます。StepAudio 2.5 Realtime はリクエストとレスポンスではなく WebSocket 上で動作するため、組み込むときは リアルタイム音声クイックスタート から始めてください。EmpirioLabs の API キーとモデル ID stepaudio-2-5-realtime を使ってサーバーから接続し、音声を双方向にストリーミングします。

StepAudio 2.5 Realtime の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。