簡単に言うと: StepAudio 3 ASR Max はStepFun最大の音声認識モデルであり、標準的な文字起こしエンドポイントを通じてEmpirioLabs利用可能です。音声ファイルを投稿してください ポスト/v1/audio/transcriptions お問い合わせ モデル:「stepaudio-3-asr-max」 そして文字起こしが返ってきます。話し言葉を自動で検出するので、選ぶ言語はありません。
あなたの最初のお願い
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H 「認証:ベアラー $EMPIRIOLABS_API_KEY」 \ -f 「model=stepaudio-3-asr-max」 \ -F 「file=@meeting.mp3」
また、JSONを file_url 公開可能なファイルやbase64の音声を指す audio_base64お問い合わせ.
この車の目的
これはStepFun認識ファミリーの精度層です。大規模な言語モデルに基づいているため、通常の文字起こしで誤りが生じる部分を音だけでなく文脈を用いて解決します。
- 人名や地名、薬名、専門用語、同音異義語
- 法律、金融、医療、自動車、ソフトウェアなどの専門用語集
- アクセントのある話し方、ささやき声、非常に速い話し方、そして混合言語の文
- バックグラウンドミュージックの上で歌唱とスピーチ
もし普通のきれいな話を大音量で書き起こしているなら、 ステップオーディオ 2.5 ASR は同じファミリーの中でより安価な選択肢であり、このエンドポイントを共有しています。
入力フォーマット
お問い合わせ WAV, mp3, OGG, M4A、または PCM.生のPCMニーズ コーデック, 料金, ビット、および チャンネル それと並行して、コンテナフォーマット自体がその情報を載せています。
番号のフォーマット
逆テキスト正規化はデフォルトでオンになっているので、話し言葉の数字、日付、通貨は人がタイプするような書き方で返ってきます。この機能を解除してください。 enable_itn:誤り 文字通りの言葉を聞きたい。
enable_itn | 書き起こし |
|---|---|
確かに (デフォルト) | 昨年は全地域で収益が12%増加しました。 |
偽り | 昨年、全地域で収益は12%増加しました。 |
人を悩ませる三つの要素
- 言語設定はありません。 ASR Maxは言語自体を識別し、その言語で文字起こしを行います。日本語音声は通過したものの日本語で返送されるため、このモデルの上に言語選択器を組み込まないでください。中国語、英語、日本語、韓国語、フランス語、スペイン語が認識されており、中国語と英語以外の言語はプレビューで対応可能です。
- ホットワードやワードのタイムスタンプはここでは利用できません。 どちらもStepAudio 2.5 ASRに存在します。カスタム語彙リストや単語ごとのタイミングが必要なら、そのモデルを使えばいいです。
- 長いファイルは受け入れられ、実際の長さで請求されます。 充電は送信する音声の測定された持続時間に沿って行われ、最低でも1秒なので、録音の前後の無音をカットする価値はあります。
料金について
請求は音声時間単位で、使用量だけ支払われ、サブスクリプションや最低契約はありません。ライブ料金は モデルページ そして、 プライシングページお問い合わせ.
コードを書かずに試してみてください
ファイルを に落とす playgroundのStepAudio 3 ASR Max そして、その書き起こしをすぐに読み返してください。完全なパラメータ参照: docs.empiriolabs.ai/models/stepaudio-3-asr-maxお問い合わせ.



