EmpirioLabsの文字起こしモデルは音声(場合によってはビデオ)をテキストに変換し、モデルに応じて単語のタイムスタンプ、言語検出、翻訳などの機能を備えています。ファイルやURLを指し示し、音声の分単位で料金を請求したトランスクリプトを読み返します。
Whisper Large v3 Turbo は POST /v1/audio/transcriptions で動作します。リクエストはすぐに job_id を返すので、ジョブが完了するまで GET /v1/jobs/{job_id} をポーリングし、結果から出力 URL を読み取ってください。 model ID は上のどのモデルにも差し替えられます。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-large-v3-turbo",
"audio_url": "https://example.com/meeting-recording.mp3"
}'EmpirioLabs には 4 転写モデル APIがあります(Whisper Large v3 Turbo, Deepgram Nova 3, OpenAI Whisper 1 など)。各モデルにはライブ料金、パラメーター、クイックスタートを備えた専用 API ページがあります。
すべての転写モデルは従量課金で、月額最低料金はありません。正確な料金表は各モデルのページにあり、常に API の請求額と一致します。
いいえ。ここにあるすべてのモデルはEmpirioLabs プレイグラウンドで動きます。コードを書かずにオプションを設定して結果を確認できる、使いやすいブラウザ内インターフェースです。自動化したくなったら、同じモデルを API から利用できます。