
テキスト・ツー・ビデオと image-to-video を同期ネイティブ・オーディオ、720p または 1080p で 3 から 15 秒、アスペクト比とプロンプト・コントロールで合成しました。
使った分だけ支払ってください。サブスクリプションのロックインはありません。
価格カタログ
EmpirioLabsの料金はモデルや単位によって異なり、トークン、画像、音声または動画の秒数、メッセージ、3Dアセット、検索リクエストなどが含まれます。インタラクティブな価格表は現在のカタログを読み込みますが、これらの代表的なレートはクライアントJavaScriptなしでも読みやすいままです。
画像入力$0.051枚あたり。480pで毎秒$0.096、720pで毎秒$0.168回の映像出力が始まります。
コスト効率の高い長コンテキストマルチモーダルAPIに対して、入力は100万プロンプトトークンあたり$0.40から始まります。
マルチモーダル推論、コーディング、エージェントワークロードに対して、入力は100万プロンプトトークンあたり$0.30から始まります。
画像から3Dへの生成は生成された3Dアセットごとに料金が設定され、フォーマットや解像度の管理に関するドキュメントが用意されています。
モデルAPI料金はUSDで表示され、USDで請求されます。対象の場合、チェックアウトで地域の支払い方法が表示されることがあります。

テキスト・ツー・ビデオと image-to-video を同期ネイティブ・オーディオ、720p または 1080p で 3 から 15 秒、アスペクト比とプロンプト・コントロールで合成しました。

1Mトークンコンテクスト、128K出力、調整可能な推論努力、ネイティブWeb検索、ツールコールによるモデルの調整とコーディング。

Kimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

キム・ク2.7 コードは、256Kコンテキスト、常にオン推論、テキスト、画像、ビデオ入力のムーンショットのトリリオンパラメータのエージェントのコーディングモデルです。
キム・ク2.7 コードは、256Kコンテキスト、常にオン推論、テキスト、画像、ビデオ入力のムーンショットのトリリオンパラメータのエージェントのコーディングモデルです。

100万トークンのコンテキスト、画像と動画の理解、引用源を含む組み込みウェブ検索、ツール呼び出しを備えたMeta Frontier推論モデルです。

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

テキスト、画像、ビデオ、コーディング、ツール使用、GUI理解、および1Mコンテキストワークフローの費用対効果の高いQwen3.7 Vision-languageモデル。
テキスト、画像、ビデオ、コーディング、ツール使用、GUI理解、および1Mコンテキストワークフローの費用対効果の高いQwen3.7 Vision-languageモデル。

キム・ク2.7 Code Highspeed は、Moonshot のエージェントコーディングモデルのより高速なサービスで、256K のコンテキスト、常にオンの推論、および画像とビデオの入力によります。

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.
Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.
MiniMax M3は、テキスト、画像、ビデオ入力でコーディング、エージェント、および長文解析用のマルチモーダル推論モデルです。
MiniMax M3は、テキスト、画像、ビデオ入力でコーディング、エージェント、および長文解析用のマルチモーダル推論モデルです。

キューン3.7 Max は、コーディング、生産性、ロングランニングのエージェント、ディープ思考、ツール、および 1M トークンのコンテキストのための主観的なテキストモデルです。
キューン3.7 Max は、コーディング、生産性、ロングランニングのエージェント、ディープ思考、ツール、および 1M トークンのコンテキストのための主観的なテキストモデルです。
text-to-song および lyric-guided オーディオ用のオープンソースの音楽生成モデル、制御可能な曲反復のための高速な 8 ステップ XL ターボ推論。
Apache ライセンス 4B FLUX.2 text-to-image 、リファレンス画像編集、クリエイティブワークフローサポートによるKleinイメージ生成と編集モデル。
高速度M2.7の変異体は、強力な汎用性能力を備えた強力な汎用性能で高速な推論のために調整しました。
リアルタイム音声モデルで、平易な英語音声指示、100+言語にわたる一つの音声識別、200ms未満のストリーミングtime-to-first-audio。
サブ130ms TTFB 音声合成は、15 カ国語で 271 以上の音声、表現力のある音声、低レイテンシの音声エージェントのリアルタイム SSE ストリーミングに対応しています。
豊富な表現力豊かなプロッディ、15言語の271以上の音声、単語ごとのタイムスタンプによるリアルタイムのSSEストリーミング
202K文脈、128K出力、ツール呼び出し、構造化された出力、キャッシュサポートのモデルを推論するロングコンテキストZhipu AI。
Kimi K2.6は、256Kコンテキスト、強力なコーディング、テキスト、画像、ビデオ入力のムーンショットのマルチモーダル推論モデルです。
MiniMax M2.7は、連動型思考、関数呼び出し、プロンプトキャッシュを備えた汎用的な推論チャットモデルです。
TRELLIS.2 イメージツー-3Dモデルで、リファレンスイメージを解像度、シード、メッシュ、テクスチャ、エクスポートコントロールでテクスチャーされたGLBアセットに変えます。
Qwen3.5 122B-A10B は 256K のコンテキスト、有効な sparse MoE の推論、およびテキスト、イメージおよびビデオ入力が付いている多項目推論モデルです。
Qwen3.5 397B-A17B は、言語、コード、エージェント、GUI タスク、画像、ビデオの理解のための重要なマルチモーショナル推論モデルです。
Qwen3.5 35B-A3Bは、スペール・モエルーティング、ディープな思考、テキスト、画像、ビデオ入力を備えた効率的なネイティブ・ビジョン・ランゲージ・モデルです。
Qwen3.5 27Bは、高速応答、256K文脈、テキスト、画像、ビデオ理解の密なマルチモーダル推論モデルです。
Qwen3.6 27B は 256K の文脈に関する有能なコーディング、STEM の推論、空間ビジョン、OCR、およびテキスト、イメージおよびビデオ理解を改善します。

エージェントのコーディング、数学の推論、空間理解、OCR、テキスト、画像、ビデオ入力の高速Qwen3.6ビジョン言語モデル。
エージェントのコーディング、数学の推論、空間理解、OCR、テキスト、画像、ビデオ入力の高速Qwen3.6ビジョン言語モデル。
ジェムマ 4 26B A4B は、256K コンテキスト、テキスト、画像、ビデオ入力、ツール、構造化された出力を備えた Google のオープンマルチモーダルモデルです。
Qwen3.5 9Bは256K文脈、イメージおよびビデオ入力、機能用具および構造された出力が付いている密集した多項目推論モデルです。

Qwen3.5 4Bは256K文脈、イメージおよびビデオ入力、機能用具および構造された出力が付いている低価格の多項目推論モデルです。
Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

コーディング、推論、ロングコンテキストライティング、一般的なチャット用の無料の軽量GLM-4.7テキストモデル。

推論、コーディング、ロングフォームチャット、一般的な言語タスクのための無料の軽量GLM-4.5テキストモデル。

ネイティブ関数呼び出しで画像、ビデオ、ファイル、およびテキスト理解のための無料のマルチモーダルGLM-4.6Vモデル。

画像生成と編集モデルは、テキストや画像入力から画像を作成および変更し、インペレーション、バーチャルトライオン、スタイル制御を行います。

ビデオ生成モデルは、テキストとオプションの画像プロンプトから最大2分のマルチショットビデオを生成し、品質と一貫性を向上させます。

多言語対応のNova-3モデルを用いた音声テキスト転写と、プロダクションワークロード向けの高度なカスタマイズ設定。

Pairs DeepSeek R1 chain-of-thought は、統一されたデータ制御インターフェイスの背後にあるAnthropic Claudeのクリエイティブとコード生成を推論しています。

LLM は、再帰的理論のパイプライン上に構築された、ラン 4 で正式な理論を証明する専門的です。

オープンソースのMixture-of-Experts LLMは、高性能推論、コーディング、および一般的な言語タスクを長時間のプロンプトで調整しました。

284B合計/13B活動的な変数およびネイティブ1Mのコンテキストが付いている軽量のMoEモデルは、低レイテンシー、費用効果が大きい高通貨の使用のために調整しました。

284B合計/13B活動的な変数およびネイティブ1Mのコンテキストが付いている軽量のMoEモデルは、低レイテンシー、費用効果が大きい高通貨の使用のために調整しました。
284B合計/13B活動的な変数およびネイティブ1Mのコンテキストが付いている軽量のMoEモデルは、低レイテンシー、費用効果が大きい高通貨の使用のために調整しました。
フラッグシップMoE LLMと1.6T合計/ 49Bアクティブパラメータとネイティブ1Mコンテキストで高度な数学、論理的推論、および特殊なコーディング。

フラッグシップMoE LLMと1.6T合計/ 49Bアクティブパラメータとネイティブ1Mコンテキストで高度な数学、論理的推論、および特殊なコーディング。
フラッグシップMoE LLMと1.6T合計/ 49Bアクティブパラメータとネイティブ1Mコンテキストで高度な数学、論理的推論、および特殊なコーディング。

このページの検索、類似ページの取得、クローリング、専用のコード検索などのWeb検索エンジンが、AIエージェントのオープンウェブを横断します。

低レイテンシ text-to-speech は、シングルとマルチスピーカーの音声と制御可能なスタイル、アクセント、およびプロダクションアプリのエクスプレストーンです。

23以上の言語で表現力豊かなマルチスピーカーボイスで、ポッドキャスト、オーディオブック、カスタマーサポートの高品質TSプレビュー。

新しいオーディオタグを備えた高度に制御可能なTSは、正確なスタイル、トーン、ペース、そしてナレーション、アシスタント、ボイスアプリを横断して配信します。

128K コンテキスト、140+ の言語を持つオープン ソースの Vision-language モデル、改善された math/reasoning 、構造化された出力、関数呼び出し。

LLM ベースの text-to-speech で、音声の 3-10 秒からゼロショットボイスクローニング、マルチリワード RL による制御可能な出力。

人間とAIが生成する可能性のあるテキストの部分をフラグするディープラーニングディテクタ、完全に人間、AI、または混合されたコンテンツの分類。

テキスト・ツー・ビデオ、画像・ツー・ビデオ、リファレンス・ツー・ビデオ、ビデオ編集モードをハイ・ファイ、モーション・スムース出力で提供するビデオモデル。

オープンソース text-to-image モデルをマルチモーダル・ミクチャー・オブ・エキスパート・アーキテクチャーに、フォトレアルティスティック・ディテールと強力な多言語テキスト・レンダリング。
8.3B-parameter ネイティブ 720p 出力(1080p まで増量可能)、強力なモーションコヒーレンス、最大 10 秒までのバイリンガル プロンプトの理解。

Janus Pro 7BモデルのAutoregressiveフレームワークは、複数のモジュールの理解とイメージ生成を1つのアーキテクチャで統一します。

テキスト・ツー・ビデオ、画像・ツー・ビデオ、リファレンス・ツー・ビデオ、編集、ネイティブ・サウンド、マルチ・シーン・トランジションによるビデオ・モデル。

標準720pとプロ1080pティアで、参照映像から文字にモーションを転送するKling 3.0モデル。

初期結果が不足しているときにクエリを維持し、標準モードよりもより包括的な回答を返す反復AI検索。

詳細な概要と回答でAIを活用したWeb検索、Deep Searchよりも高速化 OpenAI SimpleQAのベンチマークで#1をランク付け。

コスト効率の高い言語モデルは、競争力のあるレイテンシで一般的な生産ワークロードのための強力な推論とマルチモーダル性能を提供します。

強力な推論、コーディング、STEM のパフォーマンス、ハイブリッド、オンプレミス、および in-VPC の展開をサポートするエンタープライズグレードのモデル。

イメージ解析、プログラミング、数学、多言語タスクの128K文脈を備えた24Bパラメータマルチモーダルモデル、効率的なローカル推論のために調整しました。

ハイブリッドモデルは、指示を統一します。, 理容 (Magistral), と Devstral 家族: 40% 低い完了時間と 3x のスループット対小 3.

オープンソース32B MoEファンデーションモデルは、正確なデュアルタワーリップ同期で1つの推論ステップで同期ビデオとオーディオを生成します。

テキスト、画像、および300K文脈上のビデオのための低コストのマルチモーダルファンデーションモデル(最大〜30分のビデオ)、速度と手頃な価格のために調整しました。

1M文脈上のテキスト、画像、文書、ビデオ用の高速で費用対効果の高いマルチモーダル推論モデル(長いドキュメントと〜90分クリップ)。

超低レイテンシと128Kコンテクストのコストで調整されたテキストのみの基礎モデル。 44%のキャッシュ割引で要約、翻訳、チャットに強い。

家族の中で最も有効なモデル。 マルチモーダル text/image /video は 1M のコンテキストで、 chain-of-thought は、ツールとデータソースを一元化しています。

300Kの文脈上のテキスト、画像、およびビデオの精度、速度、およびコストのバランスをとるマルチモーダルファンデーションモデル(最大〜30分のビデオ)。

Whisper-1 speech-to-text トランスクリプションは、多言語の監視された音声で訓練され、ファイルごとに25 MBのアップロード制限があります。

Claude Opus 4.6 の推論、最大深さ、高められた用具のアクセスおよび広範な源の適用範囲によって動力を与えられる構造等級の研究。

複数のステップ検索、合成、推論、自律検索、読書、複雑なトピック間でソースの評価のための研究モデル。

ソナープロは、エージェントの研究者として:チェーンウェブ検索、フルページをフェッチし、ライブ推論をストリームし、複雑なクエリのための戦略を適応させます。

ドメイン、言語、日付などのフィルタリングによるリアルタイムWeb検索。 LLM 応答ではなく検索結果を返します。ファイルのアップロードはありません。

リアルタイムのWeb接続検索と、生産アプリの up-to-date AI検索統合のための正確な引用とカスタマイズ可能なソース。

引用とより大きい文脈のウィンドウを2倍に並べた検索連動モデル、詳細なニュアンス回答が必要な複雑なクエリで調整しました。

未検閲のオープンソース R1-1776 のモデルを Web 検索、SimpleQA ベンチマークの大手検索エンジンと LLM をアウトパーフォーミングします。

テキスト・ツー・ビデオ、イメージ・ツー・ビデオ、トランジション・モードの映像生成と、細部、流体の動き、リアルなアニメーションを融合。

テキストまたは1-2フレーム画像からビデオを生成し、最大1080p、複数のアスペクト比、5-10秒の持続時間、オプションの同期オーディオを要求します。
高度な複雑な Chinese/English テキストレンダリング、現実的なテクスチャ、マルチ画像の融合による画像生成と編集モデルを統合しました。
ハイブリッドリニアアテンションとスパースモエ、1Mコンテクスト、高速マルチモーダル text/image /ビデオインフェレンスを備えた Vision-languageモデル。
ハイブリッドリニアアテンションとスパースモエ、1Mコンテクスト、高速マルチモーダル text/image /ビデオインフェレンスを備えた Vision-languageモデル。

テキスト、画像、音声、ビデオを扱うコスト効率の高いオムニモーダルモデル、最大3時間のオーディオと90以上の言語で1時間のビデオ。

テキスト、画像、オーディオ、ビデオのフラッグシップオムニモーダルモデル。 3hオーディオ、1hビデオ、90 +入力と30 +出力言語、55音声の木材。
1Mのコンテキストでテキスト、画像、動画を横断し、効率的な深層思考と視覚理解のためのハイブリッドアーキテクチャを備えたマルチモーダルモデル。
1Mのコンテキストでテキスト、画像、動画を横断し、効率的な深層思考と視覚理解のためのハイブリッドアーキテクチャを備えたマルチモーダルモデル。

3.6シリーズ(テキストのみ): より高度なコーディングエージェントの実行、より強力なフロントエンドのスキル、より広いロングテールの知識。

3.5以上の大きなアップグレードを備えた Vision-language モデル: エージェントとフロントエンドのコーディング、マルチモーダル認識、OCR、およびオブジェクトのローカリゼーション。
3.5以上の大きなアップグレードを備えた Vision-language モデル: エージェントとフロントエンドのコーディング、マルチモーダル認識、OCR、およびオブジェクトのローカリゼーション。
256K-context は、推論、指示、および多言語対応の大きな改善と、さらに coding/math の精度が向上しました。
中国語-英語の理解、複雑な指示、多言語能力、ツール使用の2.5シリーズ上の主要な利益とプレビューリリース。
適応型ツール使用(検索、メモリ、コード通訳)と、複雑なタスクで高精度なテストタイムスケーリングによるモデルの調整。

Semantic文書のリランサー。 クエリごとに最大500名まで並べ替え、100以上の言語に対応し、カスタムソート命令を受け付けます。

強力なフロントエンド結果と、AIコーディングツールやエージェントの多言語プログラミングサポートを備えたコーディング調整型256Kコンテキストモデル。

高周波企業のワークロードのためのバランスの取れた汎用モデル:情報処理、コンテンツ、検索、データ分析。

256K文脈を用いたレイテンシ重視のマルチモーダルモデル、4つの推論力モードと、高通貨の使用に対する image/video の理解。

複雑な推論、マルチモーダル理解、構造化された生成、およびツール管理された実行のための256K文脈を持つ旗艦総合モデル。

ネイティブオーディオ同期、カメラ制御、およびレンダリングごとの低コストでの安定した動作を備えたシネマティッククリップ用のスピード最適化された2.0ビデオバリアント。

テキスト、画像、音声、ビデオ入力、安定したモーションと一貫性のある文字から出力されるシネマティック用のマルチモーダルビデオモデル。

レンダリング、高解像および一貫した編集およびブランドの視覚の作成の前のプロンプトによる理由の統一されたmultimodalイメージ モデル。

詳細なtext-to-image、単一画像編集、1Kおよび2K出力のマルチリファレンス融合に対応したプレミアムSeedream画像モデル。

パラリンギュリスティックコントロール(笑い、sighs)とゼロショットボイスクローニングによるロングフォーム、マルチスピーカーポッドキャストダイアログ用のオープンソースボイスモデル。

テキストプロンプトから最大3分の音声を生成し、 text-to-audio と audio-to-audio をサポートし、調整可能な時間、ステップ、および CFG スケールを伴います。

text-to-audio 、 audio-to-audio 、音楽制作、サウンドデザイン、リミックスのためのオーディオインペレーション

WAN 2.2の安定したビデオInfinity 2.0 Pro:一貫性のある文字IDを維持しながら、静止画を理論的に無限大のビデオに拡張します。

Web は、ページやドメインを横断して高速で構造化された検索のために、クロール、抽出、URL マッピングを使用して検索します。

選択可能な出力寸法(64–2048)で埋め込まれる複数のテキスト。 入力あたり最大8,192トークン。

スピードに最適化されたマルチモーダル埋め込み - Vision-Plus と同じ形状、3× 安い image/video トークン。

テキスト、画像、およびビデオ入力用の独立したベクトルを制作するマルチモーダル埋め込み。
ネイティブ・オーディオ・ビジュアル・シンク(リップ・シンプレーション、対話、音楽、SFX)と映画、マルチショット・ストーリーのためのマルチモーダル映像生成モデル。

T2V、I2V、ビデオ編集、および reference-to-video をサポートするマルチモーダルビデオモデル、テキスト、画像、またはビデオ入力から高忠実度出力。

画像生成と編集コンパニオンモデル: text-to-image 、境界ボックス編集、およびコヒーシブ画像セット、最大4K出力プロ。
制御されたWhisper Large v3ターボの文字起こしを多言語ASR、翻訳、VAD、タイムスタンプ、字幕、ホットワード、デコーダー制御付きで行います。

サブタスク、コールツール、API へのハイレベルなプロンプトをオンにし、マニュアルのオーケストレーションなしで end-to-end 結果を配信する自動AIエージェント。

プロンプトガイド付きモーションでソースイメージをアニメーション化したイメージツービデオモデルで、480pまたは720pで最大15秒で7つのアスペクト比で。

エージェントのワークフロー、複雑なソフトウェアエンジニアリング、および長期間にわたるタスクのためのトップティアモデル、1000以上のツールコールを1Mコンテキストでサポートします。

ネイティブなビジュアルと音声理解によるマルチモーダルモデルを1Mのコンテキストで、エージェントのワークフローにおけるモダリティを推論し行動するように設計されています。

テキスト、画像、reference-to-videoを一つのモデルにまとめています。シネマティックな動き、最大9つのリファレンスにわたるキャラクターの一貫性、そして同期されたネイティブ音声。

480pおよび720pでネイティブオーディオ、カメラ制御、画像や映像入力に対応した、最も高速で手頃な価格のSeedance 2.0層です。

StepFunは、画像と映像の入力、ツール呼び出し、調整可能な推論努力、そして256Kのコンテキストを備えたマルチモーダル推論モデルです。

StepFun はエージェント向けのテキスト推論モデル、コーディング、ツール呼び出し、長いコンテキスト分析を対象としています。

エージェント最適化されたStep 3.5 フラッシュバリアントで、低・高推論努力モードがあります。

StepFunは音声およびテキスト会話モデルで、テキスト出力とパラリンガスティック理解を特徴としています。

StepFun 画像生成およびtext-to-image単一画像編集のための画像編集モデルです。

文脈型StepFuntext-to-speech自然な言語による音声指示と表現力のある表現を持つモデルです。

StepFuntext-to-speech公式ボイス、カスタムクローンボイス、ボイスタグコントロールを備えたモデルです。

StepFunは中国語と英語の音声書き起こしのためのストリーミング音声認識モデルです。

Next-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Tiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 モデル