
テキスト・ツー・ビデオと image-to-video を同期ネイティブ・オーディオ、720p または 1080p で 3 から 15 秒、アスペクト比とプロンプト・コントロールで合成しました。
使い分を使いながら支払うか、週ごとの手当付きのプランを選ぶのも良いでしょう。
価格カタログ
EmpirioLabsの料金はモデルや単位によって異なり、トークン、画像、音声または動画の秒数、メッセージ、3Dアセット、検索リクエストなどが含まれます。インタラクティブな価格表は現在のカタログを読み込みますが、これらの代表的なレートはクライアントJavaScriptなしでも読みやすいままです。
画像入力$0.051枚あたり。480pで毎秒$0.096、720pで毎秒$0.168回の映像出力が始まります。
コスト効率の高い長コンテキストマルチモーダルAPIに対して、入力は100万プロンプトトークンあたり$0.40から始まります。
マルチモーダル推論、コーディング、エージェントワークロードに対して、入力は100万プロンプトトークンあたり$0.30から始まります。
画像から3Dへの生成は生成された3Dアセットごとに料金が設定され、フォーマットや解像度の管理に関するドキュメントが用意されています。
モデルAPI料金はUSDで表示され、USDで請求されます。対象の場合、チェックアウトで地域の支払い方法が表示されることがあります。
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
ミニマックス M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 Flash無料This model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V Flash無料This model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 Flash無料This model is free to run, so using it never draws from your weekly allowance.
Mistral Medium 3
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 プラス
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
Mistral Medium 3.1
Nova Premier 1.0
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

テキスト・ツー・ビデオと image-to-video を同期ネイティブ・オーディオ、720p または 1080p で 3 から 15 秒、アスペクト比とプロンプト・コントロールで合成しました。

1Mトークンコンテクスト、128K出力、調整可能な推論努力、ネイティブWeb検索、ツールコールによるモデルの調整とコーディング。

Kimi K3は、1Mトークンコンテキスト、常時稼働型思考、ネイティブウェブ検索、テキスト、画像、動画入力を備えたMoonshotの旗艦推論モデルです。

Metaの更新されたフロンティア推論モデルは、1,048,576トークンのコンテキスト、画像、動画、音声、PDFの理解、ウェブ検索、ツール呼び出しを備えています。

キム・ク2.7 コードは、256Kコンテキスト、常にオン推論、テキスト、画像、ビデオ入力のムーンショットのトリリオンパラメータのエージェントのコーディングモデルです。
キム・ク2.7 コードは、256Kコンテキスト、常にオン推論、テキスト、画像、ビデオ入力のムーンショットのトリリオンパラメータのエージェントのコーディングモデルです。

1,048,576トークンのコンテキストに加え、画像、動画、音声、PDFの理解、ウェブ検索、ツール呼び出しを備えたメタフロンティア推論モデル。

ハード推論、コーディング、研究用に更新されたマルチエージェントコンダクターで、最大努力量1M、画像入力、ウェブ検索に対応しています。

テキスト、画像、ビデオ、コーディング、ツール使用、GUI理解、および1Mコンテキストワークフローの費用対効果の高いQwen3.7 Vision-languageモデル。
テキスト、画像、ビデオ、コーディング、ツール使用、GUI理解、および1Mコンテキストワークフローの費用対効果の高いQwen3.7 Vision-languageモデル。

キム・ク2.7 Code Highspeed は、Moonshot のエージェントコーディングモデルのより高速なサービスで、256K のコンテキスト、常にオンの推論、および画像とビデオの入力によります。

ハード推論、コーディング、研究のためのオリジナルマルチエージェントコンダクターで、1Mのコンテキスト、画像入力、関数呼び出し、ウェブ検索を備えています。

テキスト、画像、動画、ツール使用、エージェントタスク向けの高速Qwen3.7ビジョン言語モデルで、暗黙的キャッシュと1Mトークンコンテキストを備えています。
テキスト、画像、動画、ツール使用、エージェントタスク向けの高速Qwen3.7ビジョン言語モデルで、暗黙的キャッシュと1Mトークンコンテキストを備えています。
MiniMax M3は、テキスト、画像、ビデオ入力でコーディング、エージェント、および長文解析用のマルチモーダル推論モデルです。
MiniMax M3は、テキスト、画像、ビデオ入力でコーディング、エージェント、および長文解析用のマルチモーダル推論モデルです。

キューン3.7 Max は、コーディング、生産性、ロングランニングのエージェント、ディープ思考、ツール、および 1M トークンのコンテキストのための主観的なテキストモデルです。
キューン3.7 Max は、コーディング、生産性、ロングランニングのエージェント、ディープ思考、ツール、および 1M トークンのコンテキストのための主観的なテキストモデルです。

コーディング、長期的なエージェント、プロフェッショナルな仕事のための兆スケールのMoEフラッグシップであり、100万トークンの文脈で画像と映像の理解を兼ね備えています。
コーディング、長期的なエージェント、プロフェッショナルな仕事のための兆スケールのMoEフラッグシップであり、100万トークンの文脈で画像と映像の理解を兼ね備えています。
text-to-song および lyric-guided オーディオ用のオープンソースの音楽生成モデル、制御可能な曲反復のための高速な 8 ステップ XL ターボ推論。
Apache ライセンス 4B FLUX.2 text-to-image 、リファレンス画像編集、クリエイティブワークフローサポートによるKleinイメージ生成と編集モデル。
高速度M2.7の変異体は、強力な汎用性能力を備えた強力な汎用性能で高速な推論のために調整しました。
リアルタイム音声モデルで、平易な英語音声指示、100+言語にわたる一つの音声識別、200ms未満のストリーミングtime-to-first-audio。
サブ130ms TTFB 音声合成は、15 カ国語で 271 以上の音声、表現力のある音声、低レイテンシの音声エージェントのリアルタイム SSE ストリーミングに対応しています。
豊富な表現力豊かなプロッディ、15言語の271以上の音声、単語ごとのタイムスタンプによるリアルタイムのSSEストリーミング
202K文脈、128K出力、ツール呼び出し、構造化された出力、キャッシュサポートのモデルを推論するロングコンテキストZhipu AI。
Kimi K2.6は、256Kコンテキスト、強力なコーディング、テキスト、画像、ビデオ入力のムーンショットのマルチモーダル推論モデルです。

コーディング、リポジトリ作業、ツール使用、フルスタックタスクの面で大幅な向上を遂げたポストトレーニング済みの0731リリースで、さらに100万のコンテキストウィンドウも備えています。
MiniMax M2.7は、連動型思考、関数呼び出し、プロンプトキャッシュを備えた汎用的な推論チャットモデルです。
TRELLIS.2 イメージツー-3Dモデルで、リファレンスイメージを解像度、シード、メッシュ、テクスチャ、エクスポートコントロールでテクスチャーされたGLBアセットに変えます。
Qwen3.5 122B-A10B は 256K のコンテキスト、有効な sparse MoE の推論、およびテキスト、イメージおよびビデオ入力が付いている多項目推論モデルです。
Qwen3.5 397B-A17B は、言語、コード、エージェント、GUI タスク、画像、ビデオの理解のための重要なマルチモーショナル推論モデルです。
Qwen3.5 35B-A3Bは、スペール・モエルーティング、ディープな思考、テキスト、画像、ビデオ入力を備えた効率的なネイティブ・ビジョン・ランゲージ・モデルです。
Qwen3.5 27Bは、高速応答、256K文脈、テキスト、画像、ビデオ理解の密なマルチモーダル推論モデルです。
Qwen3.6 27B は 256K の文脈に関する有能なコーディング、STEM の推論、空間ビジョン、OCR、およびテキスト、イメージおよびビデオ理解を改善します。

エージェントのコーディング、数学の推論、空間理解、OCR、テキスト、画像、ビデオ入力の高速Qwen3.6ビジョン言語モデル。
エージェントのコーディング、数学の推論、空間理解、OCR、テキスト、画像、ビデオ入力の高速Qwen3.6ビジョン言語モデル。
ジェムマ 4 26B A4B は、256K コンテキスト、テキスト、画像、ビデオ入力、ツール、構造化された出力を備えた Google のオープンマルチモーダルモデルです。
Qwen3.5 9Bは256K文脈、イメージおよびビデオ入力、機能用具および構造された出力が付いている密集した多項目推論モデルです。

Qwen3.5 4Bは256K文脈、イメージおよびビデオ入力、機能用具および構造された出力が付いている低価格の多項目推論モデルです。
Qwen3.6 35B A3Bは、128Kのコンテキスト、関数ツール、厳格構造化JSON出力を持つ256人のエキスパートmixture-of-experts推論モデルです。

コーディング、推論、ロングコンテキストライティング、一般的なチャット用の無料の軽量GLM-4.7テキストモデル。

推論、コーディング、ロングフォームチャット、一般的な言語タスクのための無料の軽量GLM-4.5テキストモデル。

ネイティブ関数呼び出しで画像、ビデオ、ファイル、およびテキスト理解のための無料のマルチモーダルGLM-4.6Vモデル。

画像生成と編集モデルは、テキストや画像入力から画像を作成および変更し、インペレーション、バーチャルトライオン、スタイル制御を行います。

ビデオ生成モデルは、テキストとオプションの画像プロンプトから最大2分のマルチショットビデオを生成し、品質と一貫性を向上させます。

多言語対応のNova-3モデルを用いた音声テキスト転写と、プロダクションワークロード向けの高度なカスタマイズ設定。

Pairs DeepSeek R1 chain-of-thought は、統一されたデータ制御インターフェイスの背後にあるAnthropic Claudeのクリエイティブとコード生成を推論しています。

オープンソースのMixture-of-Experts LLMは、高性能推論、コーディング、および一般的な言語タスクを長時間のプロンプトで調整しました。

284B合計/13B活動的な変数およびネイティブ1Mのコンテキストが付いている軽量のMoEモデルは、低レイテンシー、費用効果が大きい高通貨の使用のために調整しました。

284B合計/13B活動的な変数およびネイティブ1Mのコンテキストが付いている軽量のMoEモデルは、低レイテンシー、費用効果が大きい高通貨の使用のために調整しました。
284B合計/13B活動的な変数およびネイティブ1Mのコンテキストが付いている軽量のMoEモデルは、低レイテンシー、費用効果が大きい高通貨の使用のために調整しました。
フラッグシップMoE LLMと1.6T合計/ 49Bアクティブパラメータとネイティブ1Mコンテキストで高度な数学、論理的推論、および特殊なコーディング。

フラッグシップMoE LLMと1.6T合計/ 49Bアクティブパラメータとネイティブ1Mコンテキストで高度な数学、論理的推論、および特殊なコーディング。
フラッグシップMoE LLMと1.6T合計/ 49Bアクティブパラメータとネイティブ1Mコンテキストで高度な数学、論理的推論、および特殊なコーディング。

このページの検索、類似ページの取得、クローリング、専用のコード検索などのWeb検索エンジンが、AIエージェントのオープンウェブを横断します。

低レイテンシ text-to-speech は、シングルとマルチスピーカーの音声と制御可能なスタイル、アクセント、およびプロダクションアプリのエクスプレストーンです。

23以上の言語で表現力豊かなマルチスピーカーボイスで、ポッドキャスト、オーディオブック、カスタマーサポートの高品質TSプレビュー。

新しいオーディオタグを備えた高度に制御可能なTSは、正確なスタイル、トーン、ペース、そしてナレーション、アシスタント、ボイスアプリを横断して配信します。

128K コンテキスト、140+ の言語を持つオープン ソースの Vision-language モデル、改善された math/reasoning 、構造化された出力、関数呼び出し。

LLM ベースの text-to-speech で、音声の 3-10 秒からゼロショットボイスクローニング、マルチリワード RL による制御可能な出力。

人間とAIが生成する可能性のあるテキストの部分をフラグするディープラーニングディテクタ、完全に人間、AI、または混合されたコンテンツの分類。

テキスト・ツー・ビデオ、画像・ツー・ビデオ、リファレンス・ツー・ビデオ、ビデオ編集モードをハイ・ファイ、モーション・スムース出力で提供するビデオモデル。

オープンソース text-to-image モデルをマルチモーダル・ミクチャー・オブ・エキスパート・アーキテクチャーに、フォトレアルティスティック・ディテールと強力な多言語テキスト・レンダリング。
8.3B-parameter ネイティブ 720p 出力(1080p まで増量可能)、強力なモーションコヒーレンス、最大 10 秒までのバイリンガル プロンプトの理解。

Janus Pro 7BモデルのAutoregressiveフレームワークは、複数のモジュールの理解とイメージ生成を1つのアーキテクチャで統一します。

テキスト・ツー・ビデオ、画像・ツー・ビデオ、リファレンス・ツー・ビデオ、編集、ネイティブ・サウンド、マルチ・シーン・トランジションによるビデオ・モデル。

標準720pとプロ1080pティアで、参照映像から文字にモーションを転送するKling 3.0モデル。

初期結果が不足しているときにクエリを維持し、標準モードよりもより包括的な回答を返す反復AI検索。

詳細な概要と回答でAIを活用したWeb検索、Deep Searchよりも高速化 OpenAI SimpleQAのベンチマークで#1をランク付け。

コスト効率の高い言語モデルは、競争力のあるレイテンシで一般的な生産ワークロードのための強力な推論とマルチモーダル性能を提供します。

強力な推論、コーディング、STEM のパフォーマンス、ハイブリッド、オンプレミス、および in-VPC の展開をサポートするエンタープライズグレードのモデル。

イメージ解析、プログラミング、数学、多言語タスクの128K文脈を備えた24Bパラメータマルチモーダルモデル、効率的なローカル推論のために調整しました。

ハイブリッドモデルは、指示を統一します。, 理容 (Magistral), と Devstral 家族: 40% 低い完了時間と 3x のスループット対小 3.

オープンソース32B MoEファンデーションモデルは、正確なデュアルタワーリップ同期で1つの推論ステップで同期ビデオとオーディオを生成します。

テキスト、画像、および300K文脈上のビデオのための低コストのマルチモーダルファンデーションモデル(最大〜30分のビデオ)、速度と手頃な価格のために調整しました。

1M文脈上のテキスト、画像、文書、ビデオ用の高速で費用対効果の高いマルチモーダル推論モデル(長いドキュメントと〜90分クリップ)。

超低レイテンシと128Kコンテクストのコストで調整されたテキストのみの基礎モデル。 44%のキャッシュ割引で要約、翻訳、チャットに強い。

家族の中で最も有効なモデル。 マルチモーダル text/image /video は 1M のコンテキストで、 chain-of-thought は、ツールとデータソースを一元化しています。

300Kの文脈上のテキスト、画像、およびビデオの精度、速度、およびコストのバランスをとるマルチモーダルファンデーションモデル(最大〜30分のビデオ)。

Whisper-1 speech-to-text トランスクリプションは、多言語の監視された音声で訓練され、ファイルごとに25 MBのアップロード制限があります。

Claude Opus 4.6 の推論、最大深さ、高められた用具のアクセスおよび広範な源の適用範囲によって動力を与えられる構造等級の研究。

複数のステップ検索、合成、推論、自律検索、読書、複雑なトピック間でソースの評価のための研究モデル。

ソナープロは、エージェントの研究者として:チェーンウェブ検索、フルページをフェッチし、ライブ推論をストリームし、複雑なクエリのための戦略を適応させます。

ドメイン、言語、日付などのフィルタリングによるリアルタイムWeb検索。 LLM 応答ではなく検索結果を返します。ファイルのアップロードはありません。

リアルタイムのWeb接続検索と、生産アプリの up-to-date AI検索統合のための正確な引用とカスタマイズ可能なソース。

引用とより大きい文脈のウィンドウを2倍に並べた検索連動モデル、詳細なニュアンス回答が必要な複雑なクエリで調整しました。

未検閲のオープンソース R1-1776 のモデルを Web 検索、SimpleQA ベンチマークの大手検索エンジンと LLM をアウトパーフォーミングします。

テキスト・ツー・ビデオ、イメージ・ツー・ビデオ、トランジション・モードの映像生成と、細部、流体の動き、リアルなアニメーションを融合。

テキストまたは1-2フレーム画像からビデオを生成し、最大1080p、複数のアスペクト比、5-10秒の持続時間、オプションの同期オーディオを要求します。

高度な複雑な Chinese/English テキストレンダリング、現実的なテクスチャ、マルチ画像の融合による画像生成と編集モデルを統合しました。

Qwenの画像生成と編集(ベースおよびProバリアント)、多言語タイポグラフィ、マルチイメージ参照、そして制御可能な1Kまたは2K出力に対応しています。
ハイブリッドリニアアテンションとスパースモエ、1Mコンテクスト、高速マルチモーダル text/image /ビデオインフェレンスを備えた Vision-languageモデル。
ハイブリッドリニアアテンションとスパースモエ、1Mコンテクスト、高速マルチモーダル text/image /ビデオインフェレンスを備えた Vision-languageモデル。

テキスト、画像、音声、ビデオを扱うコスト効率の高いオムニモーダルモデル、最大3時間のオーディオと90以上の言語で1時間のビデオ。

テキスト、画像、オーディオ、ビデオのフラッグシップオムニモーダルモデル。 3hオーディオ、1hビデオ、90 +入力と30 +出力言語、55音声の木材。
1Mのコンテキストでテキスト、画像、動画を横断し、効率的な深層思考と視覚理解のためのハイブリッドアーキテクチャを備えたマルチモーダルモデル。
1Mのコンテキストでテキスト、画像、動画を横断し、効率的な深層思考と視覚理解のためのハイブリッドアーキテクチャを備えたマルチモーダルモデル。

3.6シリーズ(テキストのみ): より高度なコーディングエージェントの実行、より強力なフロントエンドのスキル、より広いロングテールの知識。

3.5以上の大きなアップグレードを備えた Vision-language モデル: エージェントとフロントエンドのコーディング、マルチモーダル認識、OCR、およびオブジェクトのローカリゼーション。
3.5以上の大きなアップグレードを備えた Vision-language モデル: エージェントとフロントエンドのコーディング、マルチモーダル認識、OCR、およびオブジェクトのローカリゼーション。
256K-context は、推論、指示、および多言語対応の大きな改善と、さらに coding/math の精度が向上しました。
中国語-英語の理解、複雑な指示、多言語能力、ツール使用の2.5シリーズ上の主要な利益とプレビューリリース。
適応型ツール使用(検索、メモリ、コード通訳)と、複雑なタスクで高精度なテストタイムスケーリングによるモデルの調整。

Semantic文書のリランサー。 クエリごとに最大500名まで並べ替え、100以上の言語に対応し、カスタムソート命令を受け付けます。

強力なフロントエンド結果と、AIコーディングツールやエージェントの多言語プログラミングサポートを備えたコーディング調整型256Kコンテキストモデル。

高周波企業のワークロードのためのバランスの取れた汎用モデル:情報処理、コンテンツ、検索、データ分析。

256K文脈を用いたレイテンシ重視のマルチモーダルモデル、4つの推論力モードと、高通貨の使用に対する image/video の理解。

複雑な推論、マルチモーダル理解、構造化された生成、およびツール管理された実行のための256K文脈を持つ旗艦総合モデル。

ネイティブオーディオ同期、カメラ制御、およびレンダリングごとの低コストでの安定した動作を備えたシネマティッククリップ用のスピード最適化された2.0ビデオバリアント。

テキスト、画像、音声、ビデオ入力、安定したモーションと一貫性のある文字から出力されるシネマティック用のマルチモーダルビデオモデル。

レンダリング、高解像および一貫した編集およびブランドの視覚の作成の前のプロンプトによる理由の統一されたmultimodalイメージ モデル。

プレミアムSeedream画像モデルで、text-to-image、編集、マルチリファレンスフュージョンに対応し、1K、1.5K、2K出力に加え、標準または高速プロンプト最適化が可能です。

パラリンギュリスティックコントロール(笑い、sighs)とゼロショットボイスクローニングによるロングフォーム、マルチスピーカーポッドキャストダイアログ用のオープンソースボイスモデル。

テキストプロンプトから最大3分の音声を生成し、 text-to-audio と audio-to-audio をサポートし、調整可能な時間、ステップ、および CFG スケールを伴います。

text-to-audio 、 audio-to-audio 、音楽制作、サウンドデザイン、リミックスのためのオーディオインペレーション

WAN 2.2の安定したビデオInfinity 2.0 Pro:一貫性のある文字IDを維持しながら、静止画を理論的に無限大のビデオに拡張します。

Web は、ページやドメインを横断して高速で構造化された検索のために、クロール、抽出、URL マッピングを使用して検索します。

選択可能な出力寸法(64–2048)で埋め込まれる複数のテキスト。 入力あたり最大8,192トークン。

スピードに最適化されたマルチモーダル埋め込み - Vision-Plus と同じ形状、3× 安い image/video トークン。

テキスト、画像、およびビデオ入力用の独立したベクトルを制作するマルチモーダル埋め込み。

ネイティブ・オーディオ・ビジュアル・シンク(リップ・シンプレーション、対話、音楽、SFX)と映画、マルチショット・ストーリーのためのマルチモーダル映像生成モデル。

T2V、I2V、ビデオ編集、および reference-to-video をサポートするマルチモーダルビデオモデル、テキスト、画像、またはビデオ入力から高忠実度出力。

画像生成と編集コンパニオンモデル: text-to-image 、境界ボックス編集、およびコヒーシブ画像セット、最大4K出力プロ。
制御されたWhisper Large v3ターボの文字起こしを多言語ASR、翻訳、VAD、タイムスタンプ、字幕、ホットワード、デコーダー制御付きで行います。

サブタスク、コールツール、API へのハイレベルなプロンプトをオンにし、マニュアルのオーケストレーションなしで end-to-end 結果を配信する自動AIエージェント。

テキストからビデオへの生成、image-to-video、reference-to-video生成が可能で、最大7枚の参照画像で一貫したキャラクターを表現し、1080pで最大15秒の時間が可能です。

エージェントのワークフロー、複雑なソフトウェアエンジニアリング、および長期間にわたるタスクのためのトップティアモデル、1000以上のツールコールを1Mコンテキストでサポートします。

ネイティブなビジュアルと音声理解によるマルチモーダルモデルを1Mのコンテキストで、エージェントのワークフローにおけるモダリティを推論し行動するように設計されています。

テキスト、画像、reference-to-videoを一つのモデルにまとめています。シネマティックな動き、最大9つのリファレンスにわたるキャラクターの一貫性、そして同期されたネイティブ音声。

480pおよび720pでネイティブオーディオ、カメラ制御、画像や映像入力に対応した、最も高速で手頃な価格のSeedance 2.0層です。

StepFunは、画像と映像の入力、ツール呼び出し、調整可能な推論努力、そして256Kのコンテキストを備えたマルチモーダル推論モデルです。

StepFun はエージェント向けのテキスト推論モデル、コーディング、ツール呼び出し、長いコンテキスト分析を対象としています。

エージェント最適化されたStep 3.5 フラッシュバリアントで、低・高推論努力モードがあります。

StepFunは音声およびテキスト会話モデルで、テキスト出力とパラリンガスティック理解を特徴としています。

StepFun 画像生成およびtext-to-image単一画像編集のための画像編集モデルです。

文脈型StepFuntext-to-speech自然な言語による音声指示と表現力のある表現を持つモデルです。

StepFuntext-to-speech公式ボイス、カスタムクローンボイス、ボイスタグコントロールを備えたモデルです。

StepFunは中国語と英語の音声書き起こしのためのストリーミング音声認識モデルです。

次世代のコーディングとエージェントモデルで、エンジニアリンググレードのコード配信、長期的な自律性、256Kのマルチモーダル理解を特徴としています。

1,000以上の音声、16言語、20の中国方言、自然言語の伝え方、インライン感情タグを備えた階層的な音声合成。

テキスト、画像、動画、音声の参照を1回のリクエストで、ネイティブステレオ音声で最大2Kで4秒から15秒のクリップを生成します。

OpenAIの旗艦画像モデルで、強力なプロンプトの忠実度、鮮明なテキストレンダリング、最大16枚の参照画像にわたる指示ベースの編集機能を備えています。

KuaishouのKling 3.0ビデオジェネレーターで、text-to-video、最初と最後のフレームimage-to-video、ネイティブオーディオ、720p、1080p、または4K出力を備えています。

アリババのWan 2.5ビデオモデルで、text-to-videoとimage-to-video、ネイティブオーディオ、オプションのカスタムオーディオトラック、480pから1080p出力に対応しています。

アリババのWan 2.2ビデオファミリーは、標準およびフラッシュティア、第一フレームと最後のフレーム補間、低コストで480pから1080pまでの出力を備えています。

AlibabaのWan 2.1ビデオモデルで、text-to-video、image-to-video、そして最初と最後のフレームクリップを480pまたは720pで表示できるターボおよびプラスティアがあります。

アリババのワン2.5画像モデルで、最大3枚の画像を約1.7メガピクセルで撮影できるtext-to-imageおよびマルチリファレンス編集が可能です。

アリババのWan 2.2 text-to-imageモデルで、プラスとフラッシュのティアがあり、最大1440x1440の出力を低価格で提供しています。

アリババのワン2.1text-to-imageモデルで、ターボおよびプラスティア、最大1440x1440出力を低価格で提供しています。

最大30秒の一貫したクリップ、最大50の参照画像、動画、音声クリップ、ネイティブ音声、編集、拡張を含む長尺ビデオモデル。
140 / 155 モデル