
100万トークンコンテキスト、128K出力、低・高・最大努力での常時オン推論、ネイティブウェブ検索、ツール呼び出しによるコーディングとエージェントモデル。
使い分を使いながら支払うか、週ごとの手当付きのプランを選ぶのも良いでしょう。
価格カタログ
EmpirioLabsの料金はモデルや単位によって異なり、トークン、画像、音声または動画の秒数、メッセージ、3Dアセット、検索リクエストなどが含まれます。インタラクティブな価格表は現在のカタログを読み込みますが、これらの代表的なレートはクライアントJavaScriptなしでも読みやすいままです。
画像入力$0.051枚あたり。480pで毎秒$0.096、720pで毎秒$0.168回の映像出力が始まります。
コスト効率の高い長コンテキストマルチモーダルAPIに対して、入力は100万プロンプトトークンあたり$0.40から始まります。
マルチモーダル推論、コーディング、エージェントワークロードに対して、入力は100万プロンプトトークンあたり$0.30から始まります。
画像から3Dへの生成は生成された3Dアセットごとに料金が設定され、フォーマットや解像度の管理に関するドキュメントが用意されています。
モデルAPI料金はUSDで表示され、USDで請求されます。対象の場合、チェックアウトで地域の支払い方法が表示されることがあります。
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4.1 Flash
GLM 5.3 Flash
Qwen3.8 Flash
Qwen3.8 27B
Muse Glimmer 30B
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
ミニマックス M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 Flash無料This model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V Flash無料This model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 Flash無料This model is free to run, so using it never draws from your weekly allowance.
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Fugu Max
Fugu Ultra v2.0
Qwen3.8 Max 0902
Muse Spark 1.3
GLM 5.3
DeepSeek V4 Pro 0813
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen3.7 プラス
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

100万トークンコンテキスト、128K出力、低・高・最大努力での常時オン推論、ネイティブウェブ検索、ツール呼び出しによるコーディングとエージェントモデル。

テキストからビデオへの変換とimage-to-video、720pまたは1080pで3秒から15秒間、アスペクト比とプロンプト制御付きで同期したネイティブ音声が提供されます。

ネイティブなマルチモーダルフラッシュモデルで、1Mトークンコンテキスト、画像および映像入力、常時オンの推論、ネイティブのウェブ検索、ツール呼び出し機能を備えています。

1Mトークンコンテキスト、128Kの出力、調整可能な推論努力、ネイティブのウェブ検索、ツール呼び出しを備えた推論・コーディングモデル。
1Mトークンコンテキスト、128Kの出力、調整可能な推論努力、ネイティブのウェブ検索、ツール呼び出しを備えた推論・コーディングモデル。

Kimi K3は、1Mトークンコンテキスト、常時稼働型思考、ネイティブウェブ検索、テキスト、画像、動画入力を備えたMoonshotの旗艦推論モデルです。

Metaの更新されたフロンティア推論モデルは、1,048,576トークンのコンテキスト、画像、動画、音声、PDFの理解、ウェブ検索、ツール呼び出しを備えています。

Kimi K2.7 Codeは、Moonshotの兆パラメータエージェントコーディングモデルで、256Kのコンテキスト、常時オンの推論、テキスト、画像、ビデオ入力を備えています。
Kimi K2.7 Codeは、Moonshotの兆パラメータエージェントコーディングモデルで、256Kのコンテキスト、常時オンの推論、テキスト、画像、ビデオ入力を備えています。

1,048,576トークンのコンテキストに加え、画像、動画、音声、PDFの理解、ウェブ検索、ツール呼び出しを備えたメタフロンティア推論モデル。

ハード推論、コーディング、研究用に更新されたマルチエージェントコンダクターで、最大努力量1M、画像入力、ウェブ検索に対応しています。

テキスト、画像、動画、コーディング、ツール使用、GUI理解、1Mコンテキストワークフローのためのコスト効率のQwen3.7ビジョン言語モデル。
テキスト、画像、動画、コーディング、ツール使用、GUI理解、1Mコンテキストワークフローのためのコスト効率のQwen3.7ビジョン言語モデル。

Kimi K2.7 Code Highspeedは、Moonshotのエージェントコーディングモデルの中でより高速なサービング層で、256Kのコンテキスト、常時オンの推論、画像および映像入力を備えています。

ハード推論、コーディング、研究のためのオリジナルマルチエージェントコンダクターで、1Mのコンテキスト、画像入力、関数呼び出し、ウェブ検索を備えています。

テキスト、画像、動画、ツール使用、エージェントタスク向けの高速Qwen3.7ビジョン言語モデルで、暗黙的キャッシュと1Mトークンコンテキストを備えています。
テキスト、画像、動画、ツール使用、エージェントタスク向けの高速Qwen3.7ビジョン言語モデルで、暗黙的キャッシュと1Mトークンコンテキストを備えています。
MiniMax M3は、テキスト、画像、ビデオ入力を用いたコーディング、エージェント、長文脈解析のためのマルチモーダル推論モデルです。
MiniMax M3は、テキスト、画像、ビデオ入力を用いたコーディング、エージェント、長文脈解析のためのマルチモーダル推論モデルです。

Qwen3.7 Maxは、コーディング、生産性、長期エージェント、深い思考、ツール、1Mトークンコンテキストのための旗艦テキストモデルです。
Qwen3.7 Maxは、コーディング、生産性、長期エージェント、深い思考、ツール、1Mトークンコンテキストのための旗艦テキストモデルです。

コーディング、長期的なエージェント、プロフェッショナルな仕事のための兆スケールのMoEフラッグシップであり、100万トークンの文脈で画像と映像の理解を兼ね備えています。
コーディング、長期的なエージェント、プロフェッショナルな仕事のための兆スケールのMoEフラッグシップであり、100万トークンの文脈で画像と映像の理解を兼ね備えています。

Fast Qwen3.8 視覚言語モデルで、画像と映像入力、5つの組み込みツール、1Mトークンコンテキストを備えています。

強化されたQwen3.8 Maxスナップショットで、より強力なコーディング、安定したマルチツールエージェント実行、そして1Mトークンコンテキストにわたるより鮮明なチャートとドキュメントビジョンを実現しました。
オープンソースの音楽生成モデルで、text-to-songおよび歌詞ガイド音声のための高速8ステップXLターボ推論による曲の制御可能な反復が可能です。
Apacheライセンスの4B FLUX.2 Klein画像生成・編集モデルで、text-to-image、参照画像編集、クリエイティブワークフローサポートを備えています。
高速推論にチューニングされた高速M2.7バリアントで、強力な汎用性能と強いエージェント能力を備えています。
リアルタイム音声モデルは、平易な英語の伝達方向を取り、200+言語にわたる一つの音声アイデンティティを保持し、ワードタイムスタンプでストリーミングします。
15言語で271+音声を使った130ms未満のTTFB音声合成、表現豊かな韻律、そして低遅延の音声エージェント向けのリアルタイムSSEストリーミング。
放送品質の音声合成と豊かな表現力豊かな韻律、15言語にわたる271+音声、そして単語ごとのタイムスタンプ付きのリアルタイムSSEストリーミング。
202Kのコンテキスト、128Kの出力、ツール呼び出し、構造化出力、キャッシュサポートを備えた長コンテキストのZhipu AI推論モデル。
Kimi K2.6は、256Kのコンテキスト、強力なコーディング、テキスト、画像、ビデオ入力を備えたMoonshotマルチモーダル推論モデルです。

コーディング、リポジトリ作業、ツール使用、フルスタックタスクの面で大幅な向上を遂げたポストトレーニング済みの0731リリースで、さらに100万のコンテキストウィンドウも備えています。

コーディング、リポジトリ作業、ツール使用、フルスタックタスクの面で大幅な向上を遂げたポストトレーニング済みの0731リリースで、さらに100万のコンテキストウィンドウも備えています。
歌詞とスタイルプロンプトから完全なステレオ曲を生成し、長さ、シード、フォーマットのコントロールは最大5分まで可能です。

公式の0813 Proリリースで、コーディング、リポジトリ作業、ツール使用、エージェントタスクの面で大きな進歩があり、ハイブリッド思考と100万のコンテキストウィンドウを備えています。

Metaの長期的なエージェント推論モデルで、1,048,576トークンのコンテキスト、画像、動画、PDFの理解、ウェブ検索、ツール呼び出しが可能です。
レイテンシ優先のリアルタイム音声合成で、200+言語で一つの音声アイデンティティを保持し、大音量ストリーミングワークロードに最適化されています。

DeepSeekの新しいアーキテクチャの軽量フラッグシップで、ネイティブな画像理解、ハイブリッド思考、100万のコンテキスト、最大384Kの出力トークンを備えています。
MiniMax M2.7は、インターリーブ思考、関数呼び出し、プロンプトキャッシュを備えた汎用推論チャットモデルです。
TRELLIS.2 イメージから3Dへのモデルで、参照画像を解像度、シード、メッシュ、テクスチャ、エクスポートコントロールを備えたテクスチャ付きGLBアセットに変換します。
Qwen3.5 122B-A10Bは、256Kのコンテキスト、効率的なスパースMoE推論、テキスト、画像、ビデオ入力を持つマルチモーダル推論モデルです。
Qwen3.5 397B-A17Bは、言語、コード、エージェント、GUIタスク、画像および映像の理解のための旗艦的なマルチモーダル推論モデルです。
Qwen3.5 35B-A3Bは、効率的なネイティブ視覚言語モデルで、MoEルーティングが稀で、深い思考、テキスト、画像、ビデオ入力を備えています。
Qwen3.5 27Bは、高速応答、256Kのコンテキスト、テキスト、画像、動画の理解を持つ密度の高いマルチモーダル推論モデルです。
256Kのコンテキスト、画像・映像入力、関数ツール、構造化JSON、そしてデフォルトで思考可能なマルチモーダル推論器。
Qwen3.6 27Bは、256Kのコンテキスト上でエージェント的コーディング、STEM推論、空間視覚、OCR、テキスト、画像、動画の理解を向上させます。

Fast Qwen3.6 エージェントコーディング、数学推論、空間理解、OCR、テキスト、画像、ビデオ入力のための視覚言語モデル。
Fast Qwen3.6 エージェントコーディング、数学推論、空間理解、OCR、テキスト、画像、ビデオ入力のための視覚言語モデル。
Gemma 4 26B A4Bは、Googleのオープンなマルチモーダルモデルで、256Kのコンテキスト、テキスト、画像、ビデオ入力、ツール、構造化出力を備えています。
画像理解、128Kのコンテキスト、ツール呼び出し、構造化出力、制御可能な推論力を備えたMetaオープン30Bエージェントモデル。
Qwen3.5 9Bは、256Kのコンテキスト、画像・映像入力、関数ツール、構造化出力を備えたコンパクトなマルチモーダル推論モデルです。

Qwen3.5 4Bは、256Kのコンテキスト、画像・映像入力、関数ツール、構造化出力を備えた低コストのマルチモーダル推論モデルです。
Qwen3.6 35B A3Bは、128Kのコンテキスト、関数ツール、厳格構造化JSON出力を持つ256人のエキスパートmixture-of-experts推論モデルです。

コーディング、推論、長い文脈作成、一般的なチャット用の無料の軽量GLM-4.7テキストモデル。

推論、コーディング、長文チャット、一般的な言語タスク用の無料の軽量GLM-4.5テキストモデル。

画像、動画、ファイル、テキストの理解を用い、ネイティブ関数呼び出しに対応した無料のマルチモーダルGLM-4.6Vモデル。

画像生成と編集モデルをテキストや画像入力から画像を作成・修正し、インペインテインション、バーチャルトライオン、スタイルコントロールを備えています。

テキストと任意の画像プロンプトから最大2分間のマルチショット動画を生成するビデオ生成モデルで、品質と一貫性が向上しています。

Nova-3モデルを用いた音声・テキスト転写で、多言語対応と高度なカスタマイズ可能な設定を本番ワークロード向けに提供します。

DeepSeek R1chain-of-thought論理とAnthropic Claudeのクリエイティブおよびコード生成を組み合わせ、統合されたデータ制御インターフェースの背後にあります。

オープンソースのMixture-of-Expert LLMは、長尺プロンプトにわたる高効率の推論、コーディング、一般的な言語タスクに最適化されています。

軽量なMoEモデルは、合計284B、アクティブパラメータ13B、ネイティブ1Mコンテキストを持ち、低レイテンシでコスト効率の高い高並行利用に最適化されています。

軽量なMoEモデルは、合計284B、アクティブパラメータ13B、ネイティブ1Mコンテキストを持ち、低レイテンシでコスト効率の高い高並行利用に最適化されています。
軽量なMoEモデルは、合計284B、アクティブパラメータ13B、ネイティブ1Mコンテキストを持ち、低レイテンシでコスト効率の高い高並行利用に最適化されています。

軽量なMoEモデルは、合計284B、アクティブパラメータ13B、ネイティブ1Mコンテキストを持ち、低レイテンシでコスト効率の高い高並行利用に最適化されています。
1.6Tトータル/49Bアクティブパラメータとネイティブ1Mコンテキストを備えたフラッグシップMoE LLM(高度な数学、論理推論、専門的なコーディング用)。

1.6Tトータル/49Bアクティブパラメータとネイティブ1Mコンテキストを備えたフラッグシップMoE LLM(高度な数学、論理推論、専門的なコーディング用)。
1.6Tトータル/49Bアクティブパラメータとネイティブ1Mコンテキストを備えたフラッグシップMoE LLM(高度な数学、論理推論、専門的なコーディング用)。

1.6Tトータル/49Bアクティブパラメータとネイティブ1Mコンテキストを備えたフラッグシップMoE LLM(高度な数学、論理推論、専門的なコーディング用)。

自然言語の質問に対する素早いLLMスタイルの回答で、新しいExaのウェブ検索結果に基づき、インライン引用とソースリンクを添えています。

ウェブ検索エンジンは、AIエージェント向けにオープンウェブ上でページ検索、類似ページの検索、クロール、専用コード検索を行っています。

低遅延text-to-speech、シングルスピーカーおよびマルチスピーカーの音声、コントロール可能なスタイル、アクセント、表現力豊かな本番アプリに対応しています。

ポッドキャスト、オーディオブック、カスタマーサポート向けの高品質TTSプレビューを提供し、23+言語にわたる多言語の多言語による表現力豊かな音声も提供します。

ナレーション、アシスタント、ボイスアプリをまたいで、新しいオーディオタグで正確なスタイル、トーン、テンポ、伝え方を実現し、高度にコントロールしやすいTTS。

128Kのコンテキスト、140+言語、改良されたmath/reasoning、構造化出力、関数呼び出しを備えたオープンソースのビジョン言語モデル。

LLMベースのtext-to-speechで、3〜10秒の音声からゼロショットのボイスクローンと、マルチリワード強化学習(RL)による感情表現で制御可能な出力を実現しています。

AI生成と人間生成のテキスト部分を検出し、完全に人間生成、AI、混合コンテンツを分類するディープラーニング検出器。

テキストからビデオ、画像からビデオ、参照ビデオ、ビデオ編集の各モードを提供し、高忠実度でモーションスムースな出力を実現します。

マルチモーダルなMixture-of-Expertアーキテクチャ上のオープンソースtext-to-imageモデルで、フォトリアルなディテールと強力な多言語テキストレンダリングを備えています。
8.3Bパラメータのビデオモデルで、ネイティブ720p出力(1080pまでアップスケーリング可能)、強いモーションコヒーレンス、そして最大10秒のバイリンガルプロンプト理解能力を持つ。

マルチモーダル理解と画像生成を一つのアーキテクチャに統合する、Janus Pro 7Bモデル上の自己回帰的フレームワーク。

スタンダードまたはプロモードでのビデオモデルで、テキストからビデオ、イメージからビデオ、参照ビデオ、編集、ネイティブサウンド、マルチシーントランジションに対応します。

Kling 3.0モデルで、リファレンス動画からリファレンス画像のキャラクターにモーションを転送するもので、標準720pとPro 1080pの両層があります。

初期結果が不十分でもクエリを続け、標準モードよりも包括的な回答を返す反復AI検索。

AI搭載のウェブ検索で、ディープサーチよりも速い詳細な概要と回答を提供します。OpenAI SimpleQAベンチマークで#1位にランクイン。

画像解析、プログラミング、数学、多言語タスクに128Kのコンテキストを持つ24Bパラメータのマルチモーダルモデルで、効率的な局所推論に最適化されています。

インストラクト、推論(マジストラル)、デヴストラルファミリーを統合したハイブリッドモデル:スモール3と比べて完了時間が40%短縮され、スループットは3倍です。

オープンソースの32B MoE基盤モデルで、精密なデュアルタワーリップシンクを用いて、1ステップの推論で同期した映像と音声を生成する。

30万のコンテキスト(最大~30分の動画)でテキスト、画像、動画を扱う低コストのマルチモーダル基盤モデルで、速度とコストを重視して調整されています。

テキスト、画像、文書、動画の1Mコンテキスト(長文ドキュメントと~90分のクリップ)に対して、高速でコスト効率の高いマルチモーダル推論モデルです。

128Kコンテキストで超低遅延とコストを最適化したテキストのみの基盤モデル。要約、翻訳、チャットに優れており、キャッシュ割引が44%あります。

30万のコンテキスト(最大~30分の動画)におけるテキスト、画像、動画の精度、速度、コストのマルチモーダル基礎モデルのバランス。

Whisper-1speech-to-text多言語監督付き音声で学習された文字起こしで、ファイルあたりアップロード制限は25MBです。

Claude Opus 4.6の推論による機関レベルの調査、最大限の深さ、ツールへのアクセス強化、そして広範な情報源のカバー。

複雑なテーマにわたる資料の自律的な検索、読解、評価を行う多段階の検索、統合、推論のための研究モデル。

Sonar Proをエージェント研究者として:ウェブ検索を連鎖し、ページ全体を取得し、ライブ推論をストリーミングし、複雑なクエリに戦略を適応させます。

ドメイン、言語、日付などでフィルタリングできるリアルタイムウェブ検索。検索結果を返しますが、LLMの回答ではありません。ファイルのアップロードはありません。

リアルタイムのウェブ接続検索で、正確な引用とカスタマイズ可能なソースを提供し、本番アプリでのAI検索統合up-to-date。

検索に基づくモデルで、引用数が2倍でコンテキストウィンドウが大きく、詳細な回答を必要とする複雑なクエリに対応しています。

ウェブ検索を含む検閲されていないオープンソースR1-1776の推論モデルは、SimpleQAベンチマークで主要な検索エンジンやLLMを上回る性能を発揮しました。

テキストからビデオ、イメージからビデオ、トランジションモードでのシネマティックビデオ生成を、高ディテール、流れるような動き、リアルなアニメーションを特徴としています。

テキストや1〜2フレームの画像プロンプトから最大1080pまで動画を生成し、複数のアスペクト比、5〜10秒の再生時間、オプションで同期音声も可能です。

クラスリードの複雑なChinese/Englishテキストレンダリング、リアルなテクスチャ、多画像融合を備えた統一画像生成および編集モデル。

Qwenの画像生成と編集(ベースおよびProバリアント)、多言語タイポグラフィ、マルチイメージ参照、そして制御可能な1Kまたは2K出力に対応しています。
ハイブリッドな線形注意とスパースなMoE、1Mのコンテキスト、高速マルチモーダルtext/image/ビデオ推論を備えた視覚言語モデル。
ハイブリッドな線形注意とスパースなMoE、1Mのコンテキスト、高速マルチモーダルtext/image/ビデオ推論を備えた視覚言語モデル。

テキスト、画像、音声、動画を処理できるコスト効率の良いオムニモーダルモデルで、90+言語で最大3時間の音声と1時間の動画を可能にします。

テキスト、画像、音声、ビデオのフラッグシップ・オムニモーダルモデル。3Hオーディオ、1Hビデオ、90+入力・30+出力言語、55種類の音声音色。
テキスト、画像、動画を横断し、100万人のコンテキスト上で効率的な深い思考と視覚的理解を可能にするハイブリッドアーキテクチャのマルチモーダルモデル。
テキスト、画像、動画を横断し、100万人のコンテキスト上で効率的な深い思考と視覚的理解を可能にするハイブリッドアーキテクチャのマルチモーダルモデル。

3.6シリーズ(テキストのみ)で最大のプレビューバリアント:コーディングエージェントの実行力の向上、強力なフロントエンドスキル、そしてより広範なロングテール知識。

3.5より大幅にアップグレードされたビジョン言語モデル:エージェント型およびフロントエンドコーディング、マルチモーダル認識、OCR、オブジェクトローカライゼーション。
3.5より大幅にアップグレードされたビジョン言語モデル:エージェント型およびフロントエンドコーディング、マルチモーダル認識、OCR、オブジェクトローカライゼーション。
推論、指示追従、多言語対応が大幅に改善され、coding/math精度も高い256Kのフラッグシップです。
2.5シリーズに比べて中国語と英語の理解力、複雑な指示、多言語能力、ツールの使い方において大きな進歩を見せたプレビューリリース。
複雑なタスクにおいてより高い精度を実現するために、適応ツール(検索、メモリ、コードインタプリタ)とテスト時間のスケーリングを備えた推論モデル。

セマンティックドキュメントのリランク。1クエリあたり最大500の候補を関連性でソートし、100+言語をサポートし、カスタムソート命令も受け入れます。

強力なフロントエンド結果と、AIコーディングツールおよびエージェント向けの多言語プログラミングサポートを持つ、コーディング調整された256Kコンテキストモデル。

高頻度企業ワークロード向けのバランスの取れた汎用モデル:情報処理、コンテンツ、検索、データ分析。

256Kのコンテキスト、4つの推論努力モード、image/video理解を備えたレイテンシ重視のマルチモーダルモデルで、高並行性の利用に向けられています。

複雑な推論、多様理解、構造化生成、ツール拡張実行のための旗艦モデルで、256Kのコンテキストに対応しています。

ネイティブの音声同期、カメラ制御、安定した動きを備え、レンダリング1回あたりのコストを抑えたシネマティッククリップ用のスピード最適化2.0ビデオバリアント。

テキスト、画像、音声、または映像入力からのシネマティック出力のためのマルチモーダルビデオモデルで、安定した動きと一貫したキャラクターを持ちます。

レンダリング前にプロンプトを推論し、高解像度で一貫した編集とブランドビジュアルを生成する統一されたマルチモーダル画像モデル。

プレミアムSeedream画像モデルで、1枚の画像を編集可能なレイヤーに分割し、座標マーカーやスケッチマーカーで編集し、最大10の参照を融合させます。

長尺の多話者ポッドキャスト対話のためのオープンソース音声モデルで、パラリンガスティック制御(笑い、ため息)とゼロショット音声クローンを備えています。

テキストプロンプトから最大3分間の音声を生成し、持続時間、ステップ、CFGスケールを調整可能な、text-to-audioとaudio-to-audioをサポートします。

テキストからのアップto-3-minuteオーディオに、音楽制作、サウンドデザイン、リミックスのためのtext-to-audio、audio-to-audio、オーディオインペインテインメント。

WAN 2.2のStable Video Infinity 2.0 Pro:静止画を理論上無限長の動画に拡張しつつ、文字IDを一貫性を保ちます。

クロール、抽出、URLマッピングによるウェブ検索により、ページやドメイン間での迅速かつ構造化された検索が下流パイプラインに提供されます。

選択可能な出力寸法を持つ多言語テキスト埋め込み(64–2048)。入力あたり最大8,192トークン。

速度最適化されたマルチモーダル埋め込み、Vision-Plusと同じ形状、3×安価なimage/videoトークン。

テキスト、画像、ビデオ入力に対して独立したベクトルを生成するマルチモーダル埋め込み。

ネイティブの視聴覚同期(リップシンク、セリフ、音楽、SFX)を備えたシネマティックでマルチショットのマルチモーダルビデオ生成モデル。

T2V、I2V、ビデオ編集、reference-to-videoをサポートするマルチモーダルビデオモデルで、テキスト、画像、ビデオ入力からの高忠実度出力が可能です。

画像生成および編集の伴随モデル:text-to-image、バウンディングボックス編集、そして一貫した画像セット、Proで最大4K出力が可能です。
制御されたWhisper Large v3ターボの文字起こしを多言語ASR、翻訳、VAD、タイムスタンプ、字幕、ホットワード、デコーダー制御付きで行います。

高レベルのプロンプトをサブタスクに変換し、ツールやAPIを呼び出し、手動のオーケストレーションなしにend-to-end結果を提供する自律型AIエージェントです。

テキストからビデオへの生成、image-to-video、reference-to-video生成が可能で、最大7枚の参照画像で一貫したキャラクターを表現し、1080pで最大15秒の時間が可能です。

エージェント型ワークフロー、複雑なソフトウェアエンジニアリング、長期的なタスクに向けたトップクラスモデルで、1000+のツール呼び出し、100万件のコンテキストで作業を持続可能。

1Mの文脈上でネイティブな視覚・聴覚理解を持つマルチモーダルモデルで、エージェントワークフローのモダリティ間で推論し行動することを目的としています。

テキスト、画像、reference-to-videoを一つのモデルにまとめています。シネマティックな動き、最大9つのリファレンスにわたるキャラクターの一貫性、そして同期されたネイティブ音声。

480pおよび720pでネイティブオーディオ、カメラ制御、画像や映像入力に対応した、最も高速で手頃な価格のSeedance 2.0層です。

StepFunは、画像と映像の入力、ツール呼び出し、調整可能な推論努力、そして256Kのコンテキストを備えたマルチモーダル推論モデルです。

StepFun はエージェント向けのテキスト推論モデル、コーディング、ツール呼び出し、長いコンテキスト分析を対象としています。

エージェント最適化されたStep 3.5 フラッシュバリアントで、低・高推論努力モードがあります。

StepFunは音声およびテキスト会話モデルで、テキスト出力とパラリンガスティック理解を特徴としています。

StepFun 画像生成およびtext-to-image単一画像編集のための画像編集モデルです。

文脈型StepFuntext-to-speech自然な言語による音声指示と表現力のある表現を持つモデルです。

StepFuntext-to-speech公式ボイス、カスタムクローンボイス、ボイスタグコントロールを備えたモデルです。

StepFunは中国語と英語の音声書き起こしのためのストリーミング音声認識モデルです。

次世代のコーディングとエージェントモデルで、エンジニアリンググレードのコード配信、長期的な自律性、256Kのマルチモーダル理解を特徴としています。

1,000以上の音声、16言語、20の中国方言、自然言語の伝え方、インライン感情タグを備えた階層的な音声合成。

テキスト、画像、動画、音声の参照を1回のリクエストで、ネイティブステレオ音声で最大2Kで4秒から15秒のクリップを生成します。

OpenAIの旗艦画像モデルで、強力なプロンプトの忠実度、鮮明なテキストレンダリング、最大16枚の参照画像にわたる指示ベースの編集機能を備えています。

KuaishouのKling 3.0ビデオジェネレーターで、text-to-video、最初と最後のフレームimage-to-video、ネイティブオーディオ、720p、1080p、または4K出力を備えています。

アリババのWan 2.5ビデオモデルで、text-to-videoとimage-to-video、ネイティブオーディオ、オプションのカスタムオーディオトラック、480pから1080p出力に対応しています。

アリババのWan 2.2ビデオファミリーは、標準およびフラッシュティア、第一フレームと最後のフレーム補間、低コストで480pから1080pまでの出力を備えています。

AlibabaのWan 2.1ビデオモデルで、text-to-video、image-to-video、そして最初と最後のフレームクリップを480pまたは720pで表示できるターボおよびプラスティアがあります。

アリババのワン2.5画像モデルで、最大3枚の画像を約1.7メガピクセルで撮影できるtext-to-imageおよびマルチリファレンス編集が可能です。

アリババのWan 2.2 text-to-imageモデルで、プラスとフラッシュのティアがあり、最大1440x1440の出力を低価格で提供しています。

アリババのワン2.1text-to-imageモデルで、ターボおよびプラスティア、最大1440x1440出力を低価格で提供しています。

最大30秒の一貫したクリップ、最大50の参照画像、動画、音声クリップ、ネイティブ音声、編集、拡張を含む長尺ビデオモデル。

テキストから画像への編集に加え、最大5枚のソース画像、自動またはピン留めの品質ティア、1Kまたは2Kの出力解像度に対応しています。

テキスト、画像、最初と最後のフレーム、または最大7つの参照から映像を生成し、ネイティブ音声、マルチショットカット、クリップ拡張も備えています。

アクションや特殊効果作業用のシネマグレードビデオモデルで、テキスト、画像、最初と最後のフレーム、または参照から、ネイティブの同期音声付きで処理できます。

既存の動画の口の動きをアップロードされた音声トラックや、14の内蔵音声のいずれかが話すテキストに同期させます。

1つのモデルに6つのビデオ変換:プロンプト編集、リスタイリング、被写体入れ替え、モーション転送、アップスケール、生成効果音です。

ミリ秒リップシンクによる音声・映像合成、6言語のセリフ、シネマティックなカメラムーブ、そして最大1080p出力。

最大14枚の参照画像、強力なテキストレンダリング、2Kまたは4Kの出力を一つの定価で実現する高精度な画像生成と編集。

最大14枚のリファレンス画像、最大15枚のバッチセット、1Kから4Kの出力を1枚の定額価格で統一した画像生成と編集が可能です。

Rodin Gen-2エンジンは、テキストプロンプトや最大5枚の参照画像をPBRマテリアルとクアッドまたは生メッシュを用いた生産用3Dアセットに変換します。

構造認識テクスチャを備えた生産特化したイメージから3Dへの変換、1536および1536 Proの精密ティア、最大200万面のメッシュ、5つのエクスポートフォーマット。

テキスト、画像、動画を1024次または2048次元ベクトルに融合させ、クロスモーダル検索と検索を行うマルチモーダル埋め込み。

最大30秒のオールインワン動画生成で、ネイティブ音声、オムニモーダル参照(画像、動画、音声、ファイル、ウェブリンク)、そして高速なPrimeティアに対応しています。

コスト効率の良いマルチエージェントコンダクターで、タスクごとに適切な規模の専門家チームを編成し、100万のコンテキスト、画像入力、ウェブ検索を備えています。

最も難しい推論、コーディング、研究作業に向けられた旗艦のマルチエージェントコンダクターで、100万のコンテキスト、画像入力、ウェブ検索に対応しています。
163 / 182 モデル