
GLM 5.3
Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.
テキスト、画像、音声、動画、3Dなど、モデルの全カタログを閲覧できます。
モデルカタログ
テキスト、画像、動画、音声、3D、検索、エージェントエンドポイントをpay-as-you-go価格で閲覧できます。インタラクティブなカタログはEmpirioLabsから現在の利用可能性を読み込み、これらのモデルドキュメントはクライアントJavaScriptなしでもクロール可能です。
xAIimage-to-videoプロンプトガイド付きのモーション、ネイティブ音声、480pまたは720p出力、最大15秒のクリップを備えています。
テキスト、画像、音声、または映像入力からシネマティッククリップを生成するためのマルチモーダルビデオ生成。
高解像度のクリエイティブ、ブランド、商品ビジュアルのための統一画像生成と編集。
テキスト、画像、動画、コーディング、ツール、1Mコンテキストワークフロー向けのコスト効率の高いビジョン言語モデル。
コーディング、生産性、長期エージェント、深い思考、ツール使用のための旗艦的な長期コンテキストモデル。
コーディング、エージェント、長文脈解析、テキスト、画像、ビデオ入力のためのマルチモーダル推論。
強力なコーディングサポート、256Kのコンテキスト、画像や映像入力を備えたムーンショットマルチモーダル推論。
ツール呼び出し、構造化出力、キャッシュサポート、128K出力を伴う長いコンテキスト推論。
参照画像をテクスチャ付きのGLBアセットに変換するイメージから3Dへの生成。

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Alibaba CloudMultimodal reasoner with 256K context, image and video input, function tools, structured JSON, and thinking on by default.

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

DeepSeekOfficial 0813 Pro release with major gains across coding, repository work, tool use, and agent tasks, plus hybrid thinking and a 1M context window.
Text-to-image plus multi-reference editing with up to three source images, selectable quality tiers, and 1K or 2K output resolution.

Meta AI画像理解、128Kのコンテキスト、ツール呼び出し、構造化出力、制御可能な推論力を備えたMetaオープン30Bエージェントモデル。

Z.aiCoding and agentic model with a 1M token context, 128K output, always-on reasoning at low, high, or max effort, native web search, and tool calling.

Z.ai1Mトークンコンテキスト、128Kの出力、調整可能な推論努力、ネイティブのウェブ検索、ツール呼び出しを備えた推論・コーディングモデル。

Moonshot AIKimi K3は、1Mトークンコンテキスト、常時稼働型思考、ネイティブウェブ検索、テキスト、画像、動画入力を備えたMoonshotの旗艦推論モデルです。

Meta AIMetaの更新されたフロンティア推論モデルは、1,048,576トークンのコンテキスト、画像、動画、音声、PDFの理解、ウェブ検索、ツール呼び出しを備えています。

Moonshot AIKimi K2.7 Codeは、Moonshotの兆パラメータエージェントコーディングモデルで、256Kのコンテキスト、常時オンの推論、テキスト、画像、ビデオ入力を備えています。

Meta AI1,048,576トークンのコンテキストに加え、画像、動画、音声、PDFの理解、ウェブ検索、ツール呼び出しを備えたメタフロンティア推論モデル。

Black Forest LabsApacheライセンスの4B FLUX.2 Klein画像生成・編集モデルで、text-to-image、参照画像編集、クリエイティブワークフローサポートを備えています。

Amazon画像生成と編集モデルをテキストや画像入力から画像を作成・修正し、インペインテインション、バーチャルトライオン、スタイルコントロールを備えています。

TencentマルチモーダルなMixture-of-Expertアーキテクチャ上のオープンソースtext-to-imageモデルで、フォトリアルなディテールと強力な多言語テキストレンダリングを備えています。

DeepSeekマルチモーダル理解と画像生成を一つのアーキテクチャに統合する、Janus Pro 7Bモデル上の自己回帰的フレームワーク。

Alibaba Cloudクラスリードの複雑なChinese/Englishテキストレンダリング、リアルなテクスチャ、多画像融合を備えた統一画像生成および編集モデル。

Alibaba CloudQwenの画像生成と編集(ベースおよびProバリアント)、多言語タイポグラフィ、マルチイメージ参照、そして制御可能な1Kまたは2K出力に対応しています。

Kling AIテキストからビデオへの変換とimage-to-video、720pまたは1080pで3秒から15秒間、アスペクト比とプロンプト制御付きで同期したネイティブ音声が提供されます。

Amazonテキストと任意の画像プロンプトから最大2分間のマルチショット動画を生成するビデオ生成モデルで、品質と一貫性が向上しています。

Alibaba Cloudテキストからビデオ、画像からビデオ、参照ビデオ、ビデオ編集の各モードを提供し、高忠実度でモーションスムースな出力を実現します。

Tencent8.3Bパラメータのビデオモデルで、ネイティブ720p出力(1080pまでアップスケーリング可能)、強いモーションコヒーレンス、そして最大10秒のバイリンガルプロンプト理解能力を持つ。

Kling AIスタンダードまたはプロモードでのビデオモデルで、テキストからビデオ、イメージからビデオ、参照ビデオ、編集、ネイティブサウンド、マルチシーントランジションに対応します。

Kling AIKling 3.0モデルで、リファレンス動画からリファレンス画像のキャラクターにモーションを転送するもので、標準720pとPro 1080pの両層があります。

ACE-Stepオープンソースの音楽生成モデルで、text-to-songおよび歌詞ガイド音声のための高速8ステップXLターボ推論による曲の制御可能な反復が可能です。

Inworldリアルタイム音声モデルで、平易な英語音声指示、100+言語にわたる一つの音声識別、200ms未満のストリーミングtime-to-first-audio。

Inworldサブ130ms TTFB 音声合成は、15 カ国語で 271 以上の音声、表現力のある音声、低レイテンシの音声エージェントのリアルタイム SSE ストリーミングに対応しています。

Inworld豊富な表現力豊かなプロッディ、15言語の271以上の音声、単語ごとのタイムスタンプによるリアルタイムのSSEストリーミング

MiniMaxGenerates complete stereo songs from lyrics and a style prompt, with duration, seed, and format controls up to 5 minutes.

Google低遅延text-to-speech、シングルスピーカーおよびマルチスピーカーの音声、コントロール可能なスタイル、アクセント、表現力豊かな本番アプリに対応しています。

DeepgramNova-3モデルを用いた音声・テキスト転写で、多言語対応と高度なカスタマイズ可能な設定を本番ワークロード向けに提供します。

OpenAIWhisper-1speech-to-text多言語監督付き音声で学習された文字起こしで、ファイルあたりアップロード制限は25MBです。

OpenAI制御されたWhisper Large v3ターボの文字起こしを多言語ASR、翻訳、VAD、タイムスタンプ、字幕、ホットワード、デコーダー制御付きで行います。

StepFunStepFunは中国語と英語の音声書き起こしのためのストリーミング音声認識モデルです。

Exa自然言語の質問に対する素早いLLMスタイルの回答で、新しいExaのウェブ検索結果に基づき、インライン引用とソースリンクを添えています。

Exaウェブ検索エンジンは、AIエージェント向けにオープンウェブ上でページ検索、類似ページの検索、クロール、専用コード検索を行っています。

Linkup初期結果が不十分でもクエリを続け、標準モードよりも包括的な回答を返す反復AI検索。

LinkupAI搭載のウェブ検索で、ディープサーチよりも速い詳細な概要と回答を提供します。OpenAI SimpleQAベンチマークで#1位にランクイン。

PerplexityClaude Opus 4.6の推論による機関レベルの調査、最大限の深さ、ツールへのアクセス強化、そして広範な情報源のカバー。

Perplexity複雑なテーマにわたる資料の自律的な検索、読解、評価を行う多段階の検索、統合、推論のための研究モデル。

MicrosoftTRELLIS.2 イメージツー-3Dモデルで、リファレンスイメージを解像度、シード、メッシュ、テクスチャ、エクスポートコントロールでテクスチャーされたGLBアセットに変えます。

DeemosRodin Gen-2 engine that turns a text prompt or up to five reference images into production 3D assets with PBR materials and quad or raw meshes.

Hitem3DProduction-focused image-to-3D with structure-aware textures, 1536 and 1536 Pro precision tiers, meshes up to two million faces, and five export formats.

Alibaba Cloud選択可能な出力寸法(64–2048)で埋め込まれる複数のテキスト。 入力あたり最大8,192トークン。

Alibaba CloudSpeed-optimised multimodal embedding, same shape as Vision-Plus, 3× cheaper image/video tokens.

Alibaba Cloudテキスト、画像、およびビデオ入力用の独立したベクトルを制作するマルチモーダル埋め込み。

ByteDanceMultimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.

Alibaba Cloudセマンティックドキュメントのリランク。1クエリあたり最大500の候補を関連性でソートし、100+言語をサポートし、カスタムソート命令も受け入れます。