GLM 5.3 Flashは、Z.aiのGLM-5ファミリーにおける初のネイティブマルチモーダルモデルであり、2026年8月26日にMITライセンスのもとでリリースされました。以前のプレビューはOx Alphaでした。これはマルチモーダルコーパス上で訓練された320B-A18Bmixture-of-expertsで、Z.ai はコーディングおよびエージェントベンチマークでGLM 5.2をはるかに低コストで上回る性能を示し、はるかに大規模なフロンティア符号化モデルに近い結果を報告しています。
GLM 5.3 Flashは本日、OpenAI互換APIを通じてEmpirioLabs上で稼働しており、テキスト、画像、動画、ファイル入力、1Mトークンコンテキスト、最大128Kの出力トークン、関数呼び出し、JSONモード構造化出力、組み込みウェブ検索、ストリーミング機能を備えています。試してみて プレイグラウンド または、OpenAI対応のクライアントから呼び出す。 フルスペックと現在のレートは、 GLM 5.3 フラッシュモデルページ そして、 API ドキュメントお問い合わせ.
料金について
請求は利用量に基づいており、入力トークンと出力トークンはトークンごとに計量され、組み込みのウェブ検索ごとにわずかな通話料金が加算されますが、これは検索が実際に実行された場合にのみ適用されます。別にキャッシュティアはありません。現在のトークンあたりのレートは常に モデルページ そして、 プライシングページ、あなたが請求したものと同期して滞在する.
クイックスタート
EmpirioLabs ベース URL で OpenAI SDK をポイントし、パス glm-5-3-flash モデルとして:
openaiからインポート OpenAIクライアント = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "このビルドログのスクリーンショットで何が失敗している?"}, {"type": "image_url", "image_url": {"url": "https://example.com/build-log.png"}}, ], ], reasoning_effort="low",) print(resp.choices[0].message.content)
同じモデルIDで動作します お問い合わせ、人形をした お問い合わせ、そしてGoogle互換 /v1beta/models/glm-5-3-flash:コンテンツ生成 ルート。代替IDについて glm-5.3-flash, zai/glm-5.3-flash、および zhipu/glm-5.3-flash 同じモデルに対処してください。
マルチモーダル入力
画像、動画、ファイルは標準のコンテンツパーツ配列に乗っています: image_url 画像については、 video_url ビデオの場合、 file_url 書類のために。公開HTTPSのURL(推奨)かbase64のデータURLを渡してください。Z.ai モデルをエージェント的ビジョン作業に位置づけます。インターフェース、レンダリング出力、インタラクションフィードバックを読み取ることができ、コード、ブラウザ、GUI間のループを閉じます。
働き方改革
GLM 5.3 Flashはネイティブを露出します 理由 努力 3段階の操作: ロー 軽い推論のために、 高く 推論力を高めるために、 マックス 深い理屈のために。デフォルトは マックスこれは Z.ai が複雑な符号化や長期的なエージェント作業に推奨している方法です。降格 ロー 短時間の遅延に敏感なターンです。
ウェブ検索とツール
セット お問い合わせ から 確かに モデルがウェブを検索してから答え、結果を絞り込むために search_recency_filter, search_domain_filter、および カウント.関数呼び出しは標準のOpenAIを使用しています ツール 配列、 tool_stream ツールコールの引数は生成されるたびにストリーム化します。
最初の電話の前に知っておくべきこと
- 理性は止められないので、常に出力の一部です。
理由 努力ただ受け入れるロー,高く、およびマックス.異なるレベルを求めるリクエストや思考を無効化するリクエストは、失敗せず最も近いサポートレベルで提供されるため、他のGLMモデル向けに書かれたコードは動作し続けます。推論トークンは出力トークンとして請求され、マックスたった一言の返事でも、出力予算の大半を考えることに費やされてしまうので、送信してくださいロー明示的に些細なコールに対して。 - 構造化出力はスキーマ強制ではなくJSONモードです。 使用方法
response_formatお問い合わせ{"type": "json_object"}そして、プロンプトで欲しいフィールドを説明してください。JSONスキーマの提供は受け入れられますが強制されるわけではないので、形状を仮定するのではなく、自分の側で結果を検証してください。 - メディアパーツはサービスが取得できるURLであるべきです。 モデルは
image_url,video_url、およびfile_url自身をターゲットにするため、ログインやプライベートネットワークの背後にあるURLはリクエストに失敗します。メディアが公開されていない場合は、代わりにbase64データURLとしてインライン化してください。
次にどこへ行くべきか
開く プレイグラウンド コードを書かずにGLM 5.3フラッシュを試すには、 API参照 パラメータリストの全内容については、または モデルカタログ 他のラインナップと比較するために。



