GLM-5.2は、Z.aiの主力推論とコーディングモデルで、2026年6月13日にリリースされました。 調整可能な推論力で one-million-token コンテキストウィンドウをペアリングするので、モデルが応答する前にどれだけ難しいかをダイヤルし、組み込みのWeb検索とツールコールで出荷できます。 Z.aiは、強力な汎用推論を維持し、複雑でマルチステップのエンジニアリング作業のための最大限の推論努力を推薦するコーディングファーストモデルとしてそれを置く.
GLM-5.2 は、OpenAI 互換 API を介して、テキスト入力と出力、1M トークンコンテキスト、最大 128K の出力トークン、関数呼び出し、JSON モード構造化された出力、およびストリーミングを通じて、EmpirioLabs 上で動作します。 お問い合わせ プレイグラウンド または、OpenAI対応のクライアントから呼び出す。 フルスペックと現在のレートは、 GLM-5.2モデルページ そして、 API ドキュメントお問い合わせ.
料金について
請求は利用量に基づいており、入力トークンと出力トークンはトークンごとに計量され、組み込みのウェブ検索ごとにわずかな通話料金が加算されますが、これは検索が実際に実行された場合にのみ適用されます。別にキャッシュティアはありません。現在のトークンあたりのレートは常に モデルページ そして、 プライシングページ、あなたが請求したものと同期して滞在する.
クイックスタート
EmpirioLabs ベース URL で OpenAI SDK をポイントし、パス お問い合わせ モデルとして:
openai のインポートから OpenAI クライアント = OpenAI(base url=" https://api.empiriolabs.ai/v1", api key="YOUR EMPIRIOLABS API KEY") 再指定 = client.chat.completions.create(model=" glm-5-2 ", message=[ {"role": "user", "content": "この Python ループをリストの理解にリファクタリングして、なぜ説明するのか"、 、 、 、 コンテンツの検索結果は です
働き方改革
GLM-5.2 ネイティブを公開 理由 努力 レベルからの制御 最小限 まで マックス、プラス なし 考えを完全にオフにする。 デフォルトは マックスZ.aiが複雑なコーディングを推薦する。 より速く、より安いのための努力は簡単な回転に、または置きます enable thinking を使う 最小レイテンシパスの false へ。 モデルが考えると、解答と一緒に推論が返され、表示したり隠したりすることができます.
ウェブ検索
セット お問い合わせ gLM-5.2 がライブ結果をその答えに引き出すようにする。 このモデルは、検索時に決定します。, 使用するものを引用します。, 検索が実行したときにのみ、コール当たりの手数料が適用されます. 完全にオフラインの推論のためにそれを残す.
よく知る
厳密な構造化された出力のために、モデルが引きつけられた推論の跡なしできれいなJSONを戻すように、身につけられる考えと動かして下さい。 GLM-5.2 はテキスト入力とテキストアウトです。画像やビデオの理解のために、マルチモーダルモデルを選択します カタログ. one-million-token 文脈は、大きなコードベース、長いトランスクリプト、複数のファイルレファクタを単一のリクエストで快適に保持します.



