コンテンツへスキップ

モデル詳細

glm-5.3-flashx

GLM 提供
従量課金

GLM-5.3-FlashXは、Z.aiのGLM-5.3-Flashの高速版で、最大200トークン/秒の推論速度を実現するネイティブマルチモーダルモデルです。同じハイブリッドスパースおよび線形アテンションアーキテクチャ(合計パラメータ数320B、アクティブパラメータ数18B)に基づいて構築されており、1Mトークンのコンテキストウィンドウを持つ効率的なコーディング、視覚的理解、および長期エージェントタスクに適しています。

モデル仕様

コンテキスト長
1M
最大出力
128K
入出力モダリティ
テキスト / 画像 / ファイル / 動画
リリース
2026-09

02

API エンドポイント

MixRoute 単一ゲートウェイ、OpenAI 互換

  • OpenAI-compatible /v1/chat/completions POST

03

料金

固定料金、単位: /1M Tokens

入力

$0.3700 /1M Tokens

生成

$1.2500 /1M Tokens

キャッシュ読み取り

$0.0750 /1M Tokens

05

選定サマリー

ワークロード適合性を素早く判断

このモデルは何に向いていますか?

テキスト生成モデル、入出力はテキスト、画像、動画、ファイル

glm-5.3-flashx はテキスト生成モデルです。仕様は、context window は 1,000,000 トークン、1 回の最大出力は 128,000 トークン。

使う前に何を確認すべきですか?

1,000,000 context、出力上限 128,000

glm-5.3-flashx の採用前に、標準入力は $0.37/100 万トークン、対応が宣言されている機能:ツール呼び出し、構造化出力、ストリーミング、プロンプトキャッシュ、画像入力、OpenAI SDK 互換。代表的なトラフィックで試験運用し、品質とレイテンシを確認してください。

なぜ MixRoute 経由で使うのですか?

glm-5.3-flashx はテキストと画像を同じ経路で受け付けます

テキストと画像の入力は同じ経路と同じキーで扱えます。MixRoute は OpenAI 互換エンドポイント /v1/chat/completions で glm-5.3-flashx を提供します。既存のクライアントは https://api.mixroute.ai/v1 とモデル ID glm-5.3-flashx に切り替えて、結合テストを再実行するだけです。

07

機能と互換性

未確認の機能は「Unknown」のまま、推測しません

利用可能:

ツール呼び出し

glm-5.3-flashxは関数呼び出しとツール呼び出しをサポートします。

例 tools定義を送信すると、応答としてtool_callsが返され、それを実行して結果をフィードバックします。
利用可能:

構造化された出力

glm-5.3-flashxは、必要に応じてJSON形式の出力を生成できます。

例 response_format: { type: "json_schema" }は有効なJSON出力を強制します。
利用可能:

ストリーミング配信

glm-5.3-flashxはストリーム応答をサポートしています。

例 stream: trueはトークンを段階的にストリーミングするため、チャットUIはトークンが到着するたびにレンダリングされます。
利用可能:

プロンプトのキャッシュ

glm-5.3-flashxは、サポートされているルーティング条件下でプロンプトのキャッシュをサポートします。

例 システムプロンプトとツール定義はリクエストの先頭に記述してください。プレフィックスが繰り返されると、キャッシュ読み取り料金が自動的に課金されます。
利用可能:

視覚入力

glm-5.3-flashxはテキストと同時に画像入力を処理できます。

例 テキストメッセージとともに、base64エンコードされた画像をimage_urlコンテンツパートに渡します。
利用可能:

OpenAI SDK

MixRouteのOpenAI互換エンドポイントを介してglm-5.3-flashxを呼び出します。

例 base_url を https://api.mixroute.ai/v1 に変更します。その他はすべて OpenAI のスタイルに従います。

08

トークンコスト見積もり

このページの料金に基づく見積もりで、実請求ではありません

同一プレフィックスが繰り返し読み取られる入力の割合(最大100%)

09

FAQ

推論トークンは、glm-5.3-flashxの出力として、$1.25/100万トークンで課金されます。これらは表示される回答の前に生成され、レイテンシとコストの両方にカウントされるため、最終的な回答が短い場合でも、推論設定が高いほどコストが高くなります。

単一エンドポイントで検証可能な判断

同じリクエスト形式でこのモデルと代替ルートをテスト

実際のワークロードから始め、品質、総コスト、障害条件を基に本番トラフィックを送るか判断します。