模型詳情
glm-5.3-flashx
GLM-5.3-FlashX 是 Z.ai 的 GLM-5.3-Flash 的高速版本,它是一個原生多模態模型,推理速度高達 200 個 tokens/s。它基於相同的混合稀疏和線性注意力架構(320B 個總參數,18B 個激活參數),適用於高效程式撰寫、視覺理解以及具有 1M 個 token 上下文視窗的長時域智能體任務。
模型規格
- 上下文長度
- 1M
- 最大輸出
- 128K
- 輸入/輸出模態
- 文字 / 圖片 / 檔案 / 影片
- 發布日期
- 2026-09
02
API 端點
單一 MixRoute 閘道,OpenAI 相容
-
OpenAI-compatible
/v1/chat/completionsPOST
03
價格
固定費率,單位:/1M Tokens
輸入
$0.3700 /1M Tokens
補全
$1.2500 /1M Tokens
快取讀取
$0.0750 /1M Tokens
05
選型摘要
快速判斷是否適合你的工作負載
這個模型適合什麼?
文字生成模型,輸入輸出包含文字、圖像、影片、檔案
glm-5.3-flashx 是文字生成模型。規格上,context window 為 1,000,000 個 Token,單次最多輸出 128,000 個 Token。
使用前應檢查什麼?
1,000,000 context,輸出上限 128,000
採用 glm-5.3-flashx 前,標準輸入費率為 $0.37/100 萬 Token;已宣告支援工具呼叫、結構化輸出、串流輸出、提示詞快取、視覺輸入、OpenAI SDK 相容。建議先以具代表性的流量試跑,確認品質與延遲。
為什麼透過 MixRoute 使用?
glm-5.3-flashx 以同一條路由收文字與圖像
文字與圖像輸入共用同一條路由與同一組金鑰。MixRoute 以 OpenAI 相容端點 /v1/chat/completions 提供 glm-5.3-flashx;既有用戶端只要指向 https://api.mixroute.ai/v1 並把模型 ID 換成 glm-5.3-flashx,再跑一次整合測試即可。
07
能力與相容性
未確認的能力保持「Unknown」,不做猜測
工具呼叫
glm-5.3-flashx 支援函式與工具呼叫。
tools 定義;回應會傳回 tool_calls,執行後再將結果送回模型。
結構化輸出
glm-5.3-flashx 可要求輸出 JSON 格式。
response_format: { type: "json_schema" } 可強制輸出有效 JSON。
串流輸出
glm-5.3-flashx 支援串流回應。
stream: true 會逐步串流傳回 Token,讓聊天介面邊接收邊顯示。
提示詞快取
glm-5.3-flashx 在支援的路由條件下可使用提示詞快取。
視覺輸入
glm-5.3-flashx 可處理圖片輸入與文字並行。
image_url 內容區塊中傳入 base64 編碼的圖片,與文字訊息一起發送。
OpenAI SDK
透過 MixRoute 的 OpenAI 相容端點呼叫 glm-5.3-flashx。
base_url 改為 https://api.mixroute.ai/v1;其餘部分遵循 OpenAI 風格。
08
Token 成本估算
基於本頁價格的即時估算,非實際帳單
同一前綴被重複讀取的輸入占比,最高 100%
09
FAQ
台灣企業採購 glm-5.3-flashx 的費用可以開立台灣統一發票,並打上貴公司統編。發票由 MixRoute 的台灣公司開立,不是海外主體的商業發票。適用的是企業方案採購,付款主要走銀行電匯,帳期可以談。開立前提供貴公司的統編與抬頭即可,金額依 glm-5.3-flashx 在 /v1/chat/completions 的實際用量計算,輸入 $0.3700/1M tokens,輸出 $1.2500/1M tokens。自助儲值的開票方式與台灣以外市場的條件尚未確認,請洽 Sales。
單一端點,可驗證的決策
使用相同的請求格式測試此模型與替代路由
從真實工作負載開始,再由品質、總成本與故障條件決定是否導入正式環境流量。