模型详情
glm-5.3-flashx
GLM-5.3-FlashX 是 Z.ai 的 GLM-5.3-Flash 的高速版本,它是一个原生多模态模型,推理速度高达 200 个 tokens/s。它基于相同的混合稀疏和线性注意力架构(320B 个总参数,18B 个激活参数),适用于高效编码、视觉理解以及具有 1M 个 token context window 的长时域智能体任务。
模型规格
- 上下文长度
- 1M
- 最大输出
- 128K
- 输入/输出模态
- 文本 / 图像 / 文件 / 视频
- 发布日期
- 2026-09
02
API 端点
单一 MixRoute 网关,OpenAI 兼容
-
OpenAI-compatible
/v1/chat/completionsPOST
03
价格
固定费率,单位:/1M Tokens
输入
$0.3700 /1M Tokens
补全
$1.2500 /1M Tokens
缓存读取
$0.0750 /1M Tokens
05
选型摘要
快速判断是否适合你的工作负载
这个模型适合什么?
文本生成模型,输入输出包含文本、图像、视频、文件
glm-5.3-flashx 是文本生成模型。规格上,context window 为 1,000,000 个 Token,单次最多输出 128,000 个 Token。
使用前应检查什么?
1,000,000 context,输出上限 128,000
采用 glm-5.3-flashx 前,标准输入费率为 $0.37/100 万 Token;已声明支持工具调用、结构化输出、流式输出、提示词缓存、视觉输入、OpenAI SDK 兼容。建议先以具有代表性的流量试跑,确认质量与延迟。
为什么通过 MixRoute 使用?
glm-5.3-flashx 以同一条路由接收文本与图像
文本与图像输入共用同一条路由与同一组密钥。MixRoute 以 OpenAI 兼容端点 /v1/chat/completions 提供 glm-5.3-flashx;既有客户端只需指向 https://api.mixroute.ai/v1 并把模型 ID 换成 glm-5.3-flashx,再跑一次集成测试即可。
07
能力与兼容性
未确认的能力保持“Unknown”,不做猜测
工具调用
glm-5.3-flashx 支持函数调用与工具调用。
tools 定义;响应会返回 tool_calls,执行后再把结果送回模型。
结构化输出
glm-5.3-flashx 可以按需生成 JSON 格式的输出。
response_format: { type: "json_schema" } 可强制输出有效的 JSON。
流式输出
glm-5.3-flashx 支持流式响应。
stream: true 会逐步流式返回 Token,聊天界面可以边接收边渲染。
提示缓存
glm-5.3-flashx 在支持的路由条件下可以使用提示缓存。
视觉输入
glm-5.3-flashx 可以同时处理图像与文本输入。
image_url 内容块中传入 base64 编码的图片,与文本消息一起发送。
OpenAI SDK
通过 MixRoute 的 OpenAI 兼容端点调用 glm-5.3-flashx。
base_url 改为 https://api.mixroute.ai/v1;其余部分遵循 OpenAI 风格。
08
Token 成本估算
基于本页价格的实时估算,非实际账单
同一前缀被重复读取的输入占比,最高 100%
09
FAQ
推理 Token 作为 glm-5.3-flashx 的输出计费,计费点为 $1.25/100 万 Token。它们在显示答案之前生成,并计入延迟和费用,因此即使最终答案很短,更高的推理设置也会增加成本。
单一端点,可验证的决策
使用相同的请求格式测试此模型和备用路由
从真实工作负载开始,再由质量、总成本和故障条件决定是否接入生产流量。