模型详情
GPT-5.6 Luna
GPT-5.6 Luna 是 OpenAI GPT-5.6 系列中侧重速度与成本的模型,适合聊天、分类和轻量级智能体工作流等高吞吐、低延迟任务,并在其价格区间内提供强大的推理能力。
模型规格
- 上下文长度
- 1.05M
- 最大输出
- 128K
- 输入/输出模态
- 文本 / 图像
- 发布日期
- 2026-07
02
API 端点
单一 MixRoute 网关,OpenAI 兼容
-
OpenAI-compatible
/v1/chat/completionsPOST
03
阶梯价格
单位:/1M Tokens
| 档位 | 输入 /1M Tokens | 输出 /1M Tokens | 缓存读取 /1M Tokens | 缓存写入 /1M Tokens |
|---|---|---|---|---|
| standard Length ≤ 272K | $0.2000 | $1.2000 | $0.0200 | $0.2500 |
| long_context Length > 272K | $0.4000 | $1.8000 | $0.0400 | $0.5000 |
05
选型摘要
快速判断是否适合你的工作负载
最适合
适合长上下文且注重成本的工作负载
当任务涉及大型文档、长代码库或多步骤研究时,可将此模型加入同条件测试候选列表,再根据实际质量、延迟和总成本决定是否上线。
为什么选择 MixRoute
在同一端点切换到其他模型
保持 OpenAI 兼容格式,只需更改模型 ID;需要故障转移或基于成本的路由时,可使用 MixRoute 的统一路由。
model: "gpt-5.6-terra" 改为 model: "gpt-5.6-luna",其余代码保持不变
成本定位
同级模型中价格低于平均水平;长输出时优势会缩小
与同级模型的中位价格相比,该模型的输入价格明显更低;输出占比较高的任务会缩小总成本差距,因此请使用下方估算器按自己的输入输出比例进行确认。
06
速率限制与容量
基准配额;以 Console 为准
每分钟请求数(RPM)
5,000 / min
此模型每个 API 密钥的请求速率上限;超出后返回 429
每分钟 Token 数(TPM)
4M tokens / min
输入与输出 Token 合计;随套餐等级而异,可按需申请提高
遇到 429 时自动故障转移
提供商触发速率限制时,流量会自动切换到其他可用通道;客户端无需自行实现重试逻辑
07
能力与兼容性
未确认的能力保持“Unknown”,不做猜测
工具调用
支持函数和工具调用
tools 定义;响应会返回 tool_calls,执行后再将结果传回模型
结构化输出
可要求模型输出 JSON 格式
response_format: { type: "json_schema" } 可强制输出有效 JSON
流式输出
支持流式响应
stream: true 会逐步流式返回 Token,使聊天界面可以边接收边显示
提示词缓存
取决于提供商和路由条件
视觉输入
官方能力数据尚未确认,目前标记为未知
OpenAI SDK
可通过 MixRoute 的兼容端点调用
base_url 改为 https://api.mixroute.ai/v1;其余部分遵循 OpenAI 风格
08
Token 成本估算
基于本页价格的实时估算,非实际账单
同一前缀被重复读取的输入占比,最高 100%
09
FAQ
缓存读取价格为每 100 万 Token $0.0200,仅为 $0.2000 输入价格的十分之一;缓存写入价格则为 $0.2500,比输入本身高 25%。这意味着,如果一个提示词只写入一次便不再复用,成本反而更高。判断标准是同一前缀会被再次读取多少次——每次请求都会发送的内容,例如系统提示词、工具定义和固定知识,适合缓存;一次性的长文档则不适合。在全面启用前,先衡量请求中重复前缀所占比例,再决定是否开启缓存。
单一端点,可验证的决策
使用相同的请求格式测试此模型和备用路由
从真实工作负载开始,再由质量、总成本和故障条件决定是否接入生产流量。