跳至内容

模型详情

GPT-5.6 Luna

由 OpenAI 提供
按量付费 动态计价 2 个档位

GPT-5.6 Luna 是 OpenAI GPT-5.6 系列中侧重速度与成本的模型,适合聊天、分类和轻量级智能体工作流等高吞吐、低延迟任务,并在其价格区间内提供强大的推理能力。

模型规格

上下文长度
1.05M
最大输出
128K
输入/输出模态
文本 / 图像
发布日期
2026-07

02

API 端点

单一 MixRoute 网关,OpenAI 兼容

  • OpenAI-compatible /v1/chat/completions POST

03

阶梯价格

单位:/1M Tokens

档位 输入 /1M Tokens 输出 /1M Tokens 缓存读取 /1M Tokens 缓存写入 /1M Tokens
standard Length ≤ 272K $0.2000 $1.2000 $0.0200 $0.2500
long_context Length > 272K $0.4000 $1.8000 $0.0400 $0.5000

05

选型摘要

快速判断是否适合你的工作负载

最适合

适合长上下文且注重成本的工作负载

当任务涉及大型文档、长代码库或多步骤研究时,可将此模型加入同条件测试候选列表,再根据实际质量、延迟和总成本决定是否上线。

示例 在一次请求中输入一份 300 页的英文研究报告(约 250K Token),并生成逐章摘要和风险清单

为什么选择 MixRoute

在同一端点切换到其他模型

保持 OpenAI 兼容格式,只需更改模型 ID;需要故障转移或基于成本的路由时,可使用 MixRoute 的统一路由。

示例 在请求中将 model: "gpt-5.6-terra" 改为 model: "gpt-5.6-luna",其余代码保持不变

成本定位

同级模型中价格低于平均水平;长输出时优势会缩小

与同级模型的中位价格相比,该模型的输入价格明显更低;输出占比较高的任务会缩小总成本差距,因此请使用下方估算器按自己的输入输出比例进行确认。

示例 一次请求包含 100K 输入和 10K 输出:Luna 约 $0.03,Grok 4.5 约 $0.26,Kimi K3 约 $0.45(按当前首档价格估算)

06

速率限制与容量

基准配额;以 Console 为准

可用:

每分钟请求数(RPM)

5,000 / min

此模型每个 API 密钥的请求速率上限;超出后返回 429

可用:

每分钟 Token 数(TPM)

4M tokens / min

输入与输出 Token 合计;随套餐等级而异,可按需申请提高

可用:

遇到 429 时自动故障转移

提供商触发速率限制时,流量会自动切换到其他可用通道;客户端无需自行实现重试逻辑

示例 高峰期主通道返回 429 时,系统会立即通过备用通道重新发送;响应不受影响,并按相同费率计费

07

能力与兼容性

未确认的能力保持“Unknown”,不做猜测

可用:

工具调用

支持函数和工具调用

示例 发送 tools 定义;响应会返回 tool_calls,执行后再将结果传回模型
可用:

结构化输出

可要求模型输出 JSON 格式

示例 response_format: { type: "json_schema" } 可强制输出有效 JSON
可用:

流式输出

支持流式响应

示例 stream: true 会逐步流式返回 Token,使聊天界面可以边接收边显示
有条件可用:

提示词缓存

取决于提供商和路由条件

示例 将系统提示词和工具定义放在请求开头;重复前缀会自动按缓存读取价格计费
未知:

视觉输入

官方能力数据尚未确认,目前标记为未知

可用:

OpenAI SDK

可通过 MixRoute 的兼容端点调用

示例 base_url 改为 https://api.mixroute.ai/v1;其余部分遵循 OpenAI 风格

08

Token 成本估算

基于本页价格的实时估算,非实际账单

同一前缀被重复读取的输入占比,最高 100%

09

FAQ

缓存读取价格为每 100 万 Token $0.0200,仅为 $0.2000 输入价格的十分之一;缓存写入价格则为 $0.2500,比输入本身高 25%。这意味着,如果一个提示词只写入一次便不再复用,成本反而更高。判断标准是同一前缀会被再次读取多少次——每次请求都会发送的内容,例如系统提示词、工具定义和固定知识,适合缓存;一次性的长文档则不适合。在全面启用前,先衡量请求中重复前缀所占比例,再决定是否开启缓存。

单一端点,可验证的决策

使用相同的请求格式测试此模型和备用路由

从真实工作负载开始,再由质量、总成本和故障条件决定是否接入生产流量。