模型詳情
GPT-5.6 Luna
GPT-5.6 Luna 是 OpenAI GPT-5.6 系列中著重速度與成本的模型,適合聊天、分類及輕量級 AI 代理工作流程等高吞吐、低延遲工作負載,並在其價格區間內提供出色的推理能力。
模型規格
- 上下文長度
- 1.05M
- 最大輸出
- 128K
- 輸入/輸出模態
- 文字 / 圖片
- 發布日期
- 2026-07
02
API 端點
單一 MixRoute 閘道,OpenAI 相容
-
OpenAI-compatible
/v1/chat/completionsPOST
03
階梯價格
單位:/1M Tokens
| 檔位 | 輸入 /1M Tokens | 輸出 /1M Tokens | 快取讀取 /1M Tokens | 快取寫入 /1M Tokens |
|---|---|---|---|---|
| standard Length ≤ 272K | $0.2000 | $1.2000 | $0.0200 | $0.2500 |
| long_context Length > 272K | $0.4000 | $1.8000 | $0.0400 | $0.5000 |
05
選型摘要
快速判斷是否適合你的工作負載
最適合
適合長上下文且重視成本的工作負載
當任務涉及大型文件、長程式碼庫或多步驟研究時,可將此模型加入同條件測試候選清單,再依實際品質、延遲與總成本決定是否上線。
為何選擇 MixRoute
在同一端點切換至其他模型
維持 OpenAI 相容格式,只需變更模型 ID;需要容錯移轉或以成本為依據的路由時,可使用 MixRoute 的統一路由。
model: "gpt-5.6-terra" 改為 model: "gpt-5.6-luna",其餘程式碼保持不變
成本定位
同級模型中價格低於平均;長輸出時優勢會縮小
相較於同級模型的中位價格,此模型的輸入價格明顯較低;輸出占比較高的任務會縮小總成本差距,因此請使用下方估算器依自己的輸入輸出比例確認。
06
速率限制與容量
基準配額;以 Console 為準
每分鐘請求數(RPM)
5,000 / min
此模型每個 API 金鑰的請求速率上限;超出後會回傳 429
每分鐘 Token 數(TPM)
4M tokens / min
輸入與輸出 Token 合計;依方案層級而異,可按需求申請提高
遇到 429 時自動容錯移轉
供應商觸發速率限制時,流量會自動切換至其他可用通道;用戶端不需要自行實作重試邏輯
07
能力與相容性
未確認的能力保持「Unknown」,不做猜測
工具呼叫
支援函式與工具呼叫
tools 定義;回應會傳回 tool_calls,執行後再將結果送回模型
結構化輸出
可要求模型輸出 JSON 格式
response_format: { type: "json_schema" } 可強制輸出有效 JSON
串流輸出
支援串流回應
stream: true 會逐步串流傳回 Token,讓聊天介面可以邊接收邊顯示
提示詞快取
取決於供應商與路由條件
視覺輸入
官方能力資料尚未確認,目前標示為未知
OpenAI SDK
可透過 MixRoute 的相容端點呼叫
base_url 改為 https://api.mixroute.ai/v1;其餘部分遵循 OpenAI 風格
08
Token 成本估算
基於本頁價格的即時估算,非實際帳單
同一前綴被重複讀取的輸入占比,最高 100%
09
FAQ
快取讀取價格為每 100 萬 Token $0.0200,僅為 $0.2000 輸入價格的十分之一;快取寫入價格則為 $0.2500,比輸入本身高 25%。這表示若提示詞只寫入一次便不再重複使用,成本反而更高。判斷標準是同一前綴會被再次讀取多少次——每次請求都會送出的內容,例如系統提示詞、工具定義與固定知識,適合快取;一次性的長文件則不適合。全面啟用前,先衡量請求中重複前綴的比例,再決定是否開啟快取。
單一端點,可驗證的決策
使用相同的請求格式測試此模型與替代路由
從真實工作負載開始,再由品質、總成本與故障條件決定是否導入正式環境流量。