跳至主要內容

模型詳情

GPT-5.6 Luna

由 OpenAI 提供
隨用隨付 動態計價 2 個級距

GPT-5.6 Luna 是 OpenAI GPT-5.6 系列中著重速度與成本的模型,適合聊天、分類及輕量級 AI 代理工作流程等高吞吐、低延遲工作負載,並在其價格區間內提供出色的推理能力。

模型規格

上下文長度
1.05M
最大輸出
128K
輸入/輸出模態
文字 / 圖片
發布日期
2026-07

02

API 端點

單一 MixRoute 閘道,OpenAI 相容

  • OpenAI-compatible /v1/chat/completions POST

03

階梯價格

單位:/1M Tokens

檔位 輸入 /1M Tokens 輸出 /1M Tokens 快取讀取 /1M Tokens 快取寫入 /1M Tokens
standard Length ≤ 272K $0.2000 $1.2000 $0.0200 $0.2500
long_context Length > 272K $0.4000 $1.8000 $0.0400 $0.5000

05

選型摘要

快速判斷是否適合你的工作負載

最適合

適合長上下文且重視成本的工作負載

當任務涉及大型文件、長程式碼庫或多步驟研究時,可將此模型加入同條件測試候選清單,再依實際品質、延遲與總成本決定是否上線。

範例 在單次請求中輸入一份 300 頁的英文研究報告(約 250K Token),並產生逐章摘要與風險清單

為何選擇 MixRoute

在同一端點切換至其他模型

維持 OpenAI 相容格式,只需變更模型 ID;需要容錯移轉或以成本為依據的路由時,可使用 MixRoute 的統一路由。

範例 在請求中將 model: "gpt-5.6-terra" 改為 model: "gpt-5.6-luna",其餘程式碼保持不變

成本定位

同級模型中價格低於平均;長輸出時優勢會縮小

相較於同級模型的中位價格,此模型的輸入價格明顯較低;輸出占比較高的任務會縮小總成本差距,因此請使用下方估算器依自己的輸入輸出比例確認。

範例 單次請求包含 100K 輸入與 10K 輸出:Luna 約 $0.03,Grok 4.5 約 $0.26,Kimi K3 約 $0.45(依目前首檔價格估算)

06

速率限制與容量

基準配額;以 Console 為準

可用:

每分鐘請求數(RPM)

5,000 / min

此模型每個 API 金鑰的請求速率上限;超出後會回傳 429

可用:

每分鐘 Token 數(TPM)

4M tokens / min

輸入與輸出 Token 合計;依方案層級而異,可按需求申請提高

可用:

遇到 429 時自動容錯移轉

供應商觸發速率限制時,流量會自動切換至其他可用通道;用戶端不需要自行實作重試邏輯

範例 尖峰時段主要通道回傳 429 時,系統會立即透過備援通道重新送出;回應不受影響,並以相同費率計費

07

能力與相容性

未確認的能力保持「Unknown」,不做猜測

可用:

工具呼叫

支援函式與工具呼叫

範例 傳送 tools 定義;回應會傳回 tool_calls,執行後再將結果送回模型
可用:

結構化輸出

可要求模型輸出 JSON 格式

範例 response_format: { type: "json_schema" } 可強制輸出有效 JSON
可用:

串流輸出

支援串流回應

範例 stream: true 會逐步串流傳回 Token,讓聊天介面可以邊接收邊顯示
有條件可用:

提示詞快取

取決於供應商與路由條件

範例 將系統提示詞與工具定義放在請求開頭;重複前綴會自動依快取讀取價格計費
未知:

視覺輸入

官方能力資料尚未確認,目前標示為未知

可用:

OpenAI SDK

可透過 MixRoute 的相容端點呼叫

範例 base_url 改為 https://api.mixroute.ai/v1;其餘部分遵循 OpenAI 風格

08

Token 成本估算

基於本頁價格的即時估算,非實際帳單

同一前綴被重複讀取的輸入占比,最高 100%

09

FAQ

快取讀取價格為每 100 萬 Token $0.0200,僅為 $0.2000 輸入價格的十分之一;快取寫入價格則為 $0.2500,比輸入本身高 25%。這表示若提示詞只寫入一次便不再重複使用,成本反而更高。判斷標準是同一前綴會被再次讀取多少次——每次請求都會送出的內容,例如系統提示詞、工具定義與固定知識,適合快取;一次性的長文件則不適合。全面啟用前,先衡量請求中重複前綴的比例,再決定是否開啟快取。

單一端點,可驗證的決策

使用相同的請求格式測試此模型與替代路由

從真實工作負載開始,再由品質、總成本與故障條件決定是否導入正式環境流量。