GPT API 定价:输入、缓存、输出与长上下文
GPT API 的费用是各项 token 计费项的精确之和——新鲜输入、缓存输入、缓存写入和输出,每一项都按实际处理请求的模型层级费率计价。本文拆解 GPT-5.6 Sol、Terra、Luna 的完整费率表、真正拉动账单的缓存与长上下文倍率,以及 apiToken.sale 固定五折在结算环节生效的位置。
·
GPT API 账单到底怎么算
GPT API 按 token 计量,而不是按请求一口价。每次调用都会把你发送的 token——系统提示词、对话历史、工具定义、检索到的文档——按输入费率计费,再把模型生成的 token 按另一个更高的输出费率计费。没有按请求收费,没有席位许可,也没有最低消费:token 数量乘以模型费率,就是一次调用的精确成本。
一个 token 大约相当于四个英文字符,约四分之三个单词。代码、JSON 和非拉丁文字的分词密度更高,所以同样字数的源码文件比散文更费 token。输出更贵的原因很机械:输入是一次性并行处理的,而每个输出 token 都要模型单独跑一遍前向计算。
这些都用不着你按字符数去估。响应里的 usage 对象会精确报告一次调用消耗了多少 token,并按费率表的计费项拆开:
"usage": {
"prompt_tokens": 40210,
"completion_tokens": 1834,
"total_tokens": 42044,
"prompt_tokens_details": { "cached_tokens": 32000 }
}以 gpt-5.6-sol 的临时官方费率为例:输入每百万 token $4,缓存输入每百万 $0.40,缓存写入每百万 $5,输出每百万 $20。上面这次调用的成本是 8,210 × $4/M 新鲜输入 + 32,000 × $0.40/M 缓存输入 + 1,834 × $20/M 输出 = $0.08232(官方价)——在本站固定五折之后是 $0.04116。这是基于权威 usage 数字的算术,所以做预算时以 usage 对象为准,而不是以提示词字符串的长度为准。
GPT-5.6 费率表:Sol、Terra、Luna
| 模型 | 官方输入 / 缓存 / 缓存写入 / 输出 | 本站五折后价格 |
|---|---|---|
| gpt-5.6-sol | $4 / $0.40 / $5 / $20 | $2 / $0.20 / $2.50 / $10 |
| gpt-5.6-terra | $2 / $0.20 / $2.50 / $12 | $1 / $0.10 / $1.25 / $6 |
| gpt-5.6-luna | $0.20 / $0.02 / $0.25 / $1.20 | $0.10 / $0.01 / $0.125 / $0.60 |
以上均为每百万 token 的价格。Sol 的临时官方促销价有效至 2026-11-21(含当日);自 2026-11-22 UTC 起恢复标准输入 $5、输出 $30。gpt-5.6 是 gpt-5.6-sol 的别名,价格相同,并非另一套费率——在两个模型 ID 之间切换不会改变账单。
层级之间的价差是 GPT 开销里最大的杠杆。按临时费率,Terra 输入是 Sol 的 50%,输出是 60%;Luna 则分别是 5% 和 6%。把每个任务路由到能胜任它的最弱层级——分类、抽取和路由交给 Luna,日常编码和生产聊天交给 Terra,最难的推理交给 Sol——省下的钱超过任何提示词压缩手段;而五折对所有计费项一视同仁,不会改变这个排序。
缓存读取按 10%,缓存写入按 125%
当重复的提示词前缀命中提供商的缓存时,这部分 token 会作为独立的缓存输入计费项结算,费率是普通输入的 10%——促销期 Sol 上是每百万 $0.40 而不是 $4。但存储前缀并不免费:GPT-5.6 的缓存写入按普通输入的 125% 计费,促销期 Sol 为每百万 $5,所以第一次调用要付一点溢价,之后每次命中几乎免费。哪怕只重复读取一次也是赚的:1.25 倍加 0.10 倍,仍然低于两次全价输入。
- 终态 usage 对象决定哪些 token 算缓存命中;同一个 token 绝不会同时按缓存输入和新鲜输入重复收费。
- 把稳定内容——系统提示词、工具定义、大型参考文件——放在提示词最前面;缓存按前缀匹配,不按片段匹配。
- 修改缓存前缀的中间部分会让改动点之后的全部内容失效,下次调用要为这段尾巴重新支付全价输入。
- 多轮智能体自动受益:每一轮都会把累积的对话作为输入重发,未改动的早期轮次会以缓存 token 计费。
最经典的缓存杀手是提示词顶部的易变数据——时间戳、请求 ID、随机种子。把所有随调用变化的内容挪到消息列表末尾,否则每个请求都会变成一次 125% 费率的全新缓存写入,廉价读取一次也捞不到。
272K 长上下文的价格悬崖
输入超过 272K token 后,GPT 长上下文费率会对整个请求生效:输入 2 倍、输出 1.5 倍,而不只是超出边界的那部分 token。这个跳变陡到必须在规划时考虑:一个刚好低于阈值的请求和一个刚好超过的请求,成本差距远大于多出来的那点 token。
在 Sol 促销价下,270K 输入加 2K 输出的官方成本是 270,000 × $4/M + 2,000 × $20/M = $1.12。输入再多 3K token——273,000 × $8/M + 2,000 × $30/M——同一个请求就变成 $2.244。多 1% 的输入,账单大约翻倍。在越过边界之前,先裁剪对话历史、收紧检索,或者拆分任务;五折之后悬崖依然是悬崖,只是高度减半。
推理 token 按输出计费,只算一次
GPT-5.6 模型提供可调节的推理强度(reasoning effort),生成的推理内容会计入输出用量,按输出费率计费。推理 token 属于输出计费项,不会作为单独的 token 类别再收第二次——但它们是真实的输出 token,按输出价格付费,Sol 促销期官方价是每百万 $20。
这让 effort 成为模型层级之后的第二个杠杆。一个棘手的架构问题值得在 Sol 上开 max effort;一个路由或格式化子步骤则不值得。把可预测的批量任务交给 Luna 并调低 effort,每 token 费率和你要付费的不可见 token 数量会同时下降。
固定五折在哪里结算
apiToken.sale 不改变上述任何计费机制。你的请求发往一个 OpenAI 兼容端点,应答的是同样的模型 ID,usage 对象报告的也是同样的 token 计费项。改变的是结算:每次调用先被换算成精确的官方支出——输入、缓存输入、缓存写入、输出,以及适用时的长上下文倍率——然后扣除固定的 50% B2C 折扣,之后才会动你的预充值余额。没有订阅费,也没有加价;折扣本身就是定价。
控制台会记录每次请求结算后的 token 用量和精确的折后扣费,所以你可以逐次调用地用真实流量核对本文的算术,而不必等到月底对账。同一个预充值余额也按各自的官方费率表计量支持的 Claude、Gemini 和 Kimi 模型,同样享受五折。
GPT-6 Astra:最新 GPT 模型
GPT-6 Astra 是本模型目录中的最新 GPT 模型。每百万 token 的官方新鲜输入/缓存输入/缓存写入/输出费率为 $10/$1/$12.50/$50,B2C 五折后为 $5/$0.50/$6.25/$25。Codex 最大上下文为 872K,保守输入上限为 744K,输出上限为 128K。推理强度支持 low、medium、high、xhigh 和 max。输入超过 272K 时,输入及缓存费率翻倍,输出为 1.5 倍;Fast 将适用费率再翻倍。下方 GPT-5.6 示例保留各自费率。
常见问题
GPT-5.6 每百万 token 多少钱?
截至 2026-11-21(含当日),Sol 临时官方输入/缓存/缓存写入/输出费率为 $4/$0.40/$5/$20,本站五折后为 $2/$0.20/$2.50/$10。自 2026-11-22 UTC 起恢复标准输入 $5、输出 $30。Terra 仍为 $2/$12,Luna 为 $0.20/$1.20。
什么算缓存输入?
提供商从缓存返回的重复提示词前缀。终态 usage 决定缓存计费项;同一个 token 不会同时按缓存输入和新鲜输入收费。
长上下文费率何时生效?
输入超过 272K token 时。届时整个请求按输入 2 倍、输出 1.5 倍计费,然后再扣除五折。
推理 token 单独计费吗?
不单独计费。推理 token 属于输出用量的一部分,按模型的输出费率计费,不是输出之外的第二个独立计费项。
gpt-5.6 别名比 gpt-5.6-sol 便宜吗?
不是。gpt-5.6 是 gpt-5.6-sol 的别名,共用同一套费率表,两个 ID 的每 token 价格完全相同。