Kimi API 定价:缓存命中、缓存未命中、输出与速度
Kimi API 定价把每个请求拆成三项用量——缓存命中输入、缓存未命中输入和输出——每一项都有各自官方的每百万 token 费率。本指南逐项拆解 K3、Kimi for Coding 和 High Speed 的真实费率表,用一次典型的编程会话算完整笔账,并说明 apiToken.sale 的固定五折在结算的哪一步生效。
·
每个 Kimi 请求都按这三项计费
Kimi 不公布单一的输入价格。每个请求都按缓存命中输入、缓存未命中输入和输出三项计量,每一项都有各自官方的每百万 token 费率——缓存命中远低于未命中,输出最贵。apiToken.sale 按官方费率表逐项结算这些用量,然后在扣动你的预付费余额之前减去固定的 50% 折扣。
缓存本身由提供商侧自动完成;不需要你主动开启、标记断点或管理缓存条目。当请求重复了提供商已经见过的上下文时,匹配的前缀直接从缓存提供并按命中费率计量,其余都算未命中。由于提供商没有公布单独的缓存写入价格,所以不存在隐藏的第四项:新写入缓存的 token 在引入它的那次请求上按未命中计费,之后的请求则享受便宜的命中费率。
实际影响是:两次看起来完全相同的调用,费用可能相差很大,取决于提示词有多少命中缓存。每轮都重发一大段稳定系统提示词和文件上下文的 agent 循环,正是能吃满命中费率的流量——第一轮付未命中的钱,后面都搭缓存的便车。
推理 token 是输出的子集,不是独立的 token 类别。Kimi for Coding 和 High Speed 默认开启思考,模型推理过程产生的一切都按输出费率计费——绝不会在输出之上再叠加一次。
每个公开别名背后的官方费率
| 公开别名 | 官方 命中 / 未命中 / 输出 | 本站五折后价格 |
|---|---|---|
| kimi/k3 · k3-256k · k3[1m] | $0.30 / $3 / $15 | $0.15 / $1.50 / $7.50 |
| kimi/kimi-for-coding | $0.19 / $0.95 / $4 | $0.095 / $0.475 / $2 |
| kimi/kimi-for-coding-highspeed | $0.38 / $1.90 / $8 | $0.19 / $0.95 / $4 |
以上数字均为每 1M token,从左到右依次是缓存命中输入、缓存未命中输入、输出。从表中能直接看出两个结构性事实。第一,Kimi for Coding 是 Kimi 已公布产品线中最低的通用编程费率。第二,High Speed 在每一项上都恰好是基础 Kimi for Coding 的两倍——你买的是延迟,不是另一个模型。
K3 一行覆盖了同一张费率表的三种写法。k3-256k 选择 K3 的 256K 上下文模式;k3 和 k3[1m] 选择 1M 模式,方括号写法是兼容拼写,路由器会将其归一化为提供商真实的 K3 线路模型。三种写法的每 token 费率完全相同,所以选择关乎上下文行为,而不是价格。千万不要发送 kimi-k2.7-code 这类开放平台内部资费 ID——路由器只接受 GET /v1/models 返回的公开订阅别名。
实战演算:一次编程会话,逐项拆解
以 kimi/kimi-for-coding 上一次典型的 agent 会话为例:稳定的系统提示词和仓库上下文在第一轮后进入缓存,每轮有少量新输入,回复保持精简。假设这次会话最终结算为 400,000 缓存命中 token、100,000 缓存未命中 token 和 20,000 输出 token:
| 计费项 | 按官方费率计算 | 金额 |
|---|---|---|
| 缓存命中输入 | 400,000 × $0.19 / 1M | $0.076 |
| 缓存未命中输入 | 100,000 × $0.95 / 1M | $0.095 |
| 输出 | 20,000 × $4 / 1M | $0.08 |
| 官方费用 | $0.076 + $0.095 + $0.08 | $0.251 |
| B2C 固定五折 | $0.251 × 50% | −$0.1255 |
| 从余额扣除 | $0.251 − $0.1255 | $0.1255 |
这笔账里有两点值得记住。尽管输出 token 数量最少,却占了费用大头——输出 token 比缓存命中少二十倍,花费仍超过整个命中项。其次是缓存承担了大部分工作:同样 500,000 输入 token 若全部按未命中计费,官方费用将是 $0.475 而不是 $0.171。让昂贵的上下文在各轮之间保持稳定,是压低 Kimi 账单唯一最大的杠杆。
为任务选最便宜的别名
- 默认把编程和 agent 循环指向 kimi/kimi-for-coding——已公布产品线中最低的通用编程费率。
- 只有当延迟收益值得每一项都恰好两倍于基础费率时,才用 kimi/kimi-for-coding-highspeed;对时间不敏感的批量任务永远不值得。
- 任务不需要大上下文模式时用 kimi/k3-256k 而不是 1M 写法——每 token 价格相同,你选的是行为,不是折扣。
- 只有在 Kimi for Coding 确实搞不定的工作上才升级到 K3(官方 $0.30 / $3 / $15):硬推理、长文档和长代码库任务。
- 给密钥设置终身消费上限,在仪表板查看已结算用量,而不是轻信月底估算。
结算、充值与余额如何运转
apiToken.sale 不改变上述任何计量方式。你的请求按 Kimi 自己的用量核算运行,每一项换算成官方提供商费用,然后才减去固定的 B2C 五折。净额从同一个预付费余额中扣除,该余额也按各自的官方费率表覆盖受支持的 Claude、GPT 和 Gemini 模型。没有订阅、没有按请求收取的费用,也没有最低消费。
你可以用银行卡或加密货币充值任意整数美元,余额永不过期。每个请求都会带着模型和 token 级明细出现在仪表板中,因此你可以把本指南里的算术逐行与自己的真实流量对账。余额归零时,请求会以余额不足的错误失败,直到你再次充值——密钥本身仍然有效。
在响应的 usage 对象中对账各项用量
这些数字完全不需要靠字符数估算。终态 usage 对象会报告每次调用实际消耗了多少,而且 Kimi 遵循 Anthropic Messages 的响应结构——缓存输入、新鲜输入和输出落在互不相交的桶里,可以直接乘上费率表:
curl https://router.apitoken.sale/v1/messages \
-H "x-api-key: $APITOKEN_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{"model":"kimi/kimi-for-coding","max_tokens":512,"messages":[{"role":"user","content":"Summarize this diff"}]}'
# The response carries terminal usage in the Anthropic shape:
# "usage": {
# "input_tokens": 8420,
# "cache_read_input_tokens": 38400,
# "output_tokens": 512
# }
# cache_read_input_tokens bills at the hit rate ($0.19/1M),
# input_tokens at the miss rate ($0.95/1M),
# output_tokens at the output rate ($4/1M) — then 50% off the total.由于从提供商核算到你的仪表板账本,各项全程保持互斥,成本异常总有迹可循:缓存未命中突然上升,说明有人改动了原本稳定的前缀的中间部分;输出突然上升,说明模型开始更长时间地推理或回复。OpenAI 兼容客户端通过通用 /v1 通道访问同样的别名,结算方式完全相同。
常见问题
Kimi for Coding 多少钱?
官方刊例价为每 1M 缓存命中 token $0.19、每 1M 缓存未命中 token $0.95、每 1M 输出 token $4;apiToken.sale 在结算后对每一项收取一半。
为什么 Kimi 要分缓存命中和缓存未命中两种价格?
Kimi 会自动缓存重复的上下文。终态 usage 会标识哪些输入来自缓存,每一项有各自的官方费率——命中远比未命中便宜。
写入 Kimi 缓存有单独的价格吗?
没有。提供商没有公布缓存写入计费项,因此新写入缓存的 token 在引入它的那次请求上按未命中计费;之后的请求按命中费率付费。
Kimi High Speed 更贵吗?
是。它的缓存命中、未命中和输出费率恰好都是基础 Kimi for Coding 的两倍——官方每 1M token 为 $0.38 / $1.90 / $8。
k3、k3-256k 和 k3[1m] 定价不同吗?
不。三种写法共用一张费率表(官方每 1M 为 $0.30 / $3 / $15);它们只选择 K3 的 256K 或 1M 上下文模式,k3[1m] 是兼容别名。
Kimi 的推理 token 额外收费吗?
按输出费率计费,是输出 token 的子集。思考从不会作为独立的 token 类别计量,也不会叠加在输出之上。