工作原理

如何在 Claude API 上节省 token

你的折扣降低了每 token 的单价;这些技巧降低了 token 的数量。二者叠加,会让账单大幅缩水。

·

使用提示缓存

长而稳定的上下文——系统提示、大文件、工具定义——都应当缓存。缓存读取的成本仅为全新输入 token 的一小部分,因此重复的上下文变得廉价。

另见: Claude API 定价如何运作

选对模型

不要把每个请求都发给 Opus。把廉价或高并发的工作路由给 Haiku,让日常编码留在 Sonnet 上,把 Opus 留给真正高难度的推理。

精简上下文

  • 只发送任务真正需要的文件和历史。
  • 对长会话做摘要,而非完整重发。
  • 把 max_tokens 限制在响应真正需要的范围内。

常见问题

最能省 token 的单项措施是什么?

对大而重复的上下文使用提示缓存,再配合选择能胜任任务的最便宜模型。

这些技巧能与折扣叠加吗?

能。折扣降低每 token 单价;这些技巧降低 token 数量,因此节省会相乘放大。

通过 Google 或 GitHub 创建密钥,用 $10 的 Claude 赠送用量测试网关。