08-16
把 Claude Code 的每一分钱花在刀刃上:token、缓存与会话管理
Claude Code 的账单由 prefill 与 decode 两个阶段决定:输入 token 一次读完,输出 token 逐字生成,因此输出定价约为输入的 5 倍。prompt caching 自动开启,共享前缀从缓存读取只需 0.1x,但切换 /model、/effort、fast mode 或使用 /compact 都会破坏缓存,导致整个对话重新按全价 prefill。会话成本取决于进入上下文的 token 数量、它们存活的轮数以及并发运行的上下文数。文章给出大量可执行建议:用 @ 引用文件省掉 Read 调用、把常用命令的安静参数写进 CLAUDE.md、让超过 30,000 字符的命令输出落盘、用 /rewind 而非 /compact 裁剪错误分支、把噪音任务交给子代理并指定 haiku 模型。也明确缓存过期时间:订阅 1 小时,API key 5 分钟(可用 ENABLE_PROMPT_CACHING_1H=1 延长)。适合重度 Claude Code 用户控制成本与上下文。