08-30
LLM 四级缓存全拆解:KV、前缀、提示词、语义缓存各自的命中与失效
这篇教程从第一性原理拆解 LLM 推理栈中的四层缓存:单次请求内的 KV cache、服务端跨请求的 prefix caching、API 提供方计费的 prompt caching,以及按 embedding 相似度匹配的 semantic cache。文中用可运行代码演示了 transformers 的 DynamicCache/StaticCache、vLLM 的 16-token 链式哈希前缀匹配,并给出关键数字:70B 模型 128K 上下文约 40GB KV 缓存、Anthropic 读缓存 0.1x/写缓存 1.25x、语义缓存对“否定句”产生 0.952 相似度却给出相反答案。适合自建推理服务、调优 RAG 成本或排查 API 缓存失效的工程师。