
本文深入解析了KV Cache在大语言模型中的作用原理揭示了为何第一个token生成较慢而后续token生成却迅速的原因。通过详细介绍LLM生成token的过程、Attention机制的计算方式以及KV Cache如何解决重复计算问题文章阐述了KV Cache如何显著提升模型推理速度。同时也指出了KV Cache带来的显存压力问题并简要介绍了相关优化策略。对于想要了解大模型加速技术的读者来说本文提供了清晰易懂的解释和实用的知识。你肯定注意过无论用 ChatGPT 还是 Claude第一个 token 往往要等明显更久但后面的内容却会一下子顺滑地“刷刷刷”冒出来。这背后并不是偶然而是一项非常刻意的工程设计KV Cache键值缓存。它的核心目的只有一个——让大语言模型推理更快。在进入细节之前你可以先把它理解成有没有 KV Cache决定了模型是在反复做无用功还是在“算过一次就别再算”。Part 1LLM 是怎么生成 token 的Transformer 会先处理整段输入为每一个 token都生成一个 hidden state隐藏状态。这些 hidden state 再被投影到词表空间里得到 logits——也就是对词表里每个词的打分。但真正有用的其实只有最后一个 token 对应的那组 logits。因为生成过程是这样的取最后一个 token 的 logits从中采样出下一个 token把这个新 token 接到输入后面再重复一遍这里最关键的一点是要生成下一个 token你真正需要的只有“最新那个 token”的 hidden state。前面那些 token 的 hidden state本质上都只是中间产物。Part 2Attention 到底在算什么在 Transformer 的每一层里每个 token 都会生成三组向量QueryQKeyKValueVAttention 的计算可以概括成两步用 Q 和 K 做匹配算出注意力分数再用这些分数对 V 做加权得到输出现在把注意力集中到最后一个 token上。对于最后一个 token 来说真正需要计算的是QK^T的最后一行。而这一行会用到最后一个 token 的 Query 向量序列中所有 token 的 Key 向量接着这一行对应的 attention 输出又会用到同一个最新 token 的 Query整段序列里所有 token的 Key 和 Value也就是说为了算出“唯一真正有用的那个 hidden state”每一层 attention 都只需要最新 token 的 Q以及整段上下文里所有 token 的 K 和 V。Part 3浪费到底发生在哪里假设你正在生成第 50 个 token。这时模型需要 token 1 到 token 50 的 K 和 V。而当它接着生成第 51 个 token 时又需要 token 1 到 token 51 的 K 和 V。问题来了token 1 到 token 49 的 K 和 V前一步不是已经算过了吗这些输入根本没变输出当然也不会变。但如果不做缓存模型每一步还是会把它们从头再算一遍。这就造成了巨大的重复计算每一步都有 O(n) 的冗余工作整个生成过程累计下来就是 O(n²) 级别的浪费换句话说模型并不是“不会算”而是在一遍又一遍地重算那些早就确定了的东西。Part 4KV Cache 是怎么解决这个问题的办法其实很直接既然旧 token 的 K 和 V 不会变那就把它们存起来不要每次重算。于是生成每个新 token 时流程就变成了只为最新这个 token计算它的 Q、K、V把新的 K 和 V 追加到缓存里从缓存中取出之前所有 token 的 K 和 V用“新 token 的 Q”去和“整段缓存里的 K、V”做 attention这就是 KV Cache。它的本质就是每一层、每一步只新增一个 token 的 K 和 V之前的结果全部直接复用。需要注意的是attention 本身仍然要对整段上下文做计算所以它的复杂度依旧会随着序列长度增长。 但那个代价高昂的“把 hidden state 投影成 K、V”的过程不再是每一步都把整段序列重做一遍而是每个 token 只做一次。Part 5为什么第一个 token 总是更慢现在你就能理解为什么第一个 token 往往最慢了。当你把 prompt 发给模型时模型必须先对整段输入做一次完整前向计算把每个 token 的 K 和 V 都算出来并放进缓存里。这个阶段叫 prefill也是整次请求里最吃算力的部分。一旦缓存被“热启动”起来后面每生成一个新 token就只需要做一次单 token 前向计算。所以首 token 慢是因为要先把整段 prompt 的缓存建好后续 token 快是因为之后基本都在复用缓存这个首 token 前的延迟通常就叫 TTFTTime to First Token首 token 延迟。而且 prompt 越长prefill 越重TTFT 越长用户等待越明显围绕 TTFT其实还有很多专门的优化方向比如chunked prefillspeculative decodingprompt caching但底层逻辑始终没变建缓存很贵读缓存很便宜。Part 6KV Cache 的代价是什么KV Cache 的提速并不是没有代价。它本质上是在做一笔交换用更多显存换更少计算。因为每一层都要为每个 token保存一份 K 和 V所以上下文一长缓存体积就会迅速膨胀。以 Qwen 2.5 72B 为例80 层32K 上下文窗口hidden dim 8192在这种配置下单个请求的 KV Cache 就可能吃掉数 GB 级别的 GPU 显存。 如果同时有几百个并发请求KV Cache 占用甚至可能超过模型权重本身。这也是为什么后来会有 GQAGrouped-Query Attention 和 MQAMulti-Query Attention让多个 query head 共享 key/value head以此降低 KV Cache 的显存占用同时尽量不牺牲模型效果这也解释了为什么“把上下文长度翻倍”并不只是一个参数调整那么简单上下文翻倍每个请求的 KV Cache 也跟着翻倍同一块 GPU 能同时服务的用户数就会下降Part 7一句话总结KV Cache 的核心思想非常简单历史 token 产生的 K 和 V 是不会变的所以只算一次后面一直复用。这样一来在自回归生成时每一步只需要为最新 token计算一次 Q、K、V然后拿这个 Q 去和整个缓存里的 K、V 做 attention。结果就是大幅减少重复计算显著提升推理速度实际部署里常见 5 倍左右加速但代价是显存压力会明显上升所以从 vLLM、TGI 到 TensorRT-LLM几乎所有主流 LLM serving 系统都是建立在这个思路之上的。KV Cache 的作用就是消除自回归生成中的重复计算。过去的 token 会稳定地产生同样的 K 和 V既然它们不会变就没必要每一步重算。最合理的做法就是第一次算完就缓存起来。之后每生成一个新 token只算它自己的 Q、K、V再拿新的 Q 去读取整段缓存。速度提升来自“避免重复算”代价来自“必须一直存”。因此在大规模 LLM 服务里真正最先撞上的瓶颈往往不是算力而是显存。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取