LLM 推理加速技巧 KVCache 解析

💡 最近李宏毅老师更新了关于 KVCache 的教学视频,正好趁这个机会整理了下 KVCache 原理相关内容。 核心原理:transformer 架构是自回归的,在计算 Attention 是会用到过去的 key 和 value,缓存这些值通过空间换时间的方式,提高算力计算效率。 原理分析 Understanding and Coding the Self-Attention Mechanism of Large Language Models From Scratch 输入的句子通过 tokenizer 进行分词 对每个 token 进行 embedding 得到 embedding 向量 x 向量乘上预先训练好的权重矩阵 Wq、Wk、Wv 得到 q、k、v 向量 使用 attention 公式计算得到 z 向量 通过预先训练的好的权重矩阵可以得到 Query Token 1、Key Token 1 和 Value Token 1 使用 Attention 公式,计算得到 Token 1 对应的 Attention 通过 softmax 层并全连接到词表得到 Token 2 ...

April 1, 2026

🤖 MoonCake 解构极速权重同步:从内存寻址到流⽔线引擎

背景 在 VSCode 中让 Github Copilot 进行辅助阅读源码,针对不明白的点,及时提问 等所有细节都整理清楚后,将与 Copilot 的聊天内容导入到 NotebookLM 中 在 NotebookLM 中,再次对内容进行梳理,NotebookLM 也会主动引导提问 对 NotebookLM 每轮返回的结果进行评估,如果符合预期则保存为 note 在 NotebookLM 中,将所有保存的 note 作为 source,然后通过「Slide Deck」生成 Slide 核⼼挑战:⼤模型时代下的权重更新瓶颈 优化一:提供硬件直达,消除中介 优化二:零拷贝与内核旁路,告别开销 优化三:利用 P2P 以及流水异步化机制,压榨并行 这里需要补充一点,在 checkpoint-engine 中 P2P 只在 h2d 阶段获取原始权重时才会用到,其余权重同步逻辑均由 NCCL 库来实现。 单 GPU 视角 多 GPU 视角 总体架构回顾 P2P 分发 & vLLM 更新权重 总结 & 思考 权重按 bucket 细分后,可以充分利用 PCIE、RDMA 性能,减少硬件闲置 ...

November 29, 2025