归档
善良比聪明更重要
01
31
26
LLM 推理系列(三):KV Cache 原理与显存占用 LLM 推理系列(三):KV Cache 原理与显存占用
先快速过一遍前向传播:token 先查表变成向量,然后逐层经过 Transformer Block,每层里用 Q、K、V 三个向量做自注意力,最后从词表分布里挑出下一个 token。 我们也知道了生成是自回归(Autoregressive)
2026-01-26
21
16
11
llama.cpp RPC 局域网分布式推理验证 llama.cpp RPC 局域网分布式推理验证
一、RPC 分布式推理的核心原理llama.cpp 的 RPC 模式基于一个非常朴素的想法:大模型是一层一层叠起来的,不同层可以在不同机器上算。 Transformer 模型的每一层计算相对独立——上一层算完把结果传给下一层。这就给了分布式
2026-01-11
06
01