分类
善良比聪明更重要
llama.cpp RPC 局域网分布式推理验证 llama.cpp RPC 局域网分布式推理验证
一、RPC 分布式推理的核心原理llama.cpp 的 RPC 模式基于一个非常朴素的想法:大模型是一层一层叠起来的,不同层可以在不同机器上算。 Transformer 模型的每一层计算相对独立——上一层算完把结果传给下一层。这就给了分布式
2026-01-11
llama.cpp 源码解析(二):GGUF 格式与模型加载——从磁盘文件到内存张量 llama.cpp 源码解析(二):GGUF 格式与模型加载——从磁盘文件到内存张量
这是 llama.cpp 源码系列的第二篇。上一篇我们拆解了推理引擎 GGML,理解了张量、Arena、延迟执行、Galloc、KV Cache、线程模型的完整骨架。 但还有一个问题没回答:模型文件本身是怎么设计的? 从磁盘上的一个文件,到
2026-01-06
llama.cpp 源码解析(一):GGML——大模型推理引擎是如何设计的 llama.cpp 源码解析(一):GGML——大模型推理引擎是如何设计的
几周前我开始看 llama.cpp 的源码。想看看”为什么我这台本地的笔记本也能跑得动 7B 甚至 14B 模型”,结果发现——这个项目太有意思了。所以我准备尝试写篇系列文章(又开新坑😂)。 从推理引擎开始,如果你也想知道 llama.c
2026-01-01