分类
善良比聪明更重要
LLM 推理系列(七):投机解码(Speculative Decoding) LLM 推理系列(七):投机解码(Speculative Decoding)
概述投机解码(Speculative Decoding)是一种新兴技术,用于加速大型语言模型(LLM)的推理过程。该方法不仅能够显著提升推理速度,还能保持解码质量,因此受到广泛关注。本文将简要介绍投机解码的实现原理,并探讨对该算法原始实现的
2026-02-15
LLM 推理系列(六):内存容量——端侧 AI 的入场券 LLM 推理系列(六):内存容量——端侧 AI 的入场券
LLM 内存占用的构成:三大核心部分的量化分析要理解内存瓶颈,首先需要精确拆解 LLM 在运行时到底消耗了什么。其内存占用主要由三个动态和静态的部分构成,每一部分都有其详细的计算规则。 1. 模型权重(Model Weights)这是模型最
2026-02-10
LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈 LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈
在 AI 大模型席卷一切的今天,我们都期待手机成为真正的”口袋里的AI大脑”。但你有没有感觉,手机上的 AI 助手总是慢半拍?无论是想让它快速总结一篇长文,还是在图片编辑时使用”AI消除”功能,那种等待的延迟感,总在提醒我们”理想与现实的差
2026-02-05
LLM 推理系列(四):模型量化——原理与范式 LLM 推理系列(四):模型量化——原理与范式
一、引言你有一张 RTX 4090,24GB 显存。你下载了 Llama-3.1-70B-Instruct,想在本机跑推理。然后发现:模型参数 70B,哪怕用 FP16(2 bytes per param),光是加载参数就需要 70×10⁹
2026-01-31
LLM 推理系列(三):KV Cache 原理与显存占用 LLM 推理系列(三):KV Cache 原理与显存占用
先快速过一遍前向传播:token 先查表变成向量,然后逐层经过 Transformer Block,每层里用 Q、K、V 三个向量做自注意力,最后从词表分布里挑出下一个 token。 我们也知道了生成是自回归(Autoregressive)
2026-01-26
LLM 推理系列(二):运行大型语言模型需要多少 GPU 内存? LLM 推理系列(二):运行大型语言模型需要多少 GPU 内存?
几乎在所有的大型语言模型(LLM)面试中,都有一个经常被问到的问题:”服务一个大型语言模型需要多少GPU内存?” 这个问题并非随意提出——它是检验你对这些强大模型在生产环境中部署和可扩展性理解程度的关键指标。在使用像 GPT、LLaMA 或
2026-01-21
LLM 推理系列(一):讲清 FP64、FP32、TF32、BF16、FP16、FP8、INT8、INT4、NVFP4 LLM 推理系列(一):讲清 FP64、FP32、TF32、BF16、FP16、FP8、INT8、INT4、NVFP4
看 AI 芯片、GPU、模型训练和推理时,经常会看到这些词:FP64、FP32、TF32、BF16、FP16、FP8、INT8、INT4、NVFP4 它们本质上都在回答一个问题:计算机到底用多少 bit 来表示一个数字,以及这个数字怎么被表
2026-01-16