归档
善良比聪明更重要
03
22
17
12
07
Jetson 系列(四):V4L2 到底是什么 Jetson 系列(四):V4L2 到底是什么
像 Linux 视频设备的办事大厅,专门管格式、buffer、控制和数据流 你有没有遇到过这种场景:USB 摄像头插上板子,/dev/video0 出来了。心想:Linux 不是”一切皆文件”吗?那我打开它,读几帧,不就能拿到图像了吗? 结
2026-03-07
02
02
25
20
Jetson 系列(一):Orin 安装 Jetpack Jetson 系列(一):Orin 安装 Jetpack
在本文中,您将找到在主机上安装 Jetpack 的指南。本部分假设您已经安装了 NVIDIA SDK Manager,要了解 SDK Manager,请查看安装 SDK Manager 部分。 以下小节介绍了在主机上安装 Jetpack 5
2026-02-20
15
LLM 推理系列(七):投机解码(Speculative Decoding) LLM 推理系列(七):投机解码(Speculative Decoding)
概述投机解码(Speculative Decoding)是一种新兴技术,用于加速大型语言模型(LLM)的推理过程。该方法不仅能够显著提升推理速度,还能保持解码质量,因此受到广泛关注。本文将简要介绍投机解码的实现原理,并探讨对该算法原始实现的
2026-02-15
10
LLM 推理系列(六):内存容量——端侧 AI 的入场券 LLM 推理系列(六):内存容量——端侧 AI 的入场券
LLM 内存占用的构成:三大核心部分的量化分析要理解内存瓶颈,首先需要精确拆解 LLM 在运行时到底消耗了什么。其内存占用主要由三个动态和静态的部分构成,每一部分都有其详细的计算规则。 1. 模型权重(Model Weights)这是模型最
2026-02-10
05
LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈 LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈
在 AI 大模型席卷一切的今天,我们都期待手机成为真正的”口袋里的AI大脑”。但你有没有感觉,手机上的 AI 助手总是慢半拍?无论是想让它快速总结一篇长文,还是在图片编辑时使用”AI消除”功能,那种等待的延迟感,总在提醒我们”理想与现实的差
2026-02-05
01
31
26
LLM 推理系列(三):KV Cache 原理与显存占用 LLM 推理系列(三):KV Cache 原理与显存占用
先快速过一遍前向传播:token 先查表变成向量,然后逐层经过 Transformer Block,每层里用 Q、K、V 三个向量做自注意力,最后从词表分布里挑出下一个 token。 我们也知道了生成是自回归(Autoregressive)
2026-01-26
1 / 10