欢迎关注
端侧大模型性能调优在高通芯片上实战 端侧大模型性能调优在高通芯片上实战
⚡ Profiling 三板斧 · Memory-Bound 破局 · 投机采样加速 前两篇聊了硬件架构和量化方法。到这一步,你应该已经有了一个量化好的模型,能在车机 NPU 上跑起来了。Qwen2.5-VL-3B 在 SA8397P 多核
2026-03-22
高通 QNN 全景拆解(二):从模型量化到多模型并发的完整部署实战 高通 QNN 全景拆解(二):从模型量化到多模型并发的完整部署实战
这是「高通 QNN 端侧 AI 部署全解析」系列的第二篇。上一篇我们搞懂了 QNN 的软件栈分层。今天来实战 — 从一个 HuggingFace 上的模型出发,一路走到 NPU 上跑起来的完整链路。 先看全流程: Step 1:模型获取从
2026-03-17
高通 QNN 全景拆解(一):从框架到硬件的完整软件栈 高通 QNN 全景拆解(一):从框架到硬件的完整软件栈
这是「高通 QNN 端侧 AI 部署全解析」系列的第一篇。两篇的结构: 本篇:QNN 全景 — 软件栈分层 + 三大后端 + API 核心调用 第二篇:部署实战 — 6 步上机流程 + 量化选型 + DDR 带宽优化 如果你在做端侧 A
2026-03-12
Jetson 系列(四):V4L2 到底是什么 Jetson 系列(四):V4L2 到底是什么
像 Linux 视频设备的办事大厅,专门管格式、buffer、控制和数据流 你有没有遇到过这种场景:USB 摄像头插上板子,/dev/video0 出来了。心想:Linux 不是”一切皆文件”吗?那我打开它,读几帧,不就能拿到图像了吗? 结
2026-03-07
Jetson 系列(三):YOLOv8 + 相机 pipeline 全链路加速 Jetson 系列(三):YOLOv8 + 相机 pipeline 全链路加速
“模型在 PC 上跑得飞快,一上 Orin 就卡成 PPT?” “TensorRT 引擎建好了,但端到端延迟还是高得离谱?” 在工业 AI 视觉落地中,全链路性能才是王道。从相机采集 → 图像预处理 → 模型推理 → 后处理输出,任何一环的
2026-03-02
Jetson 系列(二):跑满帧目标检测——从 5FPS 到接近硬件极限 Jetson 系列(二):跑满帧目标检测——从 5FPS 到接近硬件极限
YOLO11 + TensorRT FP16 + V4L2 零拷贝 + 双缓冲流水线,榨干 Jetson Orin Nano Super 的每一帧性能 第一章:前言——为什么你的 Jetson 跑 YOLO 只有 5FPS?如果你刚拿到一块
2026-02-25
Jetson 系列(一):Orin 安装 Jetpack Jetson 系列(一):Orin 安装 Jetpack
在本文中,您将找到在主机上安装 Jetpack 的指南。本部分假设您已经安装了 NVIDIA SDK Manager,要了解 SDK Manager,请查看安装 SDK Manager 部分。 以下小节介绍了在主机上安装 Jetpack 5
2026-02-20
LLM 推理系列(七):投机解码(Speculative Decoding) LLM 推理系列(七):投机解码(Speculative Decoding)
概述投机解码(Speculative Decoding)是一种新兴技术,用于加速大型语言模型(LLM)的推理过程。该方法不仅能够显著提升推理速度,还能保持解码质量,因此受到广泛关注。本文将简要介绍投机解码的实现原理,并探讨对该算法原始实现的
2026-02-15
LLM 推理系列(六):内存容量——端侧 AI 的入场券 LLM 推理系列(六):内存容量——端侧 AI 的入场券
LLM 内存占用的构成:三大核心部分的量化分析要理解内存瓶颈,首先需要精确拆解 LLM 在运行时到底消耗了什么。其内存占用主要由三个动态和静态的部分构成,每一部分都有其详细的计算规则。 1. 模型权重(Model Weights)这是模型最
2026-02-10
LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈 LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈
在 AI 大模型席卷一切的今天,我们都期待手机成为真正的”口袋里的AI大脑”。但你有没有感觉,手机上的 AI 助手总是慢半拍?无论是想让它快速总结一篇长文,还是在图片编辑时使用”AI消除”功能,那种等待的延迟感,总在提醒我们”理想与现实的差
2026-02-05
LLM 推理系列(四):模型量化——原理与范式 LLM 推理系列(四):模型量化——原理与范式
一、引言你有一张 RTX 4090,24GB 显存。你下载了 Llama-3.1-70B-Instruct,想在本机跑推理。然后发现:模型参数 70B,哪怕用 FP16(2 bytes per param),光是加载参数就需要 70×10⁹
2026-01-31
LLM 推理系列(三):KV Cache 原理与显存占用 LLM 推理系列(三):KV Cache 原理与显存占用
先快速过一遍前向传播:token 先查表变成向量,然后逐层经过 Transformer Block,每层里用 Q、K、V 三个向量做自注意力,最后从词表分布里挑出下一个 token。 我们也知道了生成是自回归(Autoregressive)
2026-01-26
1 / 10