分类
善良比聪明更重要
端侧大模型性能调优在高通芯片上实战 端侧大模型性能调优在高通芯片上实战
⚡ Profiling 三板斧 · Memory-Bound 破局 · 投机采样加速 前两篇聊了硬件架构和量化方法。到这一步,你应该已经有了一个量化好的模型,能在车机 NPU 上跑起来了。Qwen2.5-VL-3B 在 SA8397P 多核
2026-03-22
高通 QNN 全景拆解(二):从模型量化到多模型并发的完整部署实战 高通 QNN 全景拆解(二):从模型量化到多模型并发的完整部署实战
这是「高通 QNN 端侧 AI 部署全解析」系列的第二篇。上一篇我们搞懂了 QNN 的软件栈分层。今天来实战 — 从一个 HuggingFace 上的模型出发,一路走到 NPU 上跑起来的完整链路。 先看全流程: Step 1:模型获取从
2026-03-17
高通 QNN 全景拆解(一):从框架到硬件的完整软件栈 高通 QNN 全景拆解(一):从框架到硬件的完整软件栈
这是「高通 QNN 端侧 AI 部署全解析」系列的第一篇。两篇的结构: 本篇:QNN 全景 — 软件栈分层 + 三大后端 + API 核心调用 第二篇:部署实战 — 6 步上机流程 + 量化选型 + DDR 带宽优化 如果你在做端侧 A
2026-03-12