欢迎关注
端侧大模型性能调优在高通芯片上实战 端侧大模型性能调优在高通芯片上实战
⚡ Profiling 三板斧 · Memory-Bound 破局 · 投机采样加速 前两篇我们搞定了 QNN 的软件栈全景和部署实战。到这一步,你应该已经有了一个量化好的模型,能在车机 NPU 上跑起来了。Qwen2.5-VL-3B 在
2026-03-22
高通 QNN 全景拆解(二):从模型量化到模型推理的完整部署实战 高通 QNN 全景拆解(二):从模型量化到模型推理的完整部署实战
这是「高通 QNN 端侧 AI 部署全解析」系列的第二篇。上一篇我们搞懂了 QNN 的软件栈分层。今天来实战 — 从一个 HuggingFace 上的模型出发,一路走到 NPU 上跑起来的完整链路。 先看全流程: Step 1:模型获取从
2026-03-17
高通 QNN 全景拆解(一):从框架到硬件的完整软件栈 高通 QNN 全景拆解(一):从框架到硬件的完整软件栈
这是「高通 QNN 端侧 AI 部署全解析」系列的第一篇。三篇的结构: 本篇:QNN 全景 — 软件栈分层 + 三大后端 + API 核心调用 第二篇:部署实战 — 6 步上机流程 + 量化选型 + DDR 带宽优化 第三篇:性能调优实战
2026-03-12
Jetson 系列(四):V4L2 到底是什么 Jetson 系列(四):V4L2 到底是什么
像 Linux 视频设备的办事大厅,专门管格式、buffer、控制和数据流 你有没有遇到过这种场景:USB 摄像头插上板子,/dev/video0 出来了。心想:Linux 不是”一切皆文件”吗?那我打开它,读几帧,不就能拿到图像了吗? 结
2026-03-07
高通 QNN 系列导读:端侧 AI 部署三部曲 高通 QNN 系列导读:端侧 AI 部署三部曲
如果你在做端侧 AI——手机、车机还是 IoT——高通的 QNN 都绕不过去。这个系列三篇,从软件栈全景讲到部署实战,再讲到性能调优,按发文时间顺序读即是推荐阅读顺序。 全系列 高通 QNN 全景拆解(一):从框架到硬件的完整软件栈:六层软
2026-03-05
Jetson 系列(三):YOLOv8 + 相机 pipeline 全链路加速 Jetson 系列(三):YOLOv8 + 相机 pipeline 全链路加速
“模型在 PC 上跑得飞快,一上 Orin 就卡成 PPT?” “TensorRT 引擎建好了,但端到端延迟还是高得离谱?” 在工业 AI 视觉落地中,全链路性能才是王道。从相机采集 → 图像预处理 → 模型推理 → 后处理输出,任何一环的
2026-03-02
Jetson 系列(二):跑满帧目标检测——从 5FPS 到接近硬件极限 Jetson 系列(二):跑满帧目标检测——从 5FPS 到接近硬件极限
YOLO11 + TensorRT FP16 + V4L2 零拷贝 + 双缓冲流水线,榨干 Jetson Orin Nano Super 的每一帧性能 第一章:前言——为什么你的 Jetson 跑 YOLO 只有 5FPS?如果你刚拿到一块
2026-02-25
Jetson 系列(一):Orin 安装 Jetpack Jetson 系列(一):Orin 安装 Jetpack
在本文中,您将找到在主机上安装 Jetpack 的指南。本部分假设您已经安装了 NVIDIA SDK Manager,要了解 SDK Manager,请查看安装 SDK Manager 部分。 以下小节介绍了在主机上安装 Jetpack 5
2026-02-20
Jetson 系列导读:从环境搭建到视觉流水线 Jetson 系列导读:从环境搭建到视觉流水线
这个系列记录 Jetson Orin 上的完整视觉开发路径:先把环境搭起来,再把目标检测榨到硬件极限,然后打通相机到推理的全链路,最后补上 V4L2 这块底层拼图。4 篇文章按发文时间顺序读即是推荐阅读顺序。 全系列 Jetson 系列(一
2026-02-16
LLM 推理系列(七):投机解码(Speculative Decoding) LLM 推理系列(七):投机解码(Speculative Decoding)
概述投机解码(Speculative Decoding)是一种新兴技术,用于加速大型语言模型(LLM)的推理过程。该方法不仅能够显著提升推理速度,还能保持解码质量,因此受到广泛关注。本文将简要介绍投机解码的实现原理,并探讨对该算法原始实现的
2026-02-15
LLM 推理系列(六):内存容量——端侧 AI 的入场券 LLM 推理系列(六):内存容量——端侧 AI 的入场券
LLM 内存占用的构成:三大核心部分的量化分析要理解内存瓶颈,首先需要精确拆解 LLM 在运行时到底消耗了什么。其内存占用主要由三个动态和静态的部分构成,每一部分都有其详细的计算规则。 1. 模型权重(Model Weights)这是模型最
2026-02-10
LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈 LLM 推理系列(五):内存带宽——端侧 LLM 的第一瓶颈
在 AI 大模型席卷一切的今天,我们都期待手机成为真正的”口袋里的AI大脑”。但你有没有感觉,手机上的 AI 助手总是慢半拍?无论是想让它快速总结一篇长文,还是在图片编辑时使用”AI消除”功能,那种等待的延迟感,总在提醒我们”理想与现实的差
2026-02-05
1 / 24