一、引言你有一张 RTX 4090,24GB 显存。你下载了 Llama-3.1-70B-Instruct,想在本机跑推理。然后发现:模型参数 70B,哪怕用 FP16(2 bytes per param),光是加载参数就需要 70×10⁹
2026-01-31