显存估算原理:7B 模型到底要多大显卡
从参数量推算显存需求的通用方法,FP16/INT8/GGUF 量化对显存的影响,以及 KV-Cache 为什么才是实际瓶颈。
显存量化本地部署
显存估算原理:7B 模型到底要多大显卡
"我这个显卡能跑 7B 模型吗?"——这是本地部署最常见的问询。本文给你一个通用的估算方法。
基本公式
模型权重显存(GB)≈ 参数量(B)× 每参数字节数
| 精度 | 每参数字节 | 7B 需要 | 13B 需要 | 70B 需要 |
|---|---|---|---|---|
| FP32 | 4 | 28 GB | 52 GB | 280 GB |
| FP16 / BF16 | 2 | 14 GB | 26 GB | 140 GB |
| INT8 | 1 | 7 GB | 13 GB | 70 GB |
| INT4 (Q4) | 0.5 | 3.5 GB | 6.5 GB | 35 GB |
这就是为什么消费级显卡(8-24GB 显存)跑 7B-13B 模型是甜点区。
别忘了 KV-Cache
上表只是权重。推理时上下文缓存(KV-Cache)会额外吃显存,且随上下文长度线性增长:
- 7B 模型、4K 上下文:大约再加 1-2 GB
- 32K 长上下文:可能比权重本身还大
所以"能跑"和"跑得舒服"是两回事。经验法则:总显存预算 = 权重 × 1.2 + 上下文预留。
GGUF 量化:本地部署的主流选择
GGUF 是 llama.cpp 生态的权重格式,Q4_K_M 是最流行的量化档位(质量损失小、显存接近理论 INT4)。
本站收录的模型如果标注了 gguf 权重格式,说明社区有现成的量化包,不需要自己转换。
快速查表
| 显卡 | 推荐 | 说明 |
|---|---|---|
| 8 GB | 7B Q4 | 1080Ti / 3060Ti / 4060 |
| 12 GB | 7B FP16 / 13B Q4 | 3060 12G / 4070 |
| 16 GB | 13B FP16 / 32B Q4 | 4060Ti 16G / 4080 |
| 24 GB | 32B Q4 / 70B Q2 | 3090 / 4090 |
估算仅供参考,实际需求受注意力实现(GQA/MLA)、框架开销影响。以模型卡片标注的官方要求为准。