本地跑大模型不后悔:何时划算、显存怎么算、哪些失败信号
本地部署大模型的吸引力在于 token 价格为零,但真实成本是硬件和维护。决策应从一个问题开始:你每个月真的跑多少 token?如果答案低于一块中端显卡两年期成本的大致等价量,为本地推理买卡通常比用 API 更贵。
硬件算账很具体:4 位量化模型大约需要与参数量相同的 GB 显存,16 位权重需要约两倍。7B 模型装进 8 GB,13B 需要 16 GB,70B 需要 48 GB 或更多。吞吐同样重要:消费级显卡每秒产出的 token 远低于 API 端点,批量或流式负载在本地会明显不同。
说明本地方案正在亏钱的失败信号:模型落后于你实际需要的托管版本;因为负载是突发的,显卡一天大半时间空转;或者团队花在维护运行时上的时间比写代码还多。每一条都是留在托管 API、租用能力而不是自建的理由。
本地真正划算的场景:不能离开机器的隐私受限数据、完全离线的环境、以及显卡每天满负荷的稳定高量推理。方法是每季度重跑一次 token 计数和硬件算账,因为模型尺寸和显卡价格都在变。
显存计算放在参考表里更容易。7B 模型用 4 位量化约需 8 GB 显存,16 位权重约需两倍;13B 量化约需 16 GB,16 位约 26 GB;70B 量化需要 48 GB 或更多,16 位约 140 GB,这超出单块消费级显卡,需要专业卡或多卡。下表是规划参考,不是保证:实际数值随量化级别、上下文长度和所用运行时变化。
本地与 API 的取舍是四个因素,而不是一个标题数字。隐私:本地让数据留在机器上,托管则送出机器。用量:本地只在持续高量时划算,托管按 token 付费。团队时间:本地把运行时和升级留给你,托管交给提供商。新鲜度:本地通常落后于托管旗舰,托管立刻更新。下表把四个因素并排列出;每季度重跑 token 计数与硬件算账,因为模型尺寸和显卡价格都在变。
| 模型尺寸 | 4 位量化 | 16 位权重 | 典型显卡档次 |
|---|---|---|---|
| 7B | 约 8 GB | 约 16 GB | 8-16 GB 消费级显卡 |
| 13B | 约 16 GB | 约 26 GB | 24 GB 显卡 |
| 70B | 48 GB 或更多 | 约 140 GB | 专业卡或多卡 |
来自 llama.cpp 与 Ollama 文档的经验法则;实际显存随量化、上下文长度与运行时变化。
| 因素 | 本地 | 托管 API |
|---|---|---|
| 隐私 | 数据留在机器上 | 数据送出机器 |
| 月用量 | 需要持续高量才能打平 | 只为用到的 token 付费 |
| 团队时间 | 运行时与升级归你 | 运行时归提供商 |
| 模型新鲜度 | 落后于托管旗舰 | 立刻使用最新模型 |
决策辅助,不是价格声明;每季度重跑 token 计数与硬件算账。