AI3Radar
AI3Radar 官方AI3Radar 动态

本地跑大模型不后悔:何时划算、显存怎么算、哪些失败信号

本地部署大模型的吸引力在于 token 价格为零,但真实成本是硬件和维护。决策应从一个问题开始:你每个月真的跑多少 token?如果答案低于一块中端显卡两年期成本的大致等价量,为本地推理买卡通常比用 API 更贵。

硬件算账很具体:4 位量化模型大约需要与参数量相同的 GB 显存,16 位权重需要约两倍。7B 模型装进 8 GB,13B 需要 16 GB,70B 需要 48 GB 或更多。吞吐同样重要:消费级显卡每秒产出的 token 远低于 API 端点,批量或流式负载在本地会明显不同。

说明本地方案正在亏钱的失败信号:模型落后于你实际需要的托管版本;因为负载是突发的,显卡一天大半时间空转;或者团队花在维护运行时上的时间比写代码还多。每一条都是留在托管 API、租用能力而不是自建的理由。

本地真正划算的场景:不能离开机器的隐私受限数据、完全离线的环境、以及显卡每天满负荷的稳定高量推理。方法是每季度重跑一次 token 计数和硬件算账,因为模型尺寸和显卡价格都在变。

显存计算放在参考表里更容易。7B 模型用 4 位量化约需 8 GB 显存,16 位权重约需两倍;13B 量化约需 16 GB,16 位约 26 GB;70B 量化需要 48 GB 或更多,16 位约 140 GB,这超出单块消费级显卡,需要专业卡或多卡。下表是规划参考,不是保证:实际数值随量化级别、上下文长度和所用运行时变化。

本地与 API 的取舍是四个因素,而不是一个标题数字。隐私:本地让数据留在机器上,托管则送出机器。用量:本地只在持续高量时划算,托管按 token 付费。团队时间:本地把运行时和升级留给你,托管交给提供商。新鲜度:本地通常落后于托管旗舰,托管立刻更新。下表把四个因素并排列出;每季度重跑 token 计数与硬件算账,因为模型尺寸和显卡价格都在变。

按模型尺寸的显存规划参考(经验法则)
模型尺寸4 位量化16 位权重典型显卡档次
7B约 8 GB约 16 GB8-16 GB 消费级显卡
13B约 16 GB约 26 GB24 GB 显卡
70B48 GB 或更多约 140 GB专业卡或多卡

来自 llama.cpp 与 Ollama 文档的经验法则;实际显存随量化、上下文长度与运行时变化。

本地与托管 API 一览(决策辅助)
因素本地托管 API
隐私数据留在机器上数据送出机器
月用量需要持续高量才能打平只为用到的 token 付费
团队时间运行时与升级归你运行时归提供商
模型新鲜度落后于托管旗舰立刻使用最新模型

决策辅助,不是价格声明;每季度重跑 token 计数与硬件算账。