在自己电脑上跑大模型:Ollama 入门与硬件怎么选
本地跑大模型最大的两个理由:数据不出本机、断网也能用。随着模型压缩技术进步,现在一台普通配置的机器也能跑出可用的效果。
入门:一条命令就能跑起来
目前最省事的方式是用 Ollama 这类工具,它把模型下载、加载、提供服务都封装好了:
# 安装后,拉取并运行一个模型(以 7B 规模为例)
ollama run qwen2.5:7b
# 之后直接对话;也可以作为服务给其他程序调用
ollama serve
跑起来之后,它会监听本地端口,其他应用通过接口调用即可,不用自己处理一堆依赖。
硬件怎么选(这是最常被问的)
决定能不能跑、跑得多快的主要是显存,其次是内存和硬盘。
- 显存:模型大小基本决定显存需求。粗略地说,7B 规模的模型量化后约需 4–6GB,14B 约需 8–12GB。显存不够会直接跑不起来或极慢。
- 内存:至少 16GB。部分数据会溢出到内存,内存不足时速度断崖式下降。
- 硬盘:一个 7B 模型约 4GB 左右,准备 30–50GB 空间比较从容。固态硬盘能显著缩短加载时间。
- 没有独立显卡:也能跑,用 CPU 推理,7B 模型大概每秒几个字,能用来做批处理任务,实时对话会比较着急。
模型版本怎么看
常见标识如 7b 指参数规模,q4、q8 指量化精度。量化相当于把模型"压缩",精度越低体积越小、速度越快,但能力会有损失。一般建议从 4bit 量化的 7B 或 8B 模型起步,这个档位在效果和速度上比较平衡。
几个实测体会
- 本地小模型适合格式固定、难度不高的任务:摘要、分类、提取字段、按模板改写。复杂推理还是云端大模型强。
- 第一次加载模型比较慢(要把权重读进显存),之后会快很多,别因为第一次慢就放弃。
- 同时跑多个模型会占多份显存,注意及时释放。
- 中文任务优先选中文语料训练充分的模型,同样参数量下体验差别明显。
小结
如果你的需求是"处理内部材料、不想数据外传",或者"想离线做个批处理小工具",本地跑一个 7B 量化的模型完全够用,成本就是一台显存 6GB 以上的机器。至于要它做复杂分析和长文写作,那还是交给云端大模型更实际。