Ollama 本地跑大模型完全指南(2026)
Ollama 本地跑大模型完全指南(2026)
如果你不想把代码、文档、聊天记录都喂给云端厂商,又想随时调用一个能写代码、能总结、能聊天的模型——Ollama 是目前最省心的本地大模型运行方案。一条命令装好,一条命令拉模型,再一条命令就能在命令行、在代码里、在你自己的应用里调用它。
这篇只讲 2026 年还成立、且我实际验证过能用的方法。
一、安装
去 ollama.com 下载对应系统的安装包即可(macOS / Windows 有图形安装器,Linux 一条命令):
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
装完它会自动起一个本地服务,默认监听 11434 端口。想确认在跑:
curl http://localhost:11434/api/tags
返回 {"models":[...]} 说明服务正常。
二、拉模型与运行
模型名字格式是 仓库/模型:标签。2026 年常用的几个:
ollama pull llama3.2 # 轻量,3B,普通笔记本能跑
ollama pull qwen2.5:14b # 通义千问,中文强,建议 16G 显存
ollama pull deepseek-r1:8b # 推理模型,会输出思考过程
ollama pull gemma2:9b # Google 出品,综合均衡
直接对话:
ollama run qwen2.5:14b
>>> 用一句话解释什么是注意力机制
/bye 退出。第一次 run 没拉过会自动拉取。
三、在代码里调用(OpenAI 兼容)
Ollama 自带一个和 OpenAI 兼容的接口,绝大多数 SDK 改个 base_url 就能用:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # 本地随便填
)
resp = client.chat.completions.create(
model="qwen2.5:14b",
messages=[{"role": "user", "content": "帮我写个快速排序"}],
)
print(resp.choices[0].message.content)
Node.js 同理,把 base_url 指向 11434 即可。这意味着你之前写的云端 AI 应用,换两行配置就能切到本地模型,零改造。
四、关键参数
run 时可以用 /param 调,或在 API 请求里传:
ollama run qwen2.5:14b /? # 看所有可调参数
最常用三个:
num_ctx:上下文窗口,默认 2048,长文档总结调到8192或16384temperature:0 偏确定、1 偏发散,写代码建议 0.2 左右num_gpu:用几张卡 / 多少层放显存,设不好会爆内存
五、显存不够怎么办
这是本地跑大模型第一道坎。记住一个粗略公式:模型参数量(亿) × 2字节 ≈ 最低显存(GB)。14B 模型约需 28GB 显存,普通显卡根本放不下。
解决顺序:
- 先降尺寸:
14b换7b换3b,体验够用再往上加 - 开量化:
qwen2.5:7b-q4_K_M这种带q4标签的是 4-bit 量化版,体积和显存都砍到约 1/4,质量损失很小 - 放内存兜底:Ollama 会自动把放不进显存的部分挪到内存,速度变慢但不报错
六、5 个常见坑
- 远程调用连不上:11434 默认只绑
127.0.0.1。想从别的机器访问,启动前设OLLAMA_HOST=0.0.0.0:11434(注意这会让局域网都能连,需配防火墙)。 - 中文乱码 / 答非所问:多半是模型太小。3B 模型中文能力有限,换
qwen2.5:14b以上立竿见影。 - 跑起来巨慢:检查是不是模型全在内存里跑(没用到 GPU)。Linux 下
ollama ps看processor字段,显示100% GPU才正常。 - 上下文超了报错:长文本先
num_ctx调大,或把文档切块再喂。 - deepseek-r1 输出一堆思考:它本来就会先输出
<think>...</think>推理过程,前端展示时把这段折叠掉即可。
七、适合谁用
- 处理敏感代码 / 内部文档,不能上云
- 想给自己的应用接一个免费、可离线的模型
- 做原型验证,不想每个 token 都花钱
如果只是偶尔用用、机器配置一般,从 qwen2.5:7b-q4_K_M 起步最稳妥。真正写代码干活,建议至少 14B 级别 + 一张 16G 以上显卡。