Ollama 与 LM Studio 怎么上手
从安装到跑通的完整命令、模型标签的读法、量化档位怎么选,以及三个最常见的坑
本页解决的问题
先给结论「Ollama 与 LM Studio 怎么上手」要解决的关键问题是什么?
从安装到跑通的完整命令、模型标签的读法、量化档位怎么选,以及三个最常见的坑
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
Ollama
- 一条命令下载并运行,没有多余步骤
- 装好后自动在后台提供服务,可以直接被程序调用
- 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用
- 没有图形界面,换模型、调参数都要敲命令
LM Studio
- 内置模型浏览器,能看到体积和量化档位再决定下不下
- 会提示当前机器能不能带得动,对新手很友好
- 也能开本地服务器,同样兼容 OpenAI 格式
- 在 Apple 芯片上支持 MLX 引擎,比通用格式更快
装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例:
ollama run qwen3:8b
就这一句。本地没有就先下载,下完自动进入对话。想只下载不运行,把 run 换成 pull。其余常用命令:
# 看已经下载了哪些模型,以及各占多少空间
ollama list
# 删掉不用的,本地模型很占硬盘
ollama rm qwen3:8b
# 看当前正在占用显存的模型
ollama ps
装好后 Ollama 会在本机 11434 端口提供服务,接口格式跟 OpenAI 一致。也就是说你手上现成的 OpenAI 调用代码,把 base_url 指过来就能跑,模型名填标签名即可。
from openai import OpenAI
# 本地服务不校验密钥,api_key 随便填一个非空值
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "用一句话解释什么是量化"}],
)
print(resp.choices[0].message.content)
上面那条命令里的 8b 是举例。你自己该敲哪个数字,取决于你的机器。选一下,下面直接给出你能复制走的那条。
把上面那个选择器里的机型换着点一遍,会看出一件反直觉的事:决定你能跑多大模型的不是显卡多贵,是显存多大。一张 RTX 4090 停在 30B,而一台统一内存 128 GB 的 Mac 能吃下 122B——后者的图形算力远不如前者,但模型装得进去,前者装不进去。
- RTX 4090(24 GB 显存)→ 最大 Qwen3-30B-A3B,需 19.5 GB
- Mac 统一内存 128 GB(约 96 GB 可用)→ 最大 Qwen3.5-122B-A10B,需 79.3 GB
这也是大内存 Mac 在本地跑模型这件事上唯一说得通的理由。它的优势不是快,是装得下:同样的钱买独显,显存到 24 GB 就到头了,而统一内存能堆到 128 GB 以上,中间这一段没有别的消费级设备能补。如果你的用途就是在本地跑大尺寸模型,内存容量比 GPU 型号重要得多。
冒号后面那串不是随便写的,每一段都有含义。
ollama.com/library 对应模型的 tags 页确认当前有哪些尺寸与档位。核对日期 2026-08-07。
在模型库里搜索
搜模型名,列表会列出各个量化版本的体积。界面会根据你的机器提示哪些带得动,这一点比命令行直观很多。
下载后直接聊天
加载模型时可以调上下文长度和 GPU 分配。这两个参数直接影响显存占用,先用默认值跑通再调。
需要给程序调用时,开本地服务器
在服务器面板里启动,同样是 OpenAI 兼容接口,用法和上面的 Ollama 例子一样,只是端口不同。
Mac 用户注意选 MLX 版本
如果模型有 MLX 格式,优先选它。这是针对 Apple 芯片优化的引擎,同样的模型速度会明显好于通用格式。
- 上下文开太大,显存直接爆。这是最高频的问题。模型加载时显存看着够,一旦把上下文拉到几十 K,KV Cache 涨上来就崩了。现象是生成到一半卡死,或者速度突然慢到不可用。先按默认上下文跑通,需要长文再一档一档往上加。
- 显存不够时不一定报错。有些工具会自动把装不下的部分放到内存里,靠 CPU 算。结果是能跑,但慢十倍以上。如果你发现生成速度慢得离谱,先检查是不是没完全装进显存。
- 硬盘会被吃掉。一个 8B 的 Q4 模型三四个 GB,试几个模型就是几十个 GB。定期用
ollama list看一眼,不用的删掉。
到这里,你手上有三种用模型的方式了。它们不是替代关系,各有各的场合:
- 本地跑。数据不能外发、要长期高频调用、或者想完全不受服务商影响时。代价是能力上限受硬件限制。
- 官方 API。要最强能力、不想管运维时。按量付费,用多少算多少。
- 中转站。便利性和风险并存,具体的取舍在《什么是 API 中转站》那一节讲过,涉及数据经手第三方的问题,选之前建议回去再看一眼。
这一章到此结束。你现在应该能自己判断一个模型的开放程度、知道小模型是怎么来的和它的代价、并且能在自己的机器上把它跑起来。
「先选工具」要放回选型约束
「装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。
先写淘汰条件,再看最高分
「就这一句。本地没有就先下载,下完自动进入对话。想只下载不运行,把 run 换成 pull 。其余常用命令」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。
- 装好后自动在后台提供服务,可以直接被程序调用
- 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用
- 内置模型浏览器,能看到体积和量化档位再决定下不下
没有测试集,就没有可靠的赢家
以「这一章到此结束。你现在应该能自己判断一个模型的开放程度、知道小模型是怎么来的和它的代价、并且能在自己的机器上把它跑起来」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。
从「先选工具」走到「Ollama:从零到跑通」
「先选工具」先把问题落在「Ollama 命令行 一条命令下载并运行,没有多余步骤 装好后自动在后台提供服务,可以直接被程序调用 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用 没有图形界面,换模型、调参数都要敲命令 适合你,如果: 你要把本地模型接进自己的程序,或者习惯用终端。 LM Studio 图形界面 内置模型浏览器,能看到体积和量化档位再决定下不下 会提示当前机器能不能带得动,对新手很友好 也能开本地服务器,同样…」上;到了「Ollama:从零到跑通」,讨论继续推进到「装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。
- 「先选工具」:Ollama 命令行 一条命令下载并运行,没有多余步骤 装好后自动在后台提供服务,可以直接被程序调用 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用 没有图形界面,换模型、调参数都要敲命令 适合你,如果: 你要把本地模型接进自己的程序,或者习惯用终端。 LM Studio 图形界面 内置模型浏览器,能看到体积和量化档位再决定下不下 会提示当前机器能不能带得动,对新手很友好 也能开本地服务器,同样…
- 「Ollama:从零到跑通」:装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例
- 「最后的要点」:在 Apple 芯片上支持 MLX 引擎,比通用格式更快
最后的「最后的要点」把讨论落到「在 Apple 芯片上支持 MLX 引擎,比通用格式更快」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。