导语
摘要:开放权重模型 8 月已占 Vercel AI Gateway 56% 的令牌(去年 12 月仅 7%)——「本地跑开源模型」正从极客玩具变成工程常态。但新手最常踩的坑不是不会用,而是选错引擎:在 Mac 上硬上 vLLM、用 LM Studio 去扛生产并发、拿 llama.cpp 当服务器。本文用一张横向对比表讲清 llama.cpp / Ollama / vLLM / LM Studio 各自的形态、硬件、易用性与适用场景,并给一份可直接照做的选型决策清单。
把开源大模型从「别人服务器上能跑」变成「我自己机器上跑得动、跑得起」,推理引擎是绕不开的一环。但引擎不是「越新越好」,而是「越匹配你的场景越好」:本地单用户和线上高并发,最优解完全不同。很多人拿本地思路去选服务端引擎(或反过来),是后面一切麻烦的根源。

一、问题定义:你是在「本地玩」还是在「线上服务」
这是所有选型的总开关,先框定维度,后面的表才有意义:
- 本地单用户:首要目标是「能跑起来 + 显存装得下 + 别折腾」,易用性优先。
- 线上 GPU 服务:首要目标是「吞吐高 + 延迟低 + 多并发 + 可运维」,工程化优先。
- 还有一条隐藏维度:License 与商用权限——开源引擎能免费用,但模型和你的分发方式可能涉及单独的许可与合规。
二、四种引擎横向对比(核心收藏,建议截图)
| 引擎 | 部署形态 | 硬件后端 | 易用性 | 吞吐/生产就绪 | License 与商用 | 适合谁 |
| llama.cpp | C/C++ 库 + CLI,极致轻量 | CPU/GPU 通吃(Metal/CUDA/ROCm) | 中,需命令行 | 高可控,嵌入式友好 | MIT,可商用 | 边缘/嵌入式、二次开发、极致控制 |
| Ollama | 桌面/CLI 一键拉跑,本地 API | macOS/Linux/Windows,多后端 | 高,一行起 | 中等,单机够用 | MIT(核心),可商用 | 个人本机尝鲜、快速起服务 |
| vLLM | Python 服务框架,OpenAI 兼容 API | NVIDIA/AMD GPU,多卡 | 中,需 Python 环境 | 高吞吐、批处理、生产级 | Apache-2.0,可商用 | 高并发服务、多卡、生产部署 |
| LM Studio | 桌面 GUI + 模型市场 | 本地 GPU/CPU,图形化 | 最高,零命令 | 中,偏个人/小团队 | 闭源,个人免费、商用需授权 | 不想碰命令行的个人用户 |
注意 License 的坑:llama.cpp / Ollama / vLLM 自身开源可商用,但模型权重的许可是另一回事(如 Llama 社区许可、Qwen 许可各有商用边界);LM Studio 本体闭源,商用需单独授权——别把「引擎免费」误读成「怎么用都行」。
三、逐个点评(一句话定位)
- llama.cpp:最底层、最通用,几乎所有上层工具(包括 Ollama)都站在它肩上;要极致控制或塞进边缘设备,就它。
- Ollama:把「拉模型 + 起服务」压成一行命令,本地开发调试的首选;但别指望它扛公司级并发。
- vLLM:生产服务的默认答案,高并发、批处理、连续请求优化到位;代价是要会 Python 和 GPU 环境。
- LM Studio:给「不想写命令」的人,GUI 加模型市场最顺手;商用前先看清授权条款。

四、决策路径(按场景 if…then…)
- 你在 Mac 上跑、只想本地用 → Ollama 或 mlx-lm,别折腾 GPU 格式。
- 个人本机快速试模型 → Ollama 一行
ollama pull,零门槛。 - 线上高并发、多卡服务 → vLLM + 开源权重,把批处理和吞吐做满。
- 嵌入式/边缘/二次开发/极致控制 → llama.cpp,自己写调用。
- 完全不想碰命令行 → LM Studio,但商用先确认授权。
五、边界与不适用(License / 商用限制 / 数据安全)
- License:llama.cpp(MIT)、Ollama(MIT)、vLLM(Apache-2.0)可商用;LM Studio 闭源、商用需授权。三者都不覆盖模型权重的独立许可。
- 数据安全:本地推理的最大卖点是「数据与权重都不出本机」,适合处理敏感数据的内部工具;但务必从官方/可信源下载权重,第三方篡改或打包的权重是实打实的安全雷。
- 什么时候不该这么选:如果你要的是「随开随用、不用养 GPU」的弹性,本地引擎反而是负担——这种场景直接用云 API 更省心;本文结论只在「你确实要自己跑模型」时成立。
我的判断
我的判断很直接:大多数人吃的选择亏,不是技术不会,而是「没先定场景就选引擎」。如果你只是想在笔记本上跑个模型帮自己干活,Ollama 闭眼选,别去研究 vLLM 的批处理参数;如果你要在服务器上扛并发,就老老实实上 vLLM,并花半天把多卡和监控做掉。引擎没有「最优」,只有「最匹配你的硬件和流量形态」。把上面那张表存下来,下次选引擎先对表、再动手,能省掉一大半返工。反直觉的一面是:大家盯着「哪个引擎最快」,但真正决定体验的往往是「你和你的数据,愿不愿意离开本地」。
选型没有标准答案,只有约束条件下的最优解。这个栏目给的是对比表和一条决策路径。
关注一下
这个号只写两件事:能直接抄走的技术清单,和带判断的深度拆解。工作日每天更新。
关注之后,这四个栏目会持续更:
- 深度解析 —— 每天一件 AI 大事,写清背景、数据和我的判断,3 分钟读完
- GitHub 热榜 —— 每周一期,按「真的用得上」筛,每个都给最低成本上手路径
- 选型对比 —— 一张对比表 + 一条决策路径 + 这个结论什么时候不成立
- 实战清单 —— 前置条件、可复制配置、验证方法、常见坑
想翻哪一类,在对话框回复对应的词就行:选型对比 / GitHub 热榜 / 深度解析 / 实战清单。有不同看法也欢迎留言。
这类内容都归在「选型对比」合集里,回复这个词能翻到全部历史。
参考来源:Ollama 官方文档
感谢阅读 · 欢迎转发分享