很多人一上来就问:微调怎么做?显卡买哪张?其实第一步更简单——先搞清楚:有哪些模型可以自己下载、自己跑。下面按「家族 → 用途 → 体量」三层分类。名单是当前常见、可用 Ollama / vLLM 等自行安装的开源权重模型;版本迭代很快,选型时以官网/Ollama 库最新标签为准。
一、按「家族」分(认门派)
| | | |
|---|
Qwen(通义千问) | 阿里 | 中文强,综合与代码都很能打 | 7B / 14B / 32B…(含 Coder、多模态系列) |
Llama | Meta | 英文通用默认选项,生态大 | 8B / 70B 等 |
DeepSeek | 深度求索 | 推理、数学强;有蒸馏小模型可本机跑 | R1 蒸馏 7B/14B/32B…;满血版要很多卡 |
Mistral / Mixtral | Mistral | 快、工具调用友好;欧洲开源阵营 | 7B~Small;MoE 如 Mixtral |
Gemma | Google | 相对克制、文档全 | 2B / 9B / 27B 等 |
Phi | 微软 | 小模型里意外能打,适合边缘/笔记本 | 约 3B~14B |
社区微调版 | Hermes / Dolphin 等 | 更放开、人设强 | 多基于上面基座再训 |
另外两类也常要单独装,别和「聊天模型」混为一谈:
- Embedding(向量):如
nomic-embed-text、各类 bge——给知识库检索用 - 多模态 / 视觉:如 LLaVA、带视觉的 Qwen——能看图,显存另算
注意:业界常说的「开源模型」,多数是 开放权重(可下载自建),商用前仍要看各家许可证。
二、按「你要干什么」分(认用途)
| | |
|---|
中文客服 / 制度问答 / 办公助手 | Qwen 系 | Qwen2.5 / Qwen3 通用指令版 |
写代码、读仓库 | Coder 专用 | Qwen-Coder、Codestral 等 |
数学、复杂推理、要「想一步写一步」 | DeepSeek R1 蒸馏 | 本机可跑的 7B~32B 蒸馏版 |
只要快、工具调用多 | Mistral 系 | Mistral Small 等 |
显卡很小、先跑通 Demo | Phi / 小参数 Qwen·Llama | 3B~8B |
知识库检索 | Embedding 模型 | 与聊天模型分开部署 |
企业试点一句就够:
中文业务先看 Qwen;要推理加一道 DeepSeek 蒸馏;知识库另装 Embedding。
三、按「机器扛不扛得住」分(认体量)
参数越大一般越强,也越吃显存。用量化(如 Q4)后,体感大概是:
| | |
|---|
小(≤8B) | 约 8GB 级可尝试 | 个人电脑、PoC、低并发 |
中(14B~32B) | 约 12~24GB | 小组试用、部门助手 |
大(70B 级) | 往往要双卡 / 大显存 | 集中式推理服务 |
超大 / 满血 MoE | 多机多卡机房 | 平台组统一供给,不适合「笔记本装一下」 |
记一个粗规则:先 7B~14B 把流程跑通,再加参数;不要一上来就 70B。
四、一张「选型速查」(更简单)
要自己装、数据尽量不出网
├─ 主要中文对话? → Qwen 通用版(7B/14B 起)
├─ 主要写代码? → Qwen-Coder / 代码专用模型
├─ 要强推理? → DeepSeek R1 蒸馏版
├─ 只要轻量 Demo?→ Phi 或 8B 级 Llama/Qwen
└─ 还要知识库? → 再装一个 Embedding(别跟聊天抢同一套配置糊弄)
安装入口对企业研发最省事的是 Ollama(一条命令拉模型);上生产再考虑 vLLM 等更高吞吐方案——那是下一篇的事。
五、和「闭源 API」差在哪(一句话)
| | |
|---|
权重 | 可下载到自己机器 | 一般拿不到 |
数据 | 可内网推理 | 看合同与区域 |
成本 | 买算力 + 运维 | 按 Token 付费 |
上手 | 要装环境、选规格 | 开通就能调 |
不是谁更高级,是:要不要模型跑在自己墙上。
六、小结
今天只记住三句话:
- 能自己装的,先认家族:Qwen / Llama / DeepSeek / Mistral / Gemma / Phi
- 按用途选,别按热搜选:中文、代码、推理、检索不是同一个模型
- 按显存选规格
把地图看清,下一步才是:怎么安装、怎么配进业务系统、要不要微调。
介绍一些模型的命名规则
通用结构
家族名 + 版本 + 参数量 + 用途/变体 +(可选)量化/格式
例子:qwen2.5:7b、llama3.1:8b-instruct-q4_K_M、deepseek-r1:14b
| | |
|---|
家族 | 哪条产品线 | Qwen、Llama、Mistral、Gemma、Phi、DeepSeek
|
版本 | 第几代 | 2.5、3.1、3.3、R1
|
参数量 | 模型规模(约) | 7B=70亿、14B、32B、70B;1.5B=15亿
|
用途/变体 | 训成干什么的 | 见下表 |
量化等 | 压缩精度、运行格式 | Q4_K_M、Q8_0、GGUF、FP16
|
B = Billion(十亿参数)。数字越大一般越强、越吃显存。
用途/变体常见后缀
| |
|---|
Instruct / Chat / IT | 对话、听指令(企业助手多用这个) |
Base / Pretrain | 基座,未充分对齐;一般不直接当客服 |
Coder / Code | 偏写代码 |
Math | 偏数学 |
Vision / VL / Omni | 能看图/多模态 |
R1 / Thinking / Reasoner | 偏推理,回答可能更长、「先想再说」 |
Distill / Distilled | 从大模型「蒸馏」来的小模型,好部署 |
MoE / A3B 等 | 混合专家;总参数大,但每次只激活一部分,省算力 |
Ollama 里常见写成:qwen2.5:7b、qwen2.5-coder:14b、llama3.1:8b-instruct。
量化名怎么读(选安装包时用)
| |
|---|
FP16 / BF16 | 半精度,质量高、占显存大 |
Q8 | 8 比特量化,接近原精度 |
Q4 / Q4_K_M | 4 比特,体积小、本机最常用 |
Q5 / Q6 | 介于 Q4 与 Q8 之间 |
GGUF | llama.cpp / Ollama 常用权重格式 |
同一句「7B」,Q4 和 FP16 显存差很多;名字里带 Q4,通常更好在笔记本上跑。
几个完整例子
| |
|---|
Qwen2.5-7B-Instruct
| 通义 2.5 代 · 70亿 · 指令对话版 |
qwen2.5-coder:14b
| 同上家族 · 代码版 · 140亿 |
Llama-3.1-8B-Instruct
| Llama 3.1 · 80亿 · 指令版 |
DeepSeek-R1-Distill-Qwen-14B
| R1 推理能力 · 蒸馏到 Qwen 骨架 · 140亿 |
nomic-embed-text
| 不是聊天模型,是 Embedding(向量) |
企业选型时看名字的顺序
- 家族 + 中文/场景
- Instruct/Chat
- B 数
- 要代码 / 推理 / 看图 → 看有没有
Coder、R1、VL
一句话:
名字 = 谁家的 + 第几代 + 多大 + 干什么用的 +(可选)压得多狠。
会拆这五段,开源模型列表就不会晕。