当前位置:首页>排行榜>企业想部署自己的大模型:怎么选、怎么配、要不要微调?

企业想部署自己的大模型:怎么选、怎么配、要不要微调?

  • 更新时间 2026-09-25 16:02:28
企业想部署自己的大模型:怎么选、怎么配、要不要微调?
很多人一上来就问:微调怎么做?显卡买哪张?其实第一步更简单——先搞清楚:有哪些模型可以自己下载、自己跑。

下面按「家族 → 用途 → 体量」三层分类。名单是当前常见、可用 Ollama / vLLM 等自行安装的开源权重模型;版本迭代很快,选型时以官网/Ollama 库最新标签为准。


一、按「家族」分(认门派)

家族
谁家的
一句话印象
常见可自建规格

Qwen(通义千问)

阿里

中文强,综合与代码都很能打

7B / 14B / 32B…(含 Coder、多模态系列)

Llama

Meta

英文通用默认选项,生态大

8B / 70B 等

DeepSeek

深度求索

推理、数学强;有蒸馏小模型可本机跑

R1 蒸馏 7B/14B/32B…;满血版要很多卡

Mistral / Mixtral

Mistral

快、工具调用友好;欧洲开源阵营

7B~Small;MoE 如 Mixtral

Gemma

Google

相对克制、文档全

2B / 9B / 27B 等

Phi

微软

小模型里意外能打,适合边缘/笔记本

约 3B~14B

社区微调版

Hermes / Dolphin 等

更放开、人设强

多基于上面基座再训

另外两类也常要单独装,别和「聊天模型」混为一谈:

  • Embedding(向量)
    :如 nomic-embed-text、各类 bge——给知识库检索用
  • 多模态 / 视觉
    :如 LLaVA、带视觉的 Qwen——能看图,显存另算

注意:业界常说的「开源模型」,多数是 开放权重(可下载自建),商用前仍要看各家许可证。


二、按「你要干什么」分(认用途)

你的场景
优先看哪一类
举例方向

中文客服 / 制度问答 / 办公助手

Qwen 系

Qwen2.5 / Qwen3 通用指令版

写代码、读仓库

Coder 专用

Qwen-Coder、Codestral 等

数学、复杂推理、要「想一步写一步」

DeepSeek R1 蒸馏

本机可跑的 7B~32B 蒸馏版

只要快、工具调用多

Mistral 系

Mistral Small 等

显卡很小、先跑通 Demo

Phi / 小参数 Qwen·Llama

3B~8B

知识库检索

Embedding 模型

与聊天模型分开部署

企业试点一句就够:

中文业务先看 Qwen;要推理加一道 DeepSeek 蒸馏;知识库另装 Embedding。


三、按「机器扛不扛得住」分(认体量)

参数越大一般越强,也越吃显存。用量化(如 Q4)后,体感大概是:

体量
大致显存(量化后体感)
适合

小(≤8B)

约 8GB 级可尝试

个人电脑、PoC、低并发

中(14B~32B)

约 12~24GB

小组试用、部门助手

大(70B 级)

往往要双卡 / 大显存

集中式推理服务

超大 / 满血 MoE

多机多卡机房

平台组统一供给,不适合「笔记本装一下」

记一个粗规则:先 7B~14B 把流程跑通,再加参数;不要一上来就 70B。


四、一张「选型速查」(更简单)

要自己装、数据尽量不出网

    ├─ 主要中文对话? → Qwen 通用版(7B/14B 起)

    ├─ 主要写代码?   → Qwen-Coder / 代码专用模型

    ├─ 要强推理?     → DeepSeek R1 蒸馏版

    ├─ 只要轻量 Demo?→ Phi 或 8B 级 Llama/Qwen

    └─ 还要知识库?   → 再装一个 Embedding(别跟聊天抢同一套配置糊弄)

安装入口对企业研发最省事的是 Ollama(一条命令拉模型);上生产再考虑 vLLM 等更高吞吐方案——那是下一篇的事。


五、和「闭源 API」差在哪(一句话)

开源可自建
闭源 API(如部分云厂商)

权重

可下载到自己机器

一般拿不到

数据

可内网推理

看合同与区域

成本

买算力 + 运维

按 Token 付费

上手

要装环境、选规格

开通就能调

不是谁更高级,是:要不要模型跑在自己墙上。


六、小结

今天只记住三句话:

  1. 能自己装的
    ,先认家族:Qwen / Llama / DeepSeek / Mistral / Gemma / Phi
  2. 按用途选
    ,别按热搜选:中文、代码、推理、检索不是同一个模型
  3. 按显存选规格
    :小模型跑通,再考虑变大

把地图看清,下一步才是:怎么安装、怎么配进业务系统、要不要微调。


介绍一些模型的命名规则


通用结构

家族名 + 版本 + 参数量 + 用途/变体 +(可选)量化/格式

例子:qwen2.5:7b、llama3.1:8b-instruct-q4_K_M、deepseek-r1:14b

片段
含义
常见写法

家族

哪条产品线

Qwen、Llama、Mistral、Gemma、Phi、DeepSeek

版本

第几代

2.5、3.1、3.3、R1

参数量

模型规模(约)

7B=70亿、14B、32B、70B;1.5B=15亿

用途/变体

训成干什么的

见下表

量化等

压缩精度、运行格式

Q4_K_M、Q8_0、GGUF、FP16

B = Billion(十亿参数)。数字越大一般越强、越吃显存。


用途/变体常见后缀

名字里出现
大致意思

Instruct / Chat / IT

对话、听指令(企业助手多用这个)

Base / Pretrain

基座,未充分对齐;一般不直接当客服

Coder / Code

偏写代码

Math

偏数学

Vision / VL / Omni

能看图/多模态

R1 / Thinking / Reasoner

偏推理,回答可能更长、「先想再说」

Distill / Distilled

从大模型「蒸馏」来的小模型,好部署

MoE / A3B 等

混合专家;总参数大,但每次只激活一部分,省算力

Ollama 里常见写成:qwen2.5:7b、qwen2.5-coder:14b、llama3.1:8b-instruct。


量化名怎么读(选安装包时用)

标记
含义(直觉)

FP16 / BF16

半精度,质量高、占显存大

Q8

8 比特量化,接近原精度

Q4 / Q4_K_M

4 比特,体积小、本机最常用

Q5 / Q6

介于 Q4 与 Q8 之间

GGUF

llama.cpp / Ollama 常用权重格式

同一句「7B」,Q4 和 FP16 显存差很多;名字里带 Q4,通常更好在笔记本上跑。


几个完整例子

全名
拆开读

Qwen2.5-7B-Instruct

通义 2.5 代 · 70亿 · 指令对话版

qwen2.5-coder:14b

同上家族 · 代码版 · 140亿

Llama-3.1-8B-Instruct

Llama 3.1 · 80亿 · 指令版

DeepSeek-R1-Distill-Qwen-14B

R1 推理能力 · 蒸馏到 Qwen 骨架 · 140亿

nomic-embed-text

不是聊天模型,是 Embedding(向量)


企业选型时看名字的顺序

  1. 家族 + 中文/场景
    (如中文 → Qwen)
  2. Instruct/Chat
    ,避开裸 Base(除非你要自己再训)
  3. B 数
    是否配得上显存
  4. 要代码 / 推理 / 看图 → 看有没有 Coder、R1、VL
  5. 本机安装 → 优先带 Q4 一类量化标签的包

一句话:

名字 = 谁家的 + 第几代 + 多大 + 干什么用的 +(可选)压得多狠。

会拆这五段,开源模型列表就不会晕。

随机文章