公司准备上AI时,老板最常问的一句话是:
“现在到底哪家大模型最好?”
这个问题看起来专业,实际上很容易把选型带偏。
因为企业最终购买的,不只是一个模型的回答能力,而是一整套可用、可管、可核算、可退出的业务能力。
同一个模型,用在会议纪要上可能已经足够;用在合同审查、客服回复或内部知识查询上,要求却完全不同。排行榜第一,不代表它能接入你的权限体系;演示效果惊艳,也不代表员工每天愿意用。
所以,大模型选型的正确顺序应该反过来:
先选任务和采购路径,再用真实业务数据选模型。
第一个问题:你到底要替代哪一步,而不是“想上什么AI”
“提升效率”“建设企业知识库”“打造智能助手”都不能直接拿来选型。
先把目标写成一个可验收的任务:
谁,在什么场景下,把什么输入交给AI,得到什么输出,最后由谁确认?
例如:
售前顾问收到客户需求后,把访谈纪要和标准产品资料交给AI,在10分钟内生成方案框架,由顾问复核后发给客户。
这句话会立刻暴露五个选型条件:输入里有没有客户信息、需要读取哪些内部资料、输出允许多大错误、谁负责复核、响应速度是否重要。
如果任务还说不清,就不要进入厂商比选。否则每家供应商都能演示一个好看的答案,你却没有同一把尺子判断好坏。
第二个问题:数据能不能出去,谁能看见,留多久
企业采购最危险的一句话是:
“放心,我们不会拿你的数据训练。”
这句话只回答了一个问题,没有回答数据在哪里处理、是否留存、谁能访问、日志保存多久、子处理方有哪些、停用后如何删除。
公开的官方说明也能看到这些差异。OpenAI说明,其企业产品和API数据默认不用于训练模型;Google Cloud说明,在未经客户许可或指示时,不会使用Vertex AI客户数据训练或微调模型;Microsoft的相关文档则区分了部署类型、处理地域、存储功能和滥用监测。它们共同说明一件事:
不能只看品牌承诺,必须核对你实际购买的产品、功能和合同条款。
采购前至少把数据分成三档:
- 低敏数据:已公开的产品资料、公开政策、通用写作素材;
- 内部数据:内部流程、经营分析、未公开方案、知识库;
- 高敏数据:客户个人信息、商业秘密、财务明细、合同原文、账号凭证。
不同数据可以走不同路径。没必要为了公开文案生成就自建一整套系统,也不能因为试用方便,就把客户名单直接粘贴进未经批准的个人账号。
涉及个人信息、商业秘密或跨境处理时,应由法务、信息安全或数据合规负责人结合具体业务确认,不要把技术销售的口头回答当作合规结论。
第三个问题:买企业版SaaS、接API,还是做私有化
这三条路线解决的不是同一个问题。
这里有两个常见误区这里有两个常见误区。
第一,私有化不自动等于安全。权限配置错误、日志泄露、知识库越权和终端复制,都可能发生在企业自己的环境里。
第二,API不自动等于便宜。当你需要做知识检索、文档解析、权限映射、人工复核、监控和异常处理时,真正的成本远不止模型调用费。
第四个问题:别看公开榜单,用自己的30道题测试
通用榜单适合初筛,不适合替你做采购决定。
企业应该建立一套小型“黄金测试集”:从真实工作中选30个有代表性的任务,隐去不必要的敏感信息,并给每个任务写清合格标准。
建议至少覆盖五类情况:
1. 常规任务:日常高频输入,检查基本质量;
2. 复杂任务:长文档、多条件、跨文件信息,检查能力上限;
3. 缺失信息:故意不给关键资料,看模型会不会编造;
4. 敏感任务:包含权限、隐私或不当请求,检查拒答和升级流程;
5. 异常任务:格式错误、重复文件、冲突数据,检查系统是否可控。
不要只让项目组给答案打“好、一般、差”。建议按六项记录:
最后一项尤其重要。
一个单价低但需要反复重试和大量人工修改的方案,可能比单价高但一次通过的方案更贵。
第五个问题:算总成本,不要只看席位价或Token价
企业AI的年度总成本,可以先用这个框架估算:
年度总成本 = 软件或模型费 + 接入开发费 + 知识库与数据整理费 + 安全合规投入 + 培训推广费 + 运维评测费 + 人工复核成本 + 迁移退出成本
再把它与可验证收益放在一起:
年度净收益 = 节省的有效工时价值 + 新增业务贡献 + 减少的错误与返工损失 - 年度总成本
“有效工时”不是AI生成用了几秒,而是从收到任务到产出可被采用的结果,整个流程实际减少了多少时间。
“新增业务贡献”也不能把所有销售增长都算给AI。只有能找到对照、过程记录或稳定归因的部分,才适合进入决策表。
如果收益暂时不能换算成金额,至少跟踪四个代理指标:采用率、一次通过率、平均修改时间、重大错误数。
第六个问题:如果三个月后要换,能不能换得动
大模型更新很快。真正稳健的选型,不是押中永远最强的模型,而是避免被一个模型、一个提示词格式或一个知识库结构锁死。
采购前问清:
- 企业数据和对话记录能否完整导出;
- 知识库原文件、切片和元数据是否仍归企业所有;
- 工作流是否支持替换模型,而不是全部重做;
- 停止合作后,数据如何删除并提供什么证明;
- 价格、限额或产品能力变化时,合同有没有处理机制;
- 核心提示词、评测集和验收标准是否由企业自己保存。
退出机制不是唱衰供应商,而是给企业保留议价权和连续经营能力。
一棵给老板的大模型选型决策树
可以先按下面的顺序判断:
是否已经有一个高频、可验收的业务任务?
├─ 否 → 暂停选模型,先定义任务、负责人和基线数据
└─ 是
├─ 主要是通用办公,暂不需要深度接入内部系统?
│ ├─ 是 → 优先试企业版SaaS,先看活跃率和采用率
│ └─ 否
├─ 需要嵌入业务流程、调用内部系统或精细控制输出?
│ ├─ 是 → 优先做API/云平台小规模试点
│ └─ 否 → 重新检查是否真的需要定制开发
└─ 是否存在明确的数据、部署或控制要求,且有持续运维能力?
├─ 是 → 评估私有化或混合部署,并核算三年总成本
└─ 否 → 不要为了“看起来安全”过早私有化
这棵树不是替你选厂商,而是先把不合适的采购路径排除。
给供应商的12个问题
正式比选时,不妨把下面12个问题原样发给每一家供应商,并要求书面回答:
1. 这个方案针对我们哪个具体任务,验收标准是什么?
2. 本次使用的是哪个产品、模型和版本,版本变化如何通知?
3. 输入、输出、文件和日志分别在哪里处理与保存?
4. 数据是否用于训练、产品改进、人工审查或滥用监测?适用哪些例外?
5. 数据保存多久,谁有权限访问,能否配置或关闭?
6. 是否涉及第三方服务或子处理方?
7. 权限是否能继承企业原有的部门、角色和文档权限?
8. 出错、越权、提示词攻击或服务中断时,如何发现和处理?
9. 除报价单项目外,实施、存储、流量、运维和升级还会产生哪些费用?
10. 能否用我们的测试集做盲测,并导出完整结果?
11. 数据、知识库、提示词和评测记录能否迁移到其他方案?
12. 试点失败或合同终止后,数据删除、账号回收和服务退出如何完成?
如果一家供应商只能讲模型多强,却不能清楚回答数据、权限、验收和退出问题,它还没有真正回答企业的选型问题。
最后:企业要选的不是“最强模型”,而是“最合适的闭环”
一次靠谱的大模型选型,至少应该形成六样东西:
- 一个边界清楚的业务任务;
- 一张数据分级和流向图;
- 一套来自真实业务的测试集;
- 一份包含人工成本的总账;
- 一个明确的试点通过线和停止条件;
- 一套可导出、可替换、可退出的安排。
模型能力当然重要,但它只占选型的一部分。
对大多数企业来说,先用10个工作日跑通一个小任务,比花两个月争论哪家模型排名更高,更接近真正的AI落地。