这段时间模型更新得太快了。
几乎每隔一阵,就会看到一个新模型出来。参数更大了,测试分数更高了,推理、写代码、做图,好像什么都比上一代强。
我也会看这些对比。看到一个模型冲到榜单前面,第一反应很自然:这个是不是现在最好的?公司是不是也应该直接用最强的?
但我自己把AI放进不同工作以后,越来越觉得这个问题问得有点早。
模型强不强当然重要,可公司真正要选的,不是一个比赛冠军,而是一个能进入现有工作、长期稳定干活的工具。
这两件事看起来差不多,实际差得挺远。
排行榜上的第一名,不一定能顺利穿过真实工作的各种限制。
01 / NOTE
排行榜没有错,只是它回答的是另一个问题
排行榜很有价值。它能让我们快速知道一个模型大概擅长什么,在相对统一的任务里表现怎么样。
但企业里的任务通常一点都不统一。
有的工作要读取本地文件,有的要追溯信息来源,有的不能把资料传到外部平台;有的人需要它写代码,有的人只希望它把一份固定报告整理好;有的结果错一个字都要返工,有的只要先给一个可讨论的草稿。
排行榜很难把这些东西放进同一张表里。
它可能告诉你谁推理更强、谁速度更快,却不会告诉你:这个模型能不能接进你的文件系统,员工愿不愿意用,出了错能不能找到原因,一整条流程跑下来到底花了多少钱。
所以我现在看榜单,更多是把它当成候选名单,而不是采购答案。
榜单回答“谁在这场考试里分数更高”,企业要回答“谁能在我的条件下把事情做成”。
02 / NOTE
我做的几类工作,根本不需要同一个“最强”
我平时会让AI参与几种完全不同的工作。
做产品和行业调研时,我最在意的是来源能不能追溯,事实、推断和待验证信息有没有分开。它写得慢一点没关系,但不能把没有证据的判断说得特别肯定。
做公众号内容时,要求又变了。它要读懂我的素材和账号定位,语言不能太书面,还要按固定排版生成能直接复制的HTML。文章写得再漂亮,如果每次都要我重新解释语气和格式,我也很难长期用。
做图片时,我关心的是尺寸、构图、文字和裁切安全区。模型单张图看起来很好,但放进文章后不协调,或者公众号横图一裁成方形就缺一块,也不算完成。
到了长期工作流,我又会在意它能不能读取规则、自己拆任务、检查结果,并把这次返工的经验留给下一次。
你会发现,这几类工作需要的能力根本不一样。
调研要证据,内容要理解,图片要审美和规格,工作流要稳定、可检查、能接着做。想用一个总分把它们全部排出高低,本身就不太现实。

同一个“AI能力”,进入不同工作后会变成完全不同的验收标准。
03 / NOTE
真到企业选型,我觉得要先从结果往回看
以前我容易先看模型,再想它能用在哪里。
现在我的顺序会反过来:先选一条具体工作,讲清楚到底想改变什么。
比如是想让一份每周报告从两小时缩短到半小时,还是想减少资料遗漏,或者让新人也能按统一标准完成初稿。目标不同,后面的选择会完全不一样。
目标明确以后,再看模型有没有完成这件事需要的能力。
这里的“能力”也不是功能列表越长越好。只要它能稳定完成这条流程里最难、最关键的几步就够了。其他看起来很厉害、但工作里根本用不到的能力,不应该成为主要购买理由。
这一步看起来很朴素,却能挡住很多“先买回来再说”的冲动。
因为企业需要的不是拥有一个厉害模型,而是让某个具体结果变好。
模型能力过关以后,我还会继续看五件事。
第一是整条流程的总成本。不只是一次调用多少钱,还包括员工修改、反复沟通、等待、返工和人工接管。如果模型便宜,但每次结果都要人重做,最后一点也不便宜。
第二是数据和使用边界。哪些资料可以交给它,哪些不能;数据放在哪里,权限怎么管,使用时需要遵守什么规定。这部分不能靠一句“应该没问题”带过,涉及正式业务时还要让IT、数据和合规人员一起确认。
第三是能不能接进现有流程。它能不能读公司的文件,能不能接住上一步的结果,输出能不能直接交给下一步。每次都靠人复制粘贴,也许能试用,但很难规模化。
第四是员工到底会不会用。如果一个模型只有特别会写Prompt、懂技术的人才能发挥效果,它在少数人手里可能很强,放到团队里却不一定稳定。真正落地时,界面、操作习惯、培训成本和犯错后的恢复方式都很重要。
第五是长期稳定性。连续跑一百次,成功率怎么样?模型更新以后原来的流程会不会失效?失败时能不能退回人工?这些问题平时不太吸引眼球,但真进入工作以后,每一个都会变成成本。

企业选AI需要同时看能力、总成本、数据边界、流程接入、员工使用和稳定性。
05 / NOTE
与其争谁最强,不如拿真实任务跑一轮
如果几个模型看起来都能做,我觉得最直接的方法不是继续看更多测评,而是拿自己的真实任务做一次小测试。
挑一小批最近真的做过、难度有差异的任务,用同一份输入、同一套规则和同一个验收标准分别跑。不要只看最好的一次,也别只挑特别适合演示的案例。
最后记录几个很简单的数据:一次能不能通过,完成要多久,人工改了多少,过程中接管了几次,整条流程实际花了多少钱。
还可以专门放进几条容易出错的任务,看看它遇到边界情况会怎么处理。是主动说不确定,还是给出一个看起来很完整、实际不能用的答案。
跑完以后,结果可能没有榜单那么漂亮,但会更接近你真正要做的决定。
企业选型不是替模型颁奖,而是在自己的业务里做一次小规模验收。
06 / NOTE
最强会一直变,适配标准应该留下来
模型排行榜当然还会继续看。
它能帮我们发现新的候选,也能提醒我们哪些能力正在快速进步。但我不会再看到第一名,就默认它最适合所有公司、所有部门和所有任务。
真到工作里,我更关心的是:它能不能把这件事做成,整个过程要付出多少成本,数据和责任边界是否清楚,普通员工能不能稳定使用,出了问题有没有退路。
模型会不断换,今天的第一名也可能很快变成下一页。
但公司把业务结果、验收标准和现实约束讲清楚以后,这套选择方法不会跟着榜单一起过期。
所以公司选AI,最重要的可能不是先找到“最强模型”,而是先弄明白:我们到底需要它在什么条件下,稳定做好哪一件事。

公司选AI的正确顺序