当前位置:首页>排行榜>AI在产品中的应用,先写评测集在写Prompt稳定性提高了

AI在产品中的应用,先写评测集在写Prompt稳定性提高了

  • 更新时间 2026-09-19 22:21:28
AI在产品中的应用,先写评测集在写Prompt稳定性提高了
从开发skill到agent将AI在软件产品或者项目开发应用,一直就是不怎么稳定,AI有时候很感性,测试时准确率感觉有60%,版本发布上线后只有60%,后面试着先写评测集,再写 Prompt,效果好像要好那么点。
常规软件开发流程是:
需求 → 设计 → 编码 → 测试 → 上线
用AI进行功能开发时,会自然套用这个流程:
需求 → 写 Prompt → 试几个例子 → 感觉不错 → 提交测试→功能发布。这个模式通常让我们觉得
1. Prompt 是感觉驱动的改几个词觉得输出更顺了,就认为变好了。实际上可能只是当前几个例子里运气好,换了真实数据就崩。
2. 没有量化标准感觉不错不是指标。我们觉得不错,QA 觉得不行,运营觉得一般,老板觉得还行——谁也说服不了谁。
3. 无法回归下周换了模型版本,或者改了知识库,原来的 Prompt 可能突然变差。没有评测集,我们根本不知道什么时候退步了。
用逆向思维,评测集就是什么是对的的具象化。它的作用不是测试,而是锁定目标。
以往我们写一个 Prompt → 看看输出好不好 → 不好就改 Prompt → 直到看着顺眼
逆向思路:
我们先准备 50 条真实输入 + 人工标注的标准答案 → 然后写 Prompt → 跑评测 → 看分数 → 改 Prompt → 再跑评测 → 直到分数达标
区别在于:第一个方式是主观审美驱动,第二个方式是客观标准驱动
逆向思路具体怎么做:四步法
第一步:攒评测集,不用完美,但要真实
不需要一开始就搞几百条。50 条就够了,关键是:
1)覆盖主要场景:比如账户状态,要有正常类、异常类
2)包含边界情况:空输入、超长输入、多意图混杂、语气极差
3)包含典型错误:之前人工判断错误的类别,一定要放进去
4)标注标准答案:每条都要有人工确认的正确输出
我们不要用 AI 生成评测集。AI 生成的答案本身就有偏差,用它来评测等于自己给自己打分。
第二步:写 Prompt 时,先跑一遍评测集
不是写完再跑,是边写边跑。
每改一次 Prompt,就跑一遍全部 50 条。看分数变化:
如果分数涨了,说明改对了
如果分数跌了,说明改坏了
如果有的涨有的跌,要看是哪些样本变了,判断是 trade-off 还是方向错了
这个过程非常枯燥,但它是能让我们确信我在变好的方法。
第三步:设定通过线,不到线不提交测试
根据业务容忍度,设定最低通过标准。例如:
主场景准确率 ≥ 90%
边界场景准确率 ≥ 70%
零幻觉:不能出现虚构事实(比如开户里没有的客户信息,模型自己编出来)
第四步:上线后持续回流
评测集不是一次性资产。线上跑的数据里,挑出:
模型答错的、人工修正过的、用户投诉过的,每周补充进评测集。这样评测集会越来越厚,模型也越来越稳。
Prompt 是猜想,评测集是证据。
先有证据,再有猜想;
先定义正确,再追求正确;
先锁死标准,再优化输出。
#AI在ToB软件产品开发中思考  #prompt 

随机文章