做第一份 AI 评测集,先填清这 5 个字段
第一份 AI 评测集,可以先打开一个表格:
一行是一道测试题,写清输入、正确结果和判定方法,再让 AI 作答。这样改模型或提示词后,还能用同一批题比较表现。
老演员登场:给订单按金额升序排列。原始数据是 A / 30 元、B / 10 元、C / 20 元,执行后恢复原数据集。
下面的字段设计仅供参考:
1. 编号:例如 sort-001,用于标记具体的题目。
2. 任务输入:主要是写明给 AI 哪些材料,例如任务,原始订单数据等等。
3. 参考结果:比如 A、C、B。
4. 判定规则:比如返回 A、C、B,还是返回 A=30 元,C=20 元,B=10 元。
5. 场景标签:比如排序。
这样一个整行就是一个样本,将任务输入交给 AI,参考结果交由评测人员进行审核。
创作说明:AI 协助制图。方法依据来源如下。
1. Anthropic:Agent 评测的任务、判定与运行记录
(https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents)
2. OpenAI Evals:输入与参考答案的样本定义(https://github.com/openai/evals/blob/main/docs/build-eval.md)