| | | |
| “操作系统在什么条件下触发缺页异常?”多项选择;Accuracy。MMLU 覆盖 57 个学科,MMLU-Pro 把选项扩为 10 个并增加推理题 | | 开放写作、对话体验和生产可靠性;高分也可能来自题库熟悉度 |
| “某量子体系经过两个非对易操作后,测量结果如何变化?”研究生级选择题;Accuracy | 生物、物理、化学的专家知识与多步科学推理;适合研究型问答候选测试 | 其他专业能力;非专家也难核验,企业应用仍需领域专家评审 |
| “仓库有 48 箱货,卖出 6 箱后补入 2 箱,重复三次还剩多少?”答案匹配 | | 高等数学、真实财务分析;数据已较老,需防污染与饱和 |
| “已知多项式满足若干整除条件,求整数参数。”竞赛数学;Exact Match | 代数、几何、数论等竞赛推理,能拉开 reasoning model 差异 | 日常数值工作、表格分析;得分对 CoT、答案提取和推理预算敏感 |
| “甲早于乙,丙晚于甲但早于丁,谁最早?”23 类困难任务;平均准确率 | 逻辑演绎、对象跟踪、组合推理,以及 CoT 是否有帮助 | 全面知识水平;任务较小且偏合成,Prompt 改动可能影响较大 |
| “用恰好三点回答;每点八个汉字;不得出现‘模型’。”严格/宽松、Prompt/Instruction 四类准确率 | 可程序验证的格式、长度、关键词等指令遵循;适合结构化输出前测 | 内容是否正确、有帮助;模型可能完美守格式却答错事实 |
| “吞下口香糖真的会在胃里停留七年吗?”Truthfulness 与 Informativeness | 能否抵抗网络文本中的流行误解;适合检查“自信复述谬误” | |
| “依据中国现行语境回答一道人文、工程或职业资格选择题。”Accuracy | 中文环境下从中学到职业级的 52 学科知识与推理;适合中文基座初筛 | |
| 新近数学、代码、数据分析或指令题;按可验证标准答案自动评分 | | 人类偏好和私有业务效果;不同发布时间的版本不能无条件横比 |