为什么模型评测是企业AI应用的核心能力,如何进行模型评测?
模型评测是指通过系统化的方法、指标和场景,对已训练的大模型的功能、性能、安全性、可靠性、伦理合规性等进行全面评估的过程。其核心目标是量化模型的能力边界、发现缺陷、验证有效性,为模型优化、迭代或应用决策提供依据。发布决策:测试大模型的产品质量,验证大模型应用能否解决客户问题,发现缺陷、评估风险、决策能否商用发布创新改进:度量评估模型能力,为试错创新、训练调优提供改进数据,支撑大模型迭代学术研究:探索和理解大模型能力边界,评估涌现能力及潜在风险安全监管:通过评测确认符合法律法规和社会安全,遵从政府部门监管要求行业准入:通过大模型行业准入标准测试,得到行业权威机构认证我们对业界大模型的评测框架进行了洞察,包括(HELM-斯坦福、CLEVA-港中大、LLMEVAL-复旦、SuperCLUE-第三方评测机构),总结出他们主要考察如下4个方面:通过对大模型评测框架的调研,我们发现3个业务通用的评估属性\指标,分别为准确性(accuracy)、鲁棒性(robustness)、校准与不确定性(Calibration & Uncertainty)。准确性(accuracy)是人工智能研究中最广泛的属性,是指所有评估实例中模型的平均正确性(average correctness of model accross all evaluation instances)。如果人工智能系统不够准确,它们就没有用处,这是为什么习惯把准确性等同于基本功能正确性的原因。鲁棒性(robustness)指的是模型在面对输入的扰动时能保持其性能的能力。例如,一个鲁棒的LLM能够在问题被稍微改写或包含轻微的打字错误、同义词替换等情况下,仍能够正确的回答问题。校准与不确定性(Calibration&Uncertainty),在高风险的环境中,如决策制定,模型要有能力表达对其预测结果的信心或确定性,模型的不确定性指标可以让人类对可能的错误结果有所预期,并进行适当调整和干预,避免潜在的风险。如何进行模型评测,关键在于制定评测标准,也就是评测集。使用标准的测试数据集和度量指标来比较和评估模型。Benchmarkde的关键你在于“标准”,标准的意义在于统一。没有统一的测试标准,测试结果就没有可比性,更无法基于确定的“基准”评估改进。所以制定好的评测集,是模型评测成功的关键。有确定问答范式的,可以通过脚本批量生成。推荐使用Prompt模版 + 业务场景组合的形式生成问题和答案。没有固定问答范式的,以人工出题为主。推荐从Agent的回流日志中提取用户问题 + Prompt模版的方式生成问题和答案。绝对评测:对于数据集有参考答案,用模型生成答案与参考答案对比,是一种客观、绝对的评测方式,可以“全自动阅卷”。度量指标包括正确率/ROUGE/BLEU/EM,Precision/Recall/F1等。绝对评测用于评估模型在某一特定任务或数据集上的能力表现,使用预定义的标准和指标来量化模型的表现。其目的是提供一个客观的Benchmark标准,评估模型是否达到预期的能力标准。相对评测:是一种比较不同被测模型的输出,评估模型相对表现的方法。其目的是找出在特定任务或数据集上表现最好的模型,并了解不同模型之间的优劣。例如伯克利LMSYS组织的Charbot Arena。评测结果分析是模型评测很重要的一个环节,针对评测出的问题,追溯模型的输出链条,加以修正,是提升模型能力的关键。