一个被大多数人忽略的关键数据
先看一组行业实测。传统逻辑回归评分卡在2020年前后的信贷场景中,KS值尚能维持在0.35-0.40。但进入2024-2026年,随着信贷客群碎片化加剧、“信用白户”占比持续上升,传统评分卡在普惠小微场景的KS值已普遍降至0.25-0.30。与此同时,基于集成学习框架的大数据风控模型,在同场景下KS值稳定在0.45-0.50。
这个差距不是“好一点”和“差一点”的区别。KS从0.28到0.45,意味着在同样的通过率下,坏账识别能力可能相差一倍以上。对于一家年放款百亿级别的机构来说,这背后是数千万甚至上亿的损失差额。
但如果你以为答案就是“无脑上机器学习”,那就太天真了。
三个维度,看清两种模型的真实处境
第一,效能维度:机器学习赢在“看得见”,评分卡输在“看不见”
机器学习模型真正拉开差距的地方,是它能看到评分卡看不到的东西。传统评分卡的数据基础通常来自征信报告、申请表信息和内部历史表现数据,变量数量在50-200个维度,更新频率以月或季度为单位。而大数据风控模型的数据单元是“实时交易事件+设备指纹+社交关系+地理轨迹”的多模态风险信号。
说白了,评分卡是在用“月度快照”判断一个人,机器学习是在用“实时直播”判断一个人。对于有稳定征信记录的客群,快照够用;对于薄档案人群——那些没有信贷记录但有活跃消费行为的个体——快照几乎等于盲人摸象。
一项覆盖印度零售信贷市场的实证研究也印证了这一点:XGBoost在所有评估标准下均显著优于逻辑回归和神经网络,AUC达到0.901,而逻辑回归虽然预测力较弱,却是“最具可解释性和可审计性的模型”。
第二,合规维度:这是评分卡最后的堡垒,也是机器学习最大的软肋
监管的态度非常明确。2025年发布的银行保险机构数据安全管理办法要求,机构在信息系统和模型算法投入使用前,必须审查“数据与模型使用的合理性、正当性、可解释性”。使用人工智能技术开展业务时,应当就“数据对决策结果的影响进行解释说明和信息披露”。
这意味着什么?当你的机器学习模型拒绝了一位客户的贷款申请,你必须在规定时间内给出一个人类能理解的拒绝理由。“模型算出来你评分低”不算理由。“你的设备指纹与三个已知欺诈团伙存在关联、近30天夜间交易频率异常升高、社交关系图谱中高风险节点占比超过阈值”——这才算。
问题的核心在于:树模型和深度学习的解释方法(如SHAP、LIME)本身存在不一致性。全局特征重要性和局部解释经常打架,单调性约束难以保证,不同时间窗口的解释可能自相矛盾。一位监管人士曾公开指出,机器学习、深度学习“必然带来模型的‘黑箱’特性”,未来监管需要面对这一挑战。
所以现实是:如果你的模型只用于辅助决策、不直接触发拒绝,机器学习的合规压力可控;但如果模型直接决定“拒贷”,没有足够解释能力的模型就是一颗定时炸弹。
第三,成本维度:不只是钱的问题
评分卡的训练成本低到可以忽略——1000万样本量级下,逻辑回归训练耗时3-6小时,资源成本每周1.5万-2.2万元。而机器学习模型的特征工程、调参、部署、监控链条更长,对团队的技术栈要求也更高。
但真正的成本差距不在训练阶段,而在运维阶段。评分卡上线后,每个季度做一次变量稳定性监控就够了。机器学习模型需要持续的特征监控、模型衰减检测、解释一致性审计、对抗样本防御。这些工作不是一次性的项目投入,而是持续的运营负担。
我的建议:不做选择题,做架构题
在服务过多家机构的模型建设后,我越来越确信一个判断:评分卡和机器学习不是替代关系,而是分层关系。
具体来说:
场景一:标准化信贷产品(信用卡、消费贷)——双轨并行
前端用机器学习模型做风险排序和额度建议,后端用评分卡做最终决策的“解释锚点”。做法是:机器学习输出一个风险概率,映射到评分卡刻度上,最终拒绝理由仍由评分卡的变量体系来生成。这既拿到了机器学习的区分度提升,又保住了合规解释能力。有研究提出的“残差学习混合框架”就是这个思路的学术版——逻辑回归评分卡打底,梯度提升模型只对残差做修正,每次预测都可分解出“线性可解释部分”和“非线性修正部分”的占比。
场景二:普惠小微信贷、薄档案客群——机器学习主攻,评分卡兜底
这类客群的特征是:传统征信数据覆盖不足,但替代数据丰富。机器学习的优势可以充分发挥。但要注意两点:一是必须建立完善的解释层(SHAP+业务规则映射),确保每笔拒绝都能生成可读的理由;二是设置评分卡作为“安全网”,当机器学习模型的解释置信度低于阈值时,自动降级到评分卡决策。
场景三:强监管场景(大额信贷、对公业务)——评分卡主导,机器学习辅助
这类场景下,一笔坏账的后果远大于多赚几个基点的收益。评分卡的稳定性和可审计性是第一优先级。机器学习可以用来做贷后预警和早期风险信号捕捉,但不直接参与审批决策。
落地时最容易踩的三个坑
第一坑:用KS值选模型,用AUC交差。KS和AUC衡量的是排序能力,但风控真正需要的是“在特定通过率下的坏账率”。选模型时应该看的是“同等通过率下,哪个模型的坏样本捕获率更高”,而不是看谁的排行榜分数好看。
第二坑:忽略模型衰减曲线。评分卡的衰减通常是缓慢的、可预测的;机器学习模型的衰减可能是断崖式的——当客群结构发生突变时,模型可能在两周内从有效变成有害。建议对机器学习模型设置更频繁的监控频率(至少双周一次),并建立自动降级机制。
第三坑:把“可解释性”当成技术问题。可解释性本质上是业务问题。一个模型的SHAP值再漂亮,如果业务团队看不懂、客服团队无法向客户传达、合规团队无法向监管说明,那这个解释就是无效的。建模时就应该让业务方参与变量筛选和分箱逻辑的设计,而不是模型做完后再“翻译”。
最后说一句
评分卡代表的是“我知道自己在做什么,我愿意接受精度损失来换取确定性”。机器学习代表的是“我愿意承担不确定性,来换取更高的效能上限”。这个选择没有标准答案,但它必须由业务负责人来做,而不是由算法工程师来做。
技术从来不缺选项。缺的是,在效能和合规之间找到那条可持续的路径。