AI×金融知识站
–

kp-013 · 模型评价与监控:AUC、KS、PSI

核心 模块:量化与风险 预计 25 分钟 更新 2026-10-02

一句话定义

AUC、KS、PSI 是金融分类模型(尤其评分卡)的三件核心仪表:AUC 度量区分能力,KS 度量好坏分布的最大分离度,PSI 度量分数与特征的稳定性——读懂它们是验收与监控任何风控模型的基本功。

为什么重要

金融模型的价值不在训练完成那一刻,而在运行的每一天:客群漂移、宏观变化、策略调整都会让模型静默退化。这三个指标回答三类不同问题——"模型分得开好坏吗"(AUC/KS,开发期与监控期都要看)、"客群还是模型认识的那个客群吗"(PSI,监控期核心)、"阈值附近决策还可靠吗"(混淆矩阵族指标+业务成本)。不懂这三件仪表,就无法担任模型的验证、审批与监控角色;而模型验证在多数监管框架下是强制动作(kp-026)。

前置知识

kp-012(评分卡与概率输出)。统计基础:累积分布函数(CDF)概念、混淆矩阵。

直观类比

把模型比作安检门:AUC 是"随机拿一件违禁品和一件正常品,安检门能正确排优先级的概率"(整体区分力);KS 是"违禁品与正常品分布拉开的最大距离"(最准的那一刀切在哪里);PSI 则是"今天过检的行李构成和上周还是不是同一批"——行李构成变了(客群漂移),哪怕门的灵敏度没坏,判定规则也可能不再适用。

核心概念

  • 混淆矩阵族:TP/FP/TN/FN 衍生出精确率(P)、召回率(R)、F1;金融场景类别极不平衡(违约率常 <5%),准确率无意义,必须看排序类与业务成本类指标。
  • AUC(ROC 曲线下面积):概率解释为"随机正样本排在随机负样本之前的概率";0.5 等于随机,0.7+ 在信贷场景属可用,0.8+ 常见于较好客群——但绝对数值依赖样本定义,不可跨项目直接比较。
  • KS 统计量:好坏样本累积分布的最大垂直距离,KS = max|CDF_good(s) − CDF_bad(s)|;它落在某个分数切割点上,指示"最佳区分切点";风控常用经验区间 0.3+ 可用(教学参考值,非行业标准)。
  • PSI(种群稳定性指数):比较两个时期分数(或特征)分布的差异,PSI = Σ(实际占比−预期占比)×ln(实际占比/预期占比);经验阈值:<0.1 稳定、0.1–0.25 需关注、>0.25 显著漂移须介入(业内常用参考值)。
  • Lift 与增益图:按分数排序后前 x% 样本捕获的坏客户占比相对随机的倍数,直接对应"先催收谁/先审查谁"的业务动作。
  • 监控机制:PSI 盯输入与分数漂移,KS/AUC 滚动窗盯区分度衰减,双指标交叉触发重训或换模评审(冠军-挑战者机制:新模型并行打分不生效,达标后切换)。

原理与机制

AUC 的物理含义来自 ROC 曲线的构造:阈值从 1 扫到 0,每个阈值给一组(FPR, TPR),曲线下面积即"随机正样本得分高于随机负样本"的概率——它与阈值无关,所以适合评价模型本身;但业务决策在固定阈值上发生,AUC 好不等于当前阈值下的精确率好,两者不可互相替代。KS 的机制:它是两个 CDF 的最大距离,天然带出"最优切点",适合评分卡这类需要分段策略的场景;但 KS 只反映单点最大分离,对整体排序质量不敏感,须与 AUC 同看。PSI 的机制:逐箱比较两期分布并按对数比例加权,小箱波动被自然放大——这正是设计意图(小箱占比剧变往往是入口客群或政策变化的最早信号)。三者构成"区分度(AUC/KS)+ 稳定性(PSI)"的正交监控对:区分度掉说明模型退化了,稳定性掉说明世界变了——两种情况的应对(重训 vs 换客群策略)完全不同。

公式或模型

AUC = P( score(正样本) > score(负样本) ) (含并列按 0.5 计)
KS = maxs | CDFbad(s) − CDFgood(s) |
PSI = Σi ( pi^实际 − pi^预期 ) × ln( pi^实际 / pi^预期 )
F1 = 2PR / (P+R) Lift@x% = 前x%捕获坏客户占比 / 总体坏客户占比

图示

分数轴 →
 好:  ▁▂▃▅▇▇█ (集中高分)      CDF_good: __╱──
 坏:  █▇▅▃▂▁▁ (集中低分)      CDF_bad:  ╱▔▔
                最大垂直距离 = KS (发生在切点 s*)
监控: PSI(分数分布 vs 建模期) → 漂移报警
      滚动 AUC/KS → 区分度衰减报警
      双报警交叉 → 冠军-挑战者评审

实例或案例

某消费贷 B 卡上线 14 个月后的监控案例:前端获客渠道调整后新客占比结构变化,PSI 从 0.06 升至 0.31(分数分布显著漂移),而滚动 KS 稳定在 0.34(区分度未衰减)。监控面板判定为"客群变了、模型没坏",处置不是重训而是把新渠道客群单独建卡并复核额度策略;三个月后该渠道并入主卡时 PSI 回落至 0.12。反例若发生——PSI 稳定而 KS 持续下滑——则指向模型本身退化(如宏观经济使老规律失效),处置路径才是重训。这个对照说明:没有三件仪表的组合读数,处置决策无从谈起。

常见误区

  • 误区一:类别不平衡时看准确率。 违约率 3% 时"全预测不违约"准确率 97% 但毫无价值;必须使用 AUC/KS/Lift 等排序类指标与业务成本矩阵。
  • 误区二:KS 越高业务越好。 KS 只说明统计上分得开;分数线设置、通过率与利润目标由业务决定,统计最优切点不等于业务最优阈值。
  • 误区三:AUC 是跨模型跨数据集的可比指标。 AUC 依赖样本定义(好坏定义、观察期)与客群结构,不同项目间直接比大小没有意义。

自测题

  1. AUC 的概率解释是什么?它与固定阈值下的精确率有何关系?

答案要点:随机正样本排在负样本之前的概率;与阈值无关,而精确率依赖阈值,二者不可互替。

  1. PSI 如何计算?0.1/0.25 的经验含义是什么?

答案要点:逐箱占比差异的对数加权和;0.1 内稳定、0.1–0.25 关注、超 0.25 显著漂移须介入。

  1. "PSI 报警但 KS 正常"与"KS 报警但 PSI 正常"分别指向什么?处置有何不同?

答案要点:前者客群漂移(调策略/分卡),后者模型退化(重训/换模)。

与其他知识点的关系

kp-012 的评分卡是本指标体系的主要对象;kp-010 的因子衰减监控与本节监控思想同构;kp-026 把监控规定为模型风险管理的强制环节;kp-002 的非平稳性是 PSI 存在的根本原因。

延伸阅读

  • Fawcett(2006):"An Introduction to ROC Analysis"——ROC/AUC 的标准教程。
  • Siddiqi《Credit Risk Scorecards》——评分卡验证与监控的实务章节。