AI×金融知识站
–

kp-026 · 模型风险管理:SR 11-7 与三道防线

进阶 模块:治理与伦理 预计 28 分钟 更新 2026-10-02

一句话定义

模型风险管理(Model Risk Management,MRM)是对"模型可能出错及模型被用错"所造成损失的系统化管理,以美联储 SR 11-7 为代表性框架、以三道防线为组织落点,覆盖模型全生命周期——本知识点讲清这套框架的构成与它为何同样适用于大模型时代。

为什么重要

金融机构的决策越来越多地由模型驱动(评分、定价、风险计量、反欺诈、大模型辅助产出),模型错误的后果从利润损失到监管处罚乃至系统性风险——2012 年某国际银行的风险价值模型缺陷造成数十亿美元损失并引发监管处罚,是 MRM 教科书级案例。SR 11-7(2011 年美联储与 OCC 联合发布)把模型风险管理从"技术自查"提升为治理制度:任何影响决策的量化方法都要走"开发—验证—使用—监控—退役"的受控生命周期。对 AI+金融从业者,SR 11-7 是与监管、内审对话的共同语言,也是大模型应用能否通过内控评审的标尺。

前置知识

kp-013(模型监控指标,是生命周期"监控"环节的工具)。kp-004 帮助理解三道防线的组织位置。

直观类比

模型风险管理像航空业对飞行员与飞机的管理制度:开发是飞机制造(要有设计文档与测试记录),独立验证是适航审定(由没有利益关系的第三方挑战设计),使用是飞行手册(什么条件下能飞、谁来签放行),监控是黑匣子与定检(持续记录、定期检修),退役是机型退出(有完整交接与归档)。三道防线则是机组、航司安全部门与民航局的关系——操作者不能自审自证。

核心概念

  • 模型的 SR 11-7 定义:应用统计、数学、数值技术对输入数据进行处理,产出估计或预测的量化方法——宽定义:从简单的规则组合、评分卡到机器学习与(如今的大模型应用)都可落入,"是不是 AI"不影响"是不是模型"的判定。
  • 模型风险的两种来源:模型错误(design error——假设、数据、实现有缺陷导致输出错误)与使用错误(use error——把模型用在不适用的场景、超出验证范围使用、忽视假设失效)。
  • 全生命周期环节:开发(文档化:目的、数据、假设、局限性)→ 独立验证(effective challenge 有效挑战:概念合理性、数据质量、结果分析、基准对比)→ 使用审批(限定适用域与条件)→ 持续监控(稳定性与区分度,kp-013)→ 变更管理与退役。每个环节产出正式文档。
  • 有效挑战(effective challenge):验证须由独立于开发团队的第三方执行,且有权否决;核心是挑战而非复算——"如果假设错了会怎样""为什么不用更简单的方法""局限性是否被夸大掩盖"。
  • 三道防线:第一道业务与开发条线(模型的拥有者,负责开发、使用与日常监控)、第二道风险与合规条线(独立验证、限额、政策)、第三道内部审计(对一二道防线的再监督)。模型清单(model inventory)贯穿三道防线。
  • 风险分级:按重要性与复杂度给模型定级,验证深度与频率随级别递增——治理资源有限,分级是资源分配框架。
  • 对大模型的适用:LLM 应用(RAG、Agent)按宽定义落入模型范畴;验证内容扩展为幻觉评测、红线测试、权限与留痕审查(kp-023、kp-024 的工程产出即验证证据)。

原理与机制

为什么验证必须独立:开发者存在"自证倾向"(选择有利于自己模型的样本与口径),独立第三方以挑战姿态复查才能暴露盲区——这与审计独立性、代码评审的原理同源。为什么全生命周期而非一次性验证:模型风险随环境漂移持续产生(kp-002 的非平稳),上线时的验证只能证明"当时可用",持续监控与定期再验证才覆盖"一直可用";使用错误(场景漂移)更是只有全流程治理才能拦截。为什么大模型也要进 MRM:SR 11-7 的宽定义+用途判定使大模型应用不可豁免;且大模型放大了两类模型风险——事实性错误以流畅语言呈现(发现更难)、第三方基座模型引入供应商风险(基座升级即变更,需变更管理流程)。MRM 框架对大模型不是约束障碍,而是把散乱的工程规范(评测、留痕、红线)收编为可审计制度的组织工具。

图示

第一道防线(业务/开发): 开发·文档·使用·日常监控
        │ 提交验证
第二道防线(风险/合规): 独立验证[有效挑战]
        · 概念合理性 · 数据质量 · 结果分析 · 基准对比
        · 通过 → 使用审批(限定适用域) · 否决 → 回退
第三道防线(内审): 对一二道防线的再监督
贯穿: 模型清单(_inventory_) · 风险分级 · 全生命周期文档
生命周期: 开发 → 验证 → 审批使用 → 持续监控 → 变更/退役

实例或案例

一张评分卡从开发到退役的文档链(教学化描述):开发团队提交开发文档(样本定义、WOE 分箱、系数、局限性声明);独立验证团队复核后发现两个问题——某特征的 IV 异常高,溯源确认使用了事后修正的征信字段(前视偏差),以及观察期与产品实际审批周期不符;打回修正后重新验证通过,审批限定"适用该产品线客群、12 个月后强制再验证";上线后监控面板每季出报告(PSI/KS),第 10 个月 PSI 触发阈值,走变更流程重训并重新验证;产品下线时模型退役归档,从清单移除。这条链上的每一步都是 SR 11-7 语境下的标准动作,也是监管检查的直接抽查对象。

常见误区

  • 误区一:验证=跑一遍指标。 验证的核心是独立挑战(假设、数据、适用域、局限),复算指标只是起点;"指标都对"不能回答"假设是否成立"。
  • 误区二:小模型、内部工具不用进管理。 SR 11-7 的宽定义使评分规则、Excel 模型、大模型应用都可能落入;是否管理看用途(是否影响决策),不看技术含量。
  • 误区三:上了线就万事大吉。 模型风险随环境漂移持续累积;没有持续监控与再验证安排的模型,风险敞口随时间单调上升。

自测题

  1. SR 11-7 如何定义"模型"?这一定义为何覆盖大模型应用?

答案要点:对输入数据应用量化方法产出估计/预测即模型;宽定义按用途判定,LLM 应用影响决策即落入。

  1. 模型风险的两种来源是什么?各举一例。

答案要点:模型错误(如用了前视特征)与使用错误(如把 A 客群模型用于 B 客群)。

  1. 三道防线各自的模型管理职责是什么?

答案要点:一道开发使用监控、二道独立验证与限额政策、三道再监督;模型清单贯穿。

公式或模型

本节不适用:MRM 是治理框架而非计量模型;其依赖的监控指标(AUC/KS/PSI)定义见 kp-013。

与其他知识点的关系

kp-013 提供监控环节的仪表;kp-015 的 VaR 模型是 MRM 历史上的标志性治理对象;kp-020 的报送留痕与 kp-023/kp-024 的工程规范是大模型时代的验证证据来源;kp-004 的三台组织结构是三道防线的落位地图。

延伸阅读

  • 美联储 SR 11-7 / OCC 2011-12《模型风险管理监管指引》:框架原文(英文),业内通行译本可参考。
  • 各上市银行年报"风险管理与内控"章节:MRM 制度在中文语境的落地形态。