AI×金融知识站
–

kp-028 · 公平性、算法备案与伦理争议

前沿 模块:治理与伦理 预计 30 分钟 更新 2026-10-02

一句话定义

算法公平性研究"模型的错误如何在不同群体间分布",其核心结论是多种公平性度量在数学上不可兼得,叠加代理变量问题与算法备案义务,构成金融 AI 的伦理与合规基线——本知识点讲清定义群、不相容定理、审计方法与制度要求。

为什么重要

信贷、保险、投顾都是"模型决定谁获得资源"的场景,模型的系统性偏差会固化为对特定群体的结构性不利——这不是哲学议题而是可测量、可诉讼、可处罚的工程与合规问题。三条现实理由:其一,公平性度量存在数学上不可兼得的不相容定理,"公平"必须被翻译为具体指标取舍,这直接影响模型设计与验证;其二,敏感属性(性别、民族)可以从非敏感特征中代理还原,"删掉敏感字段"的合规话术在技术上不成立;其三,《互联网信息服务算法推荐管理规定》与《生成式人工智能服务管理暂行办法》已把算法备案与内容合规变成法定义务,金融场景叠加适当性义务后要求更严(kp-017)。

前置知识

kp-013(分类指标,公平性度量在其上扩展)、kp-026(治理框架的落位)。

直观类比

公平性像给不同体型的学生统一"及格线":统一切一刀(统计均等的问题——体力差异使同一线对不同群体难度不同),按群体分别定线(机会均等的思路——但"分别对待"本身可能构成歧视),要求"考分能预测真实能力且各组预测同样准"(校准的诉求)——三种诉求同时满足会撞数学墙(不相容定理)。代理变量则是"校服上没写名字,但校徽暴露了学校"——删掉名字栏挡不住推断。

核心概念

  • 公平性定义群:群体统计均等(statistical parity:各群体的正预测率相等)、机会均等(equal opportunity:真实正样本中各群体 TPR 相等)、校准(calibration:同分数下各群体实际违约率一致);另有反事实公平、个体公平等变体。
  • 不相容定理:当各群体基础率(真实正样本占比)不同时,校准与统计均等/机会均等不可同时满足(Kleinberg 等,2016;Chouldechova 同期独立证明)——选择哪个公平定义是价值权衡,不存在"全都要"的技术解。
  • 偏差来源:历史偏差(学习带歧视的历史即继承歧视)、标签偏差("坏客户"定义受执行偏差污染)、代表性不足(样本少的群体错误率分布不均)、测量偏差(特征对不同群体含义不同)。
  • 代理变量(proxy variable):邮政编码、消费场所类型、设备价格等非敏感特征与敏感属性高度相关,模型可借此间接歧视;"已删除敏感字段"不构成公平性证据。
  • 审计方法:分组指标审计(按敏感属性分组比较 TPR/FPR/通过率与误差)、代理变量检测(用特征集预测敏感属性,可高精度还原即代理风险高)、反事实测试(翻转敏感属性看决策是否改变——仅作探测,非因果证明)。
  • 制度要求(中国语境概览):算法备案、生态治理与不得设置歧视性偏好(算法推荐规定);训练数据合规、生成内容标识与防歧视义务(生成式 AI 管理办法);自动化决策透明度、拒绝权与不得不合理差别待遇(个人信息保护法);金融场景另叠加适当性与征信业务要求。
  • 伦理争议地图:算法歧视(发现难、追责难)、数字鸿沟(无数字痕迹人群被边缘化)、公平的价值多元(程序公平与结果公平的张力)、责任归属(机构、数据、模型、监管间的切分)。

原理与机制

不相容定理的机制直觉:校准要求"同分数同风险",统计均等要求"各群体通过率相同";当两群体基础率不同时,强行拉平通过率必使通过者中的真实违约率分化——校准被破坏;反之保持校准,通过率必然随基础率而分化。这不是工程缺陷而是概率结构,因此公平性工作从"找一个公平模型"转变为"显式声明选择哪种公平定义并承担其代价"。代理变量的机制:敏感属性的信息大量弥散在行为与地理特征中,删除敏感字段只切断直接通路,不切断信息通路——故审计必须检验"特征集对敏感属性的可还原度"。备案制度:把算法的用途、数据与防歧视措施提交监管存档,将事后争议前移为事前审查;备案材料(模型清单、公平性审计)恰是 kp-026 治理体系的自然产出。

公式或模型

统计均等: P(ŷ=1 | A=a) = P(ŷ=1 | A=a') 对所有群体 a
机会均等: P(ŷ=1 | Y=1, A=a) = P(ŷ=1 | Y=1, A=a') (TPR 相等)
校准: P(Y=1 | ŷ=s, A=a) = P(Y=1 | ŷ=s, A=a') 同分数同真实率
不相容: 基础率不同 ⇒ 校准 与 (统计均等/机会均等) 不可同时成立

图示

模型 → 分组审计: 各群体 TPR/FPR/通过率/误差
             │ 发现差异
代理检测: 用特征集预测敏感属性 → 可还原度高=代理风险
             │
决策: 声明采用的公平定义(取舍显式化)
      → 数据修复(重加权/代表性补充)
      → 阈值策略调整(有代价: 其他指标让步)
      → 持续监控(客群结构变化会改变公平性画像)
制度: 算法备案 · 生成式合规 · PIPL 自动化决策义务

实例或案例

一次信贷模型的公平性审计(教学化描述):验证团队按地区与年龄分组审计评分卡,发现某新一线城市客群通过率显著偏低且 TPR 并未改善;代理检测显示"手机号归属地+收货地址密度"组合可高精度还原户籍地,构成代理变量链。处置不是简单删特征(信息会转移到其余特征),而是:声明采用"校准优先"的公平定义、压缩该特征组合权重并论证业务必要性、在验证文档记录取舍代价、将审计纳入年度模型复审。案例说明公平性工作的现实形态:度量→取舍→留痕→周期性重审,而非一次性"修正完毕"。

常见误区

  • 误区一:删掉敏感字段就是公平。 代理变量使敏感信息可从非敏感特征还原;公平结论只能来自分组审计与代理检测,不能来自字段清单。
  • 误区二:存在"公平的模型"。 不相容定理表明公平定义之间互斥,任何模型都在某种公平观下有偏;诚实的做法是显式声明取舍并留痕,而非宣称中立。
  • 误区三:公平性是一次性验收项。 客群与数据分布的变化会持续改变公平性画像(kp-002 非平稳性的治理面);须纳入周期性审计。

自测题

  1. 三种核心公平性定义是什么?不相容定理说了什么?

答案要点:统计均等、机会均等、校准;基础率不同时校准与另两者不可同时满足,取舍必须显式。

  1. 代理变量为何使"删字段"失效?如何检测?

答案要点:敏感信息弥散于非敏感特征;用特征集预测敏感属性检验可还原度。

  1. 列出算法备案与生成式 AI 管理对金融场景的至少三条义务。

答案要点:算法备案、防歧视、训练数据合规、生成内容标识、自动化决策透明度与拒绝权。

公式或模型

见上节「公式或模型」:三种公平性定义与不相容关系。

与其他知识点的关系

kp-013 的混淆矩阵指标是分组审计的基础;kp-027 的解释链路是发现代理歧视的观察窗;kp-012/kp-017/kp-026 分别提供审计对象、适当性语境与治理框架。

延伸阅读

  • Kleinberg、Mullainathan、Raghavan(2016):"Inherent Trade-Offs in the Fair Determination of Risk Scores"——不相容定理原论文。
  • 《互联网信息服务算法推荐管理规定》《生成式人工智能服务管理暂行办法》:制度原文。