kp-028 · 公平性、算法备案与伦理争议
一句话定义
算法公平性研究"模型的错误如何在不同群体间分布",其核心结论是多种公平性度量在数学上不可兼得,叠加代理变量问题与算法备案义务,构成金融 AI 的伦理与合规基线——本知识点讲清定义群、不相容定理、审计方法与制度要求。
为什么重要
信贷、保险、投顾都是"模型决定谁获得资源"的场景,模型的系统性偏差会固化为对特定群体的结构性不利——这不是哲学议题而是可测量、可诉讼、可处罚的工程与合规问题。三条现实理由:其一,公平性度量存在数学上不可兼得的不相容定理,"公平"必须被翻译为具体指标取舍,这直接影响模型设计与验证;其二,敏感属性(性别、民族)可以从非敏感特征中代理还原,"删掉敏感字段"的合规话术在技术上不成立;其三,《互联网信息服务算法推荐管理规定》与《生成式人工智能服务管理暂行办法》已把算法备案与内容合规变成法定义务,金融场景叠加适当性义务后要求更严(kp-017)。
前置知识
kp-013(分类指标,公平性度量在其上扩展)、kp-026(治理框架的落位)。
直观类比
公平性像给不同体型的学生统一"及格线":统一切一刀(统计均等的问题——体力差异使同一线对不同群体难度不同),按群体分别定线(机会均等的思路——但"分别对待"本身可能构成歧视),要求"考分能预测真实能力且各组预测同样准"(校准的诉求)——三种诉求同时满足会撞数学墙(不相容定理)。代理变量则是"校服上没写名字,但校徽暴露了学校"——删掉名字栏挡不住推断。
核心概念
- 公平性定义群:群体统计均等(statistical parity:各群体的正预测率相等)、机会均等(equal opportunity:真实正样本中各群体 TPR 相等)、校准(calibration:同分数下各群体实际违约率一致);另有反事实公平、个体公平等变体。
- 不相容定理:当各群体基础率(真实正样本占比)不同时,校准与统计均等/机会均等不可同时满足(Kleinberg 等,2016;Chouldechova 同期独立证明)——选择哪个公平定义是价值权衡,不存在"全都要"的技术解。
- 偏差来源:历史偏差(学习带歧视的历史即继承歧视)、标签偏差("坏客户"定义受执行偏差污染)、代表性不足(样本少的群体错误率分布不均)、测量偏差(特征对不同群体含义不同)。
- 代理变量(proxy variable):邮政编码、消费场所类型、设备价格等非敏感特征与敏感属性高度相关,模型可借此间接歧视;"已删除敏感字段"不构成公平性证据。
- 审计方法:分组指标审计(按敏感属性分组比较 TPR/FPR/通过率与误差)、代理变量检测(用特征集预测敏感属性,可高精度还原即代理风险高)、反事实测试(翻转敏感属性看决策是否改变——仅作探测,非因果证明)。
- 制度要求(中国语境概览):算法备案、生态治理与不得设置歧视性偏好(算法推荐规定);训练数据合规、生成内容标识与防歧视义务(生成式 AI 管理办法);自动化决策透明度、拒绝权与不得不合理差别待遇(个人信息保护法);金融场景另叠加适当性与征信业务要求。
- 伦理争议地图:算法歧视(发现难、追责难)、数字鸿沟(无数字痕迹人群被边缘化)、公平的价值多元(程序公平与结果公平的张力)、责任归属(机构、数据、模型、监管间的切分)。
原理与机制
不相容定理的机制直觉:校准要求"同分数同风险",统计均等要求"各群体通过率相同";当两群体基础率不同时,强行拉平通过率必使通过者中的真实违约率分化——校准被破坏;反之保持校准,通过率必然随基础率而分化。这不是工程缺陷而是概率结构,因此公平性工作从"找一个公平模型"转变为"显式声明选择哪种公平定义并承担其代价"。代理变量的机制:敏感属性的信息大量弥散在行为与地理特征中,删除敏感字段只切断直接通路,不切断信息通路——故审计必须检验"特征集对敏感属性的可还原度"。备案制度:把算法的用途、数据与防歧视措施提交监管存档,将事后争议前移为事前审查;备案材料(模型清单、公平性审计)恰是 kp-026 治理体系的自然产出。
公式或模型
图示
模型 → 分组审计: 各群体 TPR/FPR/通过率/误差
│ 发现差异
代理检测: 用特征集预测敏感属性 → 可还原度高=代理风险
│
决策: 声明采用的公平定义(取舍显式化)
→ 数据修复(重加权/代表性补充)
→ 阈值策略调整(有代价: 其他指标让步)
→ 持续监控(客群结构变化会改变公平性画像)
制度: 算法备案 · 生成式合规 · PIPL 自动化决策义务
实例或案例
一次信贷模型的公平性审计(教学化描述):验证团队按地区与年龄分组审计评分卡,发现某新一线城市客群通过率显著偏低且 TPR 并未改善;代理检测显示"手机号归属地+收货地址密度"组合可高精度还原户籍地,构成代理变量链。处置不是简单删特征(信息会转移到其余特征),而是:声明采用"校准优先"的公平定义、压缩该特征组合权重并论证业务必要性、在验证文档记录取舍代价、将审计纳入年度模型复审。案例说明公平性工作的现实形态:度量→取舍→留痕→周期性重审,而非一次性"修正完毕"。
常见误区
- 误区一:删掉敏感字段就是公平。 代理变量使敏感信息可从非敏感特征还原;公平结论只能来自分组审计与代理检测,不能来自字段清单。
- 误区二:存在"公平的模型"。 不相容定理表明公平定义之间互斥,任何模型都在某种公平观下有偏;诚实的做法是显式声明取舍并留痕,而非宣称中立。
- 误区三:公平性是一次性验收项。 客群与数据分布的变化会持续改变公平性画像(kp-002 非平稳性的治理面);须纳入周期性审计。
自测题
- 三种核心公平性定义是什么?不相容定理说了什么?
答案要点:统计均等、机会均等、校准;基础率不同时校准与另两者不可同时满足,取舍必须显式。
- 代理变量为何使"删字段"失效?如何检测?
答案要点:敏感信息弥散于非敏感特征;用特征集预测敏感属性检验可还原度。
- 列出算法备案与生成式 AI 管理对金融场景的至少三条义务。
答案要点:算法备案、防歧视、训练数据合规、生成内容标识、自动化决策透明度与拒绝权。
公式或模型
见上节「公式或模型」:三种公平性定义与不相容关系。
与其他知识点的关系
kp-013 的混淆矩阵指标是分组审计的基础;kp-027 的解释链路是发现代理歧视的观察窗;kp-012/kp-017/kp-026 分别提供审计对象、适当性语境与治理框架。
延伸阅读
- Kleinberg、Mullainathan、Raghavan(2016):"Inherent Trade-Offs in the Fair Determination of Risk Scores"——不相容定理原论文。
- 《互联网信息服务算法推荐管理规定》《生成式人工智能服务管理暂行办法》:制度原文。