kp-019 · KYC 与身份核验:OCR、活体检测与尽调分级
一句话定义
KYC(Know Your Customer)的身份核验层用"证件 OCR → 活体检测 → 人脸比对 → 权威数据源核验 → 受益所有人穿透 → 风险分级尽调"的链路,把"客户是谁"变成可审计的事实,本知识点拆解这条链路的技术与流程要点。
为什么重要
身份是所有金融义务的锚点:反洗钱的责任主体、适当性的匹配对象、账户安全的边界都以"确认了你是谁"为前提。核验环节的失败形态极其具体——翻拍屏 photograph、面具与硅胶头模、AI 换脸深度伪造(deepfake)——攻击手段与防御技术在持续对抗。同时,核验是个人信息处理的高敏感区(人脸属敏感个人信息,处理须单独同意与严格最小化),技术方案必须与合规设计同步。对从业者,掌握这条链路等于掌握"生物识别+文档智能+合规分级"三合一的完整工程样本。
前置知识
kp-018(CDD 与 AML 框架,本知识点是其身份层的展开)。
直观类比
核验链路像机场的三道关卡:OCR 是"读懂护照信息页"(机器读证件),活体检测是"确认镜头前是真人本人在场"(防照片与录像),人脸比对是"把镜头前的脸与证件照核对"(1:1);出境前的"黑名单比对"是 1:N 排查;而"商务旅客/普通旅客"的差异化安检流程就是尽调分级——风险越高,检查越细。
核心概念
- 证件 OCR:版式识别(判断证件类型与区域)+ 字段识别(姓名、证件号、有效期)+ 真伪要素( chips、水印、字体规范的启发式检查);输出结构化信息并留存影像。
- 活体检测(liveness detection):动作配合(眨眼、转头)、炫彩/随机光反光检测(防屏幕翻拍)、3D 结构光(硬件级防平面攻击);对抗目标是照片、屏幕翻拍、面具、视频注入与深度伪造。
- 人脸比对:1:1(镜头脸 vs 证件照,核验本人)与 1:N(镜头脸 vs 黑名单库,排查在逃/冒用);输出相似度分数,阈值由业务按误识率(FAR)/拒真率(FRR)权衡设定。
- 权威数据源核验:姓名+证件号对接公安实名库、企业对接工商登记、银行卡四要素/三要素核验——把"影像证据"升级为"官方事实"。
- 受益所有人(UBO):对公客户穿透股权与控制权链,识别最终自然人受益人(常见口径:持股 25% 以上或实际控制人);受益所有人不明时识别"负责日常管理的人员"。
- 尽调分级:低风险(简化 CDD)、中风险(标准 CDD)、高风险(加强 EDD:资金来源与用途说明、高层审批、缩短复核周期);分级触发持续尽调的频率差异。
- 合规要点:人脸属敏感个人信息——单独同意、最小化存储(优先存特征值而非原图)、留痕与审计;跨境传输受数据出境规则约束。
原理与机制
为什么需要"多因子链路"而非单点技术:OCR 能被高仿证件欺骗、活体能被深度伪造攻击、比对能被换脸绕过——单点无解,但各环节的攻击成本不同,串联后攻击者需同时伪造证件、动态人脸与官方数据一致性,攻击成本指数级上升;这正是纵深防御(defense in depth)思想。阈值设定的机制:人脸比对阈值越高误识率(把别人认成本人)越低但拒真率(本人认不出)越高;金融开户场景通常选低 FAR 以防冒名,辅以人工复核兜底 FRR 损失——阈值是风险偏好决策,非纯技术参数。尽调分级的机制:核验成本与风险成正比才可持续,把 EDD 集中投放在高风险客群(PEPs、高风险行业、复杂股权结构),低风险客群走简化流程——分级是资源分配框架,也是监管检查的问责框架。
图示
证件拍摄 ─▶ 版式识别+OCR ─▶ 影像与字段留存
▼
活体检测(动作/炫彩/3D) ─▶ 防: 翻拍·面具·深度伪造
▼
人脸 1:1 比对(证件照) + 1:N 黑名单比对
▼
权威源核验: 公安实名 / 工商登记 / 银行卡要素
▼
对公: UBO 穿透(股权/控制链 ≥25% 或实际控制)
▼
风险分级: 低→简化 / 中→标准 / 高→EDD(审批+缩短复核)
▼
持续尽调: 触发式更新(信息变更/名单命中/交易异常)
实例或案例
一次远程开户的完整链路(教学化描述):客户上传身份证,OCR 三秒返回结构化字段并检出证件在有效期内;活体环节随机指令"向左转头+眨眼",炫彩光检测通过(排除屏幕翻拍);1:1 比对相似度 0.87 高于阈值,1:N 黑名单无命中;系统将姓名+证件号送公安实名接口核验一致;客户为企业经办人时另行走 UBO 穿透,识别出持股 60% 的自然人受益人。风险标签判定"标准级"完成开户;若命中 PEPs 标签则自动升级 EDD,要求资金来源说明并由合规岗审批。全流程每一步留痕:影像哈希、接口返回原文、阈值版本——事后审计可完整回放"当时凭什么通过"。
常见误区
- 误区一:OCR 识别率高=核验可靠。 OCR 只解决"读出来",不解决"是不是真的、是不是本人";完整可信来自链路纵深而非单点准确率。
- 误区二:一次核验终身有效。 客户信息会过期、名单会更新、风险会变化;持续尽调(触发式更新+定期复核)是 KYC 的义务组成,不是增值服务。
- 误区三:人脸数据存原图便于复查。 敏感个人信息应最小化——优先存储特征值与哈希,原图按最短期限留存;"留全了方便"在合规上恰好相反。
自测题
- 核验链路为什么必须纵深串联?单点技术各自的攻击面是什么?
答案要点:OCR 防不了高仿证件、活体防不了深度伪造、比对防不了注入;串联使攻击成本指数上升。
- 人脸比对阈值如何权衡?为什么说它是业务决策?
答案要点:FAR 与 FRR 此消彼长;开户场景选低误识并人工兜底拒真,阈值反映机构风险偏好。
- 尽调分级如何分配资源?EDD 通常包含什么?
答案要点:风险越高检查越重;EDD 含资金来源说明、高层审批、更短复核周期与更高监控频率。
公式或模型
本节不适用:人脸比对与活体检测的模型内部(损失函数、网络结构)不在本库范围;工程层面需要掌握的是 FAR/FRR 权衡与链路防御思想。
与其他知识点的关系
kp-018 把本知识点作为 CDD 支柱的输入;kp-017 的 KYC 风险画像是"了解客户"的软信息层(与本节的事实层互补);kp-028 的个人信息与算法治理约束适用于生物识别数据的处理。
延伸阅读
- 《个人信息保护法》(中国,2021):敏感个人信息处理的合规基线。
- NIST Face Recognition Vendor Test 系列报告:人脸识别性能评测的公开基准。