kp-024 · 幻觉与合规红线:金融场景的防护设计
一句话定义
幻觉(hallucination)是模型生成与事实或输入依据不符内容的现象,金融场景叠加高错误成本与监管义务,必须以"分层防护(检索约束、数值外置、输出校验、拒答策略)+红线清单+审计留痕"系统性应对——本知识点给出完整的防护架构。
为什么重要
幻觉在一般场景是产品缺陷,在金融场景是合规事件:一段编造的营收数字进入研报是研究事故,一条虚构的政策条款出现在客服回复是投诉与处罚隐患,一次越界的"建议买入"直接踩适当性红线。更隐蔽的是,大模型幻觉以高置信度的流畅语言呈现,非专业读者与疲惫的审核者都难以察觉——这决定了防护不能依赖"人眼把关",必须工程化。本知识点是模块 06 的收束点:前三个知识点(RAG、提示、Agent)的每个设计选择,最终都要回答"幻觉与合规风险被压到了哪里"。
前置知识
kp-021(RAG 语境)。kp-016/kp-023 帮助理解幻觉的爆发场景。
直观类比
幻觉像一位口才极佳却爱即兴发挥的实习生:不能指望"提醒他别编"就解决问题,而要改造环境——只给他盖章过的文件(检索约束)、算数一律用计算器(数值外置)、交稿前逐条核对出处(输出校验)、没有依据时明确说"我不掌握"(拒答策略)、以及明确他永远不能替你签字(红线边界)。
核心概念
- 幻觉类型学:事实幻觉(编造不存在的条款/数字/事件)、输入冲突幻觉(与所给材料矛盾,如摘要改写原文数值)、指令幻觉(无视约束与格式)、引用幻觉(给出看似存在的出处)——金融场景数值幻觉与输入冲突幻觉危害最直接。
- 诱因机制:采样随机性(高温度)、知识截止(训练后的新信息)、检索污染(噪声上下文)、训练数据中的错误模式被"流畅地"复现。
- 分层防护:①检索层——RAG 约束答案域、材料质量治理(kp-021);②计算层——数值计算与指标计算外置为工具(模型只传递参数不心算,kp-023);③生成层——提示约束(引用义务、"材料未提及则回答未掌握")+低温度;④校验层——Schema 校验(kp-022)、数值溯源比对(答案中每个数字须在检索材料中存在)、引用存在性检查;⑤拒答与兜底——明确不可答清单与转人工路径。
- 金融红线清单:不荐股、不预测个股价格与点位、不承诺收益、不代客决策、不输出规避监管的指引、涉交易内容必须标注"仅供学习研究"、免责声明不豁免实质合规义务。
- 评测与红队:幻觉率基准(金标集上统计事实错误比例)、对抗测试(诱导性提问、材料冲突、越权请求)、线上抽检(对客回复按比例人工复核)。
- 审计留痕:问题、检索材料版本、模型与提示版本、输出与校验结果全量留存——事后可回答"当时为什么这么答"。
原理与机制
为什么"检索增强"压不住全部幻觉:RAG 只约束了材料的域,不保证生成忠实于材料——模型仍会混淆、省略、改写数字,或用训练知识"补充"材料没有的内容(输入冲突幻觉尤其隐蔽);因此 RAG 之上必须叠校验层,把"说没说对"变成可机判的检查。为什么数值必须外置计算:大模型按 token 生成数字,本质是"猜测最像答案的数字序列",乘除运算错误率随位数上升——把算术交给确定性工具、模型只负责理解与组织语言,把不可靠组件从计算链路中移除。为什么拒答是能力而非缺陷:金融场景"不知道"的正确成本远低于"编一个"——把拒答路径(材料不足即回答未掌握+转人工/转检索)设计为默认行为,是可靠性优先于覆盖率的架构选择。为什么免责声明不能兜底:监管判断"是否构成投资建议"看实质行为而非免责文字,红线清单约束的是系统行为边界,免责声明只是最后的告知义务。
图示
问题 → 检索层: RAG 约束答案域 + 材料质量门
→ 生成层: 提示约束(引用义务/未提及即拒答) + 低温度
→ 计算外置: 数值/指标调用确定性工具
→ 校验层: Schema ✓ · 数值溯源比对 ✓ · 引用存在性 ✓
├ 通过 → 输出(附引用)
└ 失败 → 重试/降级 → 拒答("未掌握") + 转人工
红线: 不荐股 · 不预测价格 · 不承诺收益 · 不代客决策
留痕: 问题+材料版本+模型/提示版本+校验结果 全量归档
实例或案例
一次幻觉事故的解剖与修复(教学化描述):某投研助手在摘要中写出"该公司 2025 年营收预计增长 27.4%",但检索材料中只有"市场人士预计增长超两成"的表述——模型把模糊表述精确化并补造了小数。修复四层:生成约束改为"预测类数字只能逐字引用材料且标注区间性质";校验层增加数值溯源比对(答案数字须在材料中逐字出现,否则拦截);该类问题进入金标集的对抗子集;线上对"预测"类意图的回复全部附材料原文引用。修复后同类错误在金标集上归零,代价是拒答率上升 4%——这正是金融场景可接受的交换:用覆盖率换确定性。
常见误区
- 误区一:换更大的模型幻觉就消失。 模型升级降低幻觉率但不归零,且幻觉形态会变化;防护必须以工程层(校验、拒答、留痕)独立于模型存在——换模型时防护不重建。
- 误区二:加了免责声明就合规。 合规看实质行为边界(红线清单是否硬编码进系统),免责声明只是告知,不能把越界行为洗成合规。
- 误区三:幻觉可以靠人工审核兜底。 流畅幻觉的识别依赖领域专业知识,人工审核对数值级错误的命中率有限且成本高;正确结构是"机器校验拦绝大多数+人工抽验高杠杆环节"。
自测题
- 幻觉四类型中,哪两类对金融场景危害最直接?为什么?
答案要点:数值幻觉(直接误导决策与披露)与输入冲突幻觉(改写原文数字,最隐蔽难查)。
- 为什么数值计算必须外置为工具?
答案要点:模型生成数字本质是序列猜测,误差随位数上升;外置把计算从概率链路移入确定性链路。
- 写出金融大模型应用至少五条红线。
答案要点:不荐股、不预测个股价格、不承诺收益、不代客决策、不输出规避监管指引、涉交易内容标注仅供学习研究。
公式或模型
本节不适用:幻觉度量(忠实性比例、幻觉率)的评测构造已在 kp-021、kp-022 定义;本知识点聚焦防护架构而非统计定义。
与其他知识点的关系
kp-021 的检索约束与 kp-022 的 Schema 校验是本体系的第一、四层;kp-016 与 kp-023 的闸门设计是红线在业务场景的落点;kp-009 的证据链复核是流程级的最后防线;本知识点与 kp-026 共同构成"技术防护+治理框架"的闭环。
延伸阅读
- Ji et al.(2023):"Survey of Hallucination in Natural Language Generation"——幻觉分类与度量的系统综述。
- 《生成式人工智能服务管理暂行办法》(中国,2023):生成内容标识与合规义务的制度背景。