AI×金融知识站
–

kp-022 · 提示工程与结构化输出在金融文本任务

进阶 模块:大模型落地 预计 25 分钟 更新 2026-10-02

一句话定义

提示工程在金融场景的要义不是"写咒语",而是把业务任务转化为"角色+任务+约束+输出模式+少样本"的可测试规格,并用结构化输出(JSON Schema/函数调用)把模型回答变成机器可校验的数据——本知识点以可执行的操作步骤与排错清单组织。

为什么重要

金融文本任务(抽取、分类、摘要、改写)占大模型落地需求的大头,而它们的工程化程度远低于外表:很多团队"提示词调到看起来对"就上线,结果模型或提示词一升级质量静默退化,无法归因。掌握本知识点的方法——把提示当代码管理(版本、评测、回归)而不是当文案写——是从"演示可用"到"生产可用"的分水岭。结构化输出则是把模型接进业务系统的桥梁:下游系统需要的是带类型与约束的字段,不是一段自由文本。

前置知识

kp-021(RAG 语境,本知识点是生成层的工程化展开)。

直观类比

写提示像写验收标准明确的工单:角色是"指派给哪个岗位",任务是"做什么",约束是"红线与口径",输出模式是"交付物格式",少样本是"照这两个已完成的例子做"。而评测集是"质检抽样规则"——没有质检标准的工单,交付质量全凭运气。

核心概念

  • 提示五要素:角色(明确专业身份与视角)、任务(单一明确,复合任务拆步骤)、约束(口径、禁止项、不确定时的行为规范——如"材料未提及则输出 unknown")、输出模式(JSON Schema 字段定义或函数调用签名)、少样本示例(2–5 个覆盖边界情况的示例,含负面示例)。
  • 结构化输出:JSON Schema 约束字段与类型;函数调用(function calling)让模型声明"要调用哪个工具与参数";配套 schema 校验(类型、枚举、必填、数值范围)——校验失败触发重试或降级流程,绝不把未校验输出直通下游。
  • 字段级防御设计:枚举优先于自由文本("评级变动"用 up/down/unchanged 而非自由描述)、日期规范化(统一格式与口径)、数值与单位分离、缺失值显式(null 与"未提及"区分)。
  • 评测集:金标标注(50–200 条起步,覆盖正常/边界/对抗样本),自动指标(字段准确率、F1)+ 人工抽评;提示或模型每次变更必须跑回归。
  • 采样与确定性:温度(temperature)越低输出越稳定,抽取/分类任务用低温度;需要多样性的创作任务才用高温度——金融生产任务默认低温度。
  • 成本与批处理:批量离线任务用批处理接口与更小模型试探,线上交互才用旗舰模型;提示长度本身是成本(按 token 计费)。

原理与机制

为什么枚举与 Schema 能大幅提高可靠性:自由文本输出的正确性依赖模型"说得对",而 Schema 把可能性空间压缩到合法值域内,模型只需"选得对";校验器再把选择错误显式暴露(非法枚举、类型不符),错误从"静默混入"变为"显式失败可重试"。为什么少样本示例比长篇指令更有效:大模型本质是模式补全器,示例直接锚定输入-输出映射(in-context learning),尤其对边界情况(缺失值怎么标、歧义怎么处理),一个精准的负面示例胜过三行描述。为什么评测集是生命线:提示工程的所有改动(加约束、换示例、升级模型)都是"可能改善 A 环节、损害 B 环节"的双刃操作,只有固定金标上的回归对比才能判断净效果——这与软件测试同理,也呼应 kp-009 的可复现性纪律。

公式或模型

字段级准确率 = 抽对字段数 / 应抽字段数
JSON Schema 校验要点:
type(类型) · enum(枚举) · required(必填) ·
pattern(格式) · maximum/minimum(数值范围)
失败处理: 校验失败 → 最多 N 次重试(带错误信息) → 降级(人工/规则)

图示

任务规格: 角色+任务+约束+输出模式(JSON Schema)+少样本
        ↓ 调用(低温度)
模型输出 → Schema 校验器
        ├─ 通过 → 下游系统(业务表/事件库)
        └─ 失败 → 带错误重试(≤N 次) → 仍失败 → 降级人工
评测闭环: 金标集 → 字段准确率/F1 → 改提示 → 回归 → 上线

实例或案例

财报电话会议纪要的结构化任务(教学化描述):需求是从 60 页纪要提取"业绩指引"事件。第一版提示只说"提取业绩指引 JSON",上线后 20% 记录把"管理层预期"与"分析师提问中的数字"混淆。改造三步:约束层显式声明"仅取管理层陈述的数值,问答回应一律排除";Schema 用枚举字段 direction ∈ {up, down, maintain} 加上数值区间字段;附 3 个少样本示例,其中一个是"分析师提到增长 10% 但管理层未确认"的负面示例(应输出 no_guidance)。金标集(80 条)字段准确率从 0.74 升至 0.95;此后每次更换模型版本都重跑金标集,一次升级中发现方向字段准确率下降 6 个点,及时回退。整个流程演示了"规格化+校验+回归"三件套如何把提示从玄学变成工程。

常见误区

  • 误区一:提示词一次调好,永久可用。 模型版本、上游检索、业务口径都会变;没有评测集守护的提示词是随时会静默坏掉的黑盒。
  • 误区二:JSON 模式=不会出错。 合法 JSON 不等于内容正确:枚举选错、数值抄错仍在;Schema 校验解决"格式",内容校验(如数值与原文比对)另需一层。
  • 误区三:提示越长越好、示例越多越好。 冗长指令相互稀释、过多示例引入噪声且推高成本;五要素齐、示例精、约束明确才是高信噪比提示。

自测题

  1. 提示五要素是什么?各自对应工单的哪部分?

答案要点:角色(岗位)、任务(做什么)、约束(红线口径)、输出模式(交付格式)、少样本(参考例子)。

  1. 为什么"合法 JSON"仍需要第二层内容校验?

答案要点:Schema 保证格式与值域,不保证内容事实正确;数值/日期需与原文比对,枚举选择需业务规则复核。

  1. 评测集如何防止提示工程退化?

答案要点:固定金标上做回归对比,任何改动(提示/模型/检索)先过评测再上线,退化可见可归因。

公式或模型

见上节「公式或模型」:字段准确率与 Schema 校验要素。

与其他知识点的关系

kp-021 为本任务的检索层前置;kp-005/kp-006 是本方法学的两个典型应用域;kp-024 的红线清单决定约束层写什么(禁投顾、禁预测);kp-009 的可复现性要求提示词版本化管理。

延伸阅读

  • Brown et al.(2020):"Language Models are Few-Shot Learners"——上下文学习的奠基论文。
  • Wei et al.(2022):"Chain-of-Thought Prompting"——推理链提示的代表作。